Codebook-Verlustfreie LLM-Kompression: 10–25 % RAM-Reduzierung durch Bitweise Packung

Ein Entwickler hat einen Proof-of-Concept-Code für verlustfreie LLM-Kompression veröffentlicht, der durch bitweises generisches Packen indizierter Gewichte den Speicherverbrauch um 10-25% reduziert. Die Technik tauscht etwas Inferenzgeschwindigkeit gegen eine kleinere Modellgröße, wodurch größere Modelle auf Hardware mit begrenztem VRAM ausgeführt werden können.
Wie es funktioniert
Der Entwickler begann damit, zu fragen, wie viele eindeutige Werte tatsächlich in LLM-Schichten existieren. Die Analyse ergab, dass während fp16 16 Bits verwendet, die meisten Modelle nur etwa 12-13 Bits an eindeutigen Werten nutzen. Durch das Packen dieser Werte in Blöcke erreicht die Technik Kompression ohne Genauigkeitsverlust.
Leistungsmerkmale
- RAM-Reduzierung: 10-25%+ über getestete Modelle
- Geschwindigkeitsauswirkung: Inferenzgeschwindigkeit in Beispieltests etwa halbiert
- Testhardware: NVIDIA P2200 (5GB) und CPU, mit Entwicklungsupdates für AMD MI50 (32GB)
Implementierungsdetails
Der Entwickler arbeitete mehrere Wochen an diesem Projekt unter Verwendung von KI-Codierungsassistenten, darunter Claude, Qwen und Gemini. Das Repository enthält sowohl verlustfreie als auch verlustbehaftete/ausgeglichene Versionen, wobei die verlustbehaftete Version noch nicht umfassend getestet wurde.
Der Entwickler schlägt vor, dass dieser Kompressionsansatz als Möglichkeit dienen könnte, die "Kompaktheit" eines Modells zu messen – wie effizient es seinen Parameterraum nutzt.
Code-Verfügbarkeit
Der Proof-of-Concept-Code ist auf GitHub verfügbar: https://github.com/bigattichouse/Codebook-Quantization
📖 Read the full source: r/LocalLLaMA
👀 Siehe auch

Jean-Claude: Ein satirisches LLM-Frontend, das die EU-KI-Regulierung verspottet, mit 412 Cookie-Partnern und Mehrwertsteuer-Rechnungen alle 5 Nachrichten
Jean-Claude ist ein satirisches LLM-Frontend, das EU-Bürokratie bis zum Äußersten treibt: 412 Cookie-Partner, Vier-Augen-Prinzip mit Mitzeichnungspflicht, CO₂-Tracking pro Token mit verbindlicher €-Kompensation, Umsatzsteuerrechnung alle 5 Nachrichten und ein Compliance-Center mit fiktiven DSGVO/AI-Act-Kennzahlen.

Code-Evolution-Methode verdreifacht die Leistung von LLM im ARC-AGI-2-Benchmark
Forscher erzielten eine 2,8-fache Verbesserung auf dem ARC-AGI-2-Benchmark durch Code-Evolution mit Open-Weight-Modellen und erreichten 34 % Genauigkeit bei 2,67 US-Dollar pro Aufgabe. Dieselbe Methode brachte Gemini 3.1 Pro auf 95 % Genauigkeit bei 8,71 US-Dollar pro Aufgabe.

Godogen: Claude Code Skills für die komplette Godot-Spielerstellung
Godogen ist eine Open-Source-Pipeline, die Claude Code-Fähigkeiten nutzt, um vollständige, spielbare Godot-4-Projekte aus Textaufforderungen zu generieren. Sie übernimmt Architekturdesign, 2D/3D-Asset-Generierung, GDScript-Programmierung und visuelle QA-Tests und adressiert spezifische Engpässe wie die Knappheit von GDScript-Trainingsdaten sowie Probleme mit Build-Time- vs. Runtime-Zuständen.

ZSE: Open-Source-LLM-Inferenz-Engine mit 3,9-Sekunden-Kaltstarts
ZSE ist eine Open-Source-Inferenz-Engine für LLMs, die den Speicherbedarf für 32B-Modelle von 64GB auf 19,3GB VRAM reduziert und mit einem vorquantisierten .zse-Format und speichergemappten Gewichten Kaltstarts von 3,9 Sekunden für 7B-Modelle erreicht.