Codebook-Verlustfreie LLM-Kompression: 10–25 % RAM-Reduzierung durch Bitweise Packung

✍️ OpenClawRadar📅 Veröffentlicht: 15. März 2026🔗 Source
Codebook-Verlustfreie LLM-Kompression: 10–25 % RAM-Reduzierung durch Bitweise Packung
Ad

Ein Entwickler hat einen Proof-of-Concept-Code für verlustfreie LLM-Kompression veröffentlicht, der durch bitweises generisches Packen indizierter Gewichte den Speicherverbrauch um 10-25% reduziert. Die Technik tauscht etwas Inferenzgeschwindigkeit gegen eine kleinere Modellgröße, wodurch größere Modelle auf Hardware mit begrenztem VRAM ausgeführt werden können.

Wie es funktioniert

Der Entwickler begann damit, zu fragen, wie viele eindeutige Werte tatsächlich in LLM-Schichten existieren. Die Analyse ergab, dass während fp16 16 Bits verwendet, die meisten Modelle nur etwa 12-13 Bits an eindeutigen Werten nutzen. Durch das Packen dieser Werte in Blöcke erreicht die Technik Kompression ohne Genauigkeitsverlust.

Leistungsmerkmale

  • RAM-Reduzierung: 10-25%+ über getestete Modelle
  • Geschwindigkeitsauswirkung: Inferenzgeschwindigkeit in Beispieltests etwa halbiert
  • Testhardware: NVIDIA P2200 (5GB) und CPU, mit Entwicklungsupdates für AMD MI50 (32GB)
Ad

Implementierungsdetails

Der Entwickler arbeitete mehrere Wochen an diesem Projekt unter Verwendung von KI-Codierungsassistenten, darunter Claude, Qwen und Gemini. Das Repository enthält sowohl verlustfreie als auch verlustbehaftete/ausgeglichene Versionen, wobei die verlustbehaftete Version noch nicht umfassend getestet wurde.

Der Entwickler schlägt vor, dass dieser Kompressionsansatz als Möglichkeit dienen könnte, die "Kompaktheit" eines Modells zu messen – wie effizient es seinen Parameterraum nutzt.

Code-Verfügbarkeit

Der Proof-of-Concept-Code ist auf GitHub verfügbar: https://github.com/bigattichouse/Codebook-Quantization

📖 Read the full source: r/LocalLLaMA

Ad

👀 Siehe auch

Jean-Claude: Ein satirisches LLM-Frontend, das die EU-KI-Regulierung verspottet, mit 412 Cookie-Partnern und Mehrwertsteuer-Rechnungen alle 5 Nachrichten
Werkzeuge

Jean-Claude: Ein satirisches LLM-Frontend, das die EU-KI-Regulierung verspottet, mit 412 Cookie-Partnern und Mehrwertsteuer-Rechnungen alle 5 Nachrichten

Jean-Claude ist ein satirisches LLM-Frontend, das EU-Bürokratie bis zum Äußersten treibt: 412 Cookie-Partner, Vier-Augen-Prinzip mit Mitzeichnungspflicht, CO₂-Tracking pro Token mit verbindlicher €-Kompensation, Umsatzsteuerrechnung alle 5 Nachrichten und ein Compliance-Center mit fiktiven DSGVO/AI-Act-Kennzahlen.

OpenClawRadar
Code-Evolution-Methode verdreifacht die Leistung von LLM im ARC-AGI-2-Benchmark
Werkzeuge

Code-Evolution-Methode verdreifacht die Leistung von LLM im ARC-AGI-2-Benchmark

Forscher erzielten eine 2,8-fache Verbesserung auf dem ARC-AGI-2-Benchmark durch Code-Evolution mit Open-Weight-Modellen und erreichten 34 % Genauigkeit bei 2,67 US-Dollar pro Aufgabe. Dieselbe Methode brachte Gemini 3.1 Pro auf 95 % Genauigkeit bei 8,71 US-Dollar pro Aufgabe.

OpenClawRadar
Godogen: Claude Code Skills für die komplette Godot-Spielerstellung
Werkzeuge

Godogen: Claude Code Skills für die komplette Godot-Spielerstellung

Godogen ist eine Open-Source-Pipeline, die Claude Code-Fähigkeiten nutzt, um vollständige, spielbare Godot-4-Projekte aus Textaufforderungen zu generieren. Sie übernimmt Architekturdesign, 2D/3D-Asset-Generierung, GDScript-Programmierung und visuelle QA-Tests und adressiert spezifische Engpässe wie die Knappheit von GDScript-Trainingsdaten sowie Probleme mit Build-Time- vs. Runtime-Zuständen.

OpenClawRadar
ZSE: Open-Source-LLM-Inferenz-Engine mit 3,9-Sekunden-Kaltstarts
Werkzeuge

ZSE: Open-Source-LLM-Inferenz-Engine mit 3,9-Sekunden-Kaltstarts

ZSE ist eine Open-Source-Inferenz-Engine für LLMs, die den Speicherbedarf für 32B-Modelle von 64GB auf 19,3GB VRAM reduziert und mit einem vorquantisierten .zse-Format und speichergemappten Gewichten Kaltstarts von 3,9 Sekunden für 7B-Modelle erreicht.

OpenClawRadar