Codebook-Verlustfreie LLM-Kompression: 10–25 % RAM-Reduzierung durch Bitweise Packung

✍️ OpenClawRadar📅 Veröffentlicht: 15. März 2026🔗 Source
Codebook-Verlustfreie LLM-Kompression: 10–25 % RAM-Reduzierung durch Bitweise Packung
Ad

Ein Entwickler hat einen Proof-of-Concept-Code für verlustfreie LLM-Kompression veröffentlicht, der durch bitweises generisches Packen indizierter Gewichte den Speicherverbrauch um 10-25% reduziert. Die Technik tauscht etwas Inferenzgeschwindigkeit gegen eine kleinere Modellgröße, wodurch größere Modelle auf Hardware mit begrenztem VRAM ausgeführt werden können.

Wie es funktioniert

Der Entwickler begann damit, zu fragen, wie viele eindeutige Werte tatsächlich in LLM-Schichten existieren. Die Analyse ergab, dass während fp16 16 Bits verwendet, die meisten Modelle nur etwa 12-13 Bits an eindeutigen Werten nutzen. Durch das Packen dieser Werte in Blöcke erreicht die Technik Kompression ohne Genauigkeitsverlust.

Leistungsmerkmale

  • RAM-Reduzierung: 10-25%+ über getestete Modelle
  • Geschwindigkeitsauswirkung: Inferenzgeschwindigkeit in Beispieltests etwa halbiert
  • Testhardware: NVIDIA P2200 (5GB) und CPU, mit Entwicklungsupdates für AMD MI50 (32GB)
Ad

Implementierungsdetails

Der Entwickler arbeitete mehrere Wochen an diesem Projekt unter Verwendung von KI-Codierungsassistenten, darunter Claude, Qwen und Gemini. Das Repository enthält sowohl verlustfreie als auch verlustbehaftete/ausgeglichene Versionen, wobei die verlustbehaftete Version noch nicht umfassend getestet wurde.

Der Entwickler schlägt vor, dass dieser Kompressionsansatz als Möglichkeit dienen könnte, die "Kompaktheit" eines Modells zu messen – wie effizient es seinen Parameterraum nutzt.

Code-Verfügbarkeit

Der Proof-of-Concept-Code ist auf GitHub verfügbar: https://github.com/bigattichouse/Codebook-Quantization

📖 Read the full source: r/LocalLLaMA

Ad

👀 Siehe auch

Chromeflow: Chrome-Erweiterung automatisiert Web-UI-Aufgaben für Claude
Werkzeuge

Chromeflow: Chrome-Erweiterung automatisiert Web-UI-Aufgaben für Claude

Chromeflow ist eine kostenlose, quelloffene Chrome-Erweiterung und MCP-Server, die mit Claude Code erstellt wurde und Claude Browsersteuerung gibt, um manuelle Web-UI-Aufgaben wie die Einrichtung von Stripe, Supabase oder SendGrid zu automatisieren. Es hebt Elemente zum Klicken hervor, füllt Felder aus, klickt auf Speichern und schreibt API-Schlüssel direkt in .env-Dateien.

OpenClawRadar
Maßgeschneiderte KI v0.8.1: VS Code-Autovervollständigungserweiterung für Code und Text
Werkzeuge

Maßgeschneiderte KI v0.8.1: VS Code-Autovervollständigungserweiterung für Code und Text

Bespoke AI v0.8.1 ist eine VS Code-Erweiterung, die Autovervollständigung sowohl für Code als auch für Text bietet. Sie nutzt Claude Code-Abonnements über Anthropics Agent SDK, um API-Gebühren zu vermeiden, und unterstützt mehrere Backends einschließlich Ollama.

OpenClawRadar
Multi-Agenten-Handelsratssystem mit GPT-5.1 und Claude 4.6
Werkzeuge

Multi-Agenten-Handelsratssystem mit GPT-5.1 und Claude 4.6

Ein Entwickler hat ein Multi-Agenten-Handelssystem mit ZagiHQ für die Orchestrierung erstellt, das drei parallele Datenerfassungs-Agenten und drei LLMs (GPT-5.1, Claude 4.6 Opus, Claude 4.6 Sonnet) verwendet, die sich bei Trades einigen müssen. Das System filtert Setups durch Uneinigkeit heraus und erfordert manuelle Genehmigung.

OpenClawRadar
WebMCP-Browser-APIs könnten den Bedarf an Web-Scraping für KI-Agenten verringern.
Werkzeuge

WebMCP-Browser-APIs könnten den Bedarf an Web-Scraping für KI-Agenten verringern.

Googles WebMCP führt Browser-APIs ein, die es Websites ermöglichen, Tools für KI-Agenten direkt aufrufbar zu registrieren, wodurch viel DOM-Scraping und Anti-Bot-Umgehungen entfallen könnten, die Entwickler derzeit aufbauen.

OpenClawRadar