Codebook-Verlustfreie LLM-Kompression: 10–25 % RAM-Reduzierung durch Bitweise Packung

Ein Entwickler hat einen Proof-of-Concept-Code für verlustfreie LLM-Kompression veröffentlicht, der durch bitweises generisches Packen indizierter Gewichte den Speicherverbrauch um 10-25% reduziert. Die Technik tauscht etwas Inferenzgeschwindigkeit gegen eine kleinere Modellgröße, wodurch größere Modelle auf Hardware mit begrenztem VRAM ausgeführt werden können.
Wie es funktioniert
Der Entwickler begann damit, zu fragen, wie viele eindeutige Werte tatsächlich in LLM-Schichten existieren. Die Analyse ergab, dass während fp16 16 Bits verwendet, die meisten Modelle nur etwa 12-13 Bits an eindeutigen Werten nutzen. Durch das Packen dieser Werte in Blöcke erreicht die Technik Kompression ohne Genauigkeitsverlust.
Leistungsmerkmale
- RAM-Reduzierung: 10-25%+ über getestete Modelle
- Geschwindigkeitsauswirkung: Inferenzgeschwindigkeit in Beispieltests etwa halbiert
- Testhardware: NVIDIA P2200 (5GB) und CPU, mit Entwicklungsupdates für AMD MI50 (32GB)
Implementierungsdetails
Der Entwickler arbeitete mehrere Wochen an diesem Projekt unter Verwendung von KI-Codierungsassistenten, darunter Claude, Qwen und Gemini. Das Repository enthält sowohl verlustfreie als auch verlustbehaftete/ausgeglichene Versionen, wobei die verlustbehaftete Version noch nicht umfassend getestet wurde.
Der Entwickler schlägt vor, dass dieser Kompressionsansatz als Möglichkeit dienen könnte, die "Kompaktheit" eines Modells zu messen – wie effizient es seinen Parameterraum nutzt.
Code-Verfügbarkeit
Der Proof-of-Concept-Code ist auf GitHub verfügbar: https://github.com/bigattichouse/Codebook-Quantization
📖 Read the full source: r/LocalLLaMA
👀 Siehe auch

Chromeflow: Chrome-Erweiterung automatisiert Web-UI-Aufgaben für Claude
Chromeflow ist eine kostenlose, quelloffene Chrome-Erweiterung und MCP-Server, die mit Claude Code erstellt wurde und Claude Browsersteuerung gibt, um manuelle Web-UI-Aufgaben wie die Einrichtung von Stripe, Supabase oder SendGrid zu automatisieren. Es hebt Elemente zum Klicken hervor, füllt Felder aus, klickt auf Speichern und schreibt API-Schlüssel direkt in .env-Dateien.

Maßgeschneiderte KI v0.8.1: VS Code-Autovervollständigungserweiterung für Code und Text
Bespoke AI v0.8.1 ist eine VS Code-Erweiterung, die Autovervollständigung sowohl für Code als auch für Text bietet. Sie nutzt Claude Code-Abonnements über Anthropics Agent SDK, um API-Gebühren zu vermeiden, und unterstützt mehrere Backends einschließlich Ollama.

Multi-Agenten-Handelsratssystem mit GPT-5.1 und Claude 4.6
Ein Entwickler hat ein Multi-Agenten-Handelssystem mit ZagiHQ für die Orchestrierung erstellt, das drei parallele Datenerfassungs-Agenten und drei LLMs (GPT-5.1, Claude 4.6 Opus, Claude 4.6 Sonnet) verwendet, die sich bei Trades einigen müssen. Das System filtert Setups durch Uneinigkeit heraus und erfordert manuelle Genehmigung.

WebMCP-Browser-APIs könnten den Bedarf an Web-Scraping für KI-Agenten verringern.
Googles WebMCP führt Browser-APIs ein, die es Websites ermöglichen, Tools für KI-Agenten direkt aufrufbar zu registrieren, wodurch viel DOM-Scraping und Anti-Bot-Umgehungen entfallen könnten, die Entwickler derzeit aufbauen.