Codebook Lossless LLM Compression : Réduction de 10 à 25 % de la RAM grâce au Bitwise Packing

✍️ OpenClawRadar📅 Publié: March 15, 2026🔗 Source
Codebook Lossless LLM Compression : Réduction de 10 à 25 % de la RAM grâce au Bitwise Packing
Ad

Un développeur a publié un code de preuve de concept pour la compression LLM sans perte qui réduit l'utilisation de la mémoire de 10 à 25 % grâce à un regroupement générique bit à bit des poids indexés. La technique échange une partie de la vitesse d'inférence contre une taille de modèle plus petite, permettant d'exécuter des modèles plus volumineux sur du matériel à VRAM limitée.

Fonctionnement

Le développeur a commencé par se demander combien de valeurs uniques existent réellement dans les couches LLM. L'analyse a révélé que si le fp16 utilise 16 bits, la plupart des modèles n'utilisent qu'environ 12 à 13 bits de valeurs uniques. En regroupant ces valeurs en blocs, la technique obtient une compression sans perte de précision.

Caractéristiques de performance

  • Réduction de RAM : 10-25 %+ sur les modèles testés
  • Impact sur la vitesse : Vitesse d'inférence approximativement divisée par deux dans les tests d'exemple
  • Matériel de test : NVIDIA P2200 (5 Go) et CPU, avec des mises à jour en développement pour AMD MI50 (32 Go)
Ad

Détails d'implémentation

Le développeur a travaillé sur ce projet pendant plusieurs semaines en utilisant des assistants de codage IA, dont Claude, Qwen et Gemini. Le dépôt comprend à la fois des versions sans perte et avec perte/équilibrées, bien que la version avec perte n'ait pas encore été largement testée.

Le développeur suggère que cette approche de compression pourrait servir à mesurer la « compacité » d'un modèle – à quel point il utilise efficacement son espace de paramètres.

Disponibilité du code

Le code de preuve de concept est disponible sur GitHub : https://github.com/bigattichouse/Codebook-Quantization

📖 Lire la source complète : r/LocalLLaMA

Ad

👀 See Also

Trepan : Auditeur de sécurité local VS Code pour le code généré par l'IA
Tools

Trepan : Auditeur de sécurité local VS Code pour le code généré par l'IA

Trepan est une extension open-source pour VS Code qui agit comme un gardien de sécurité pour les suggestions de code générées par l'IA. Il utilise Ollama pour exécuter des audits de sécurité locaux contre des règles spécifiques au projet dans un fichier .trepan/system_rules.md.

OpenClawRadar
CipherClaw : Utiliser un Personnage de Sécurité pour Auditer du Code avec Claude
Tools

CipherClaw : Utiliser un Personnage de Sécurité pour Auditer du Code avec Claude

Un développeur a utilisé CipherClaw, un persona CLAUDE.md appelé TALON, pour faire penser Claude Code comme un architecte de sécurité. Son exécution sur une application Next.js a révélé 17 problèmes de sécurité, dont des vulnérabilités critiques comme des points de terminaison non authentifiés renvoyant des données d'administrateur et des jetons d'authentification codés en dur.

OpenClawRadar
Serveur MCP pour le contexte de codebase en profondeur emballé
Tools

Serveur MCP pour le contexte de codebase en profondeur emballé

Un nouveau serveur MCP intègre le contexte du code source sur 5 niveaux de profondeur dans des budgets de tokens, résolvant le problème où les agents d'IA de codage chargent soit trop peu de fichiers, soit obtiennent des cartes de dépôt plates sans contenu réel.

OpenClawRadar
RunAnywhere RCLI : Pipeline d'IA vocale sur appareil pour Apple Silicon
Tools

RunAnywhere RCLI : Pipeline d'IA vocale sur appareil pour Apple Silicon

RunAnywhere a publié RCLI, un pipeline d'IA vocale open-source pour macOS qui exécute STT, LLM et TTS entièrement sur les appareils Apple Silicon. L'outil utilise leur moteur d'inférence propriétaire MetalRT et revendique des améliorations de performances significatives par rapport aux solutions existantes.

OpenClawRadar