Codebook Lossless LLM Compression : Réduction de 10 à 25 % de la RAM grâce au Bitwise Packing

Un développeur a publié un code de preuve de concept pour la compression LLM sans perte qui réduit l'utilisation de la mémoire de 10 à 25 % grâce à un regroupement générique bit à bit des poids indexés. La technique échange une partie de la vitesse d'inférence contre une taille de modèle plus petite, permettant d'exécuter des modèles plus volumineux sur du matériel à VRAM limitée.
Fonctionnement
Le développeur a commencé par se demander combien de valeurs uniques existent réellement dans les couches LLM. L'analyse a révélé que si le fp16 utilise 16 bits, la plupart des modèles n'utilisent qu'environ 12 à 13 bits de valeurs uniques. En regroupant ces valeurs en blocs, la technique obtient une compression sans perte de précision.
Caractéristiques de performance
- Réduction de RAM : 10-25 %+ sur les modèles testés
- Impact sur la vitesse : Vitesse d'inférence approximativement divisée par deux dans les tests d'exemple
- Matériel de test : NVIDIA P2200 (5 Go) et CPU, avec des mises à jour en développement pour AMD MI50 (32 Go)
Détails d'implémentation
Le développeur a travaillé sur ce projet pendant plusieurs semaines en utilisant des assistants de codage IA, dont Claude, Qwen et Gemini. Le dépôt comprend à la fois des versions sans perte et avec perte/équilibrées, bien que la version avec perte n'ait pas encore été largement testée.
Le développeur suggère que cette approche de compression pourrait servir à mesurer la « compacité » d'un modèle – à quel point il utilise efficacement son espace de paramètres.
Disponibilité du code
Le code de preuve de concept est disponible sur GitHub : https://github.com/bigattichouse/Codebook-Quantization
📖 Lire la source complète : r/LocalLLaMA
👀 See Also

Open-source local hook bascule automatiquement entre les modèles Claude pour réduire les coûts d'IA
Un développeur a créé un crochet local pour Cursor et Claude Code qui analyse les invites et sélectionne automatiquement le modèle Claude approprié (Haiku, Sonnet ou Opus) avant d'envoyer les requêtes. L'outil utilise des règles de mots-clés pour classer les tâches et bloquer les scénarios de surcoût, avec une analyse rétrospective montrant une réduction des coûts de 50 à 70 %.

TechDebtMCP v2.0.0 : Serveur MCP pour l'analyse de la dette technique dans 14 langues
TechDebtMCP v2.0.0 est un serveur MCP qui connecte Claude aux bases de code pour trouver, mesurer et hiérarchiser la dette technique dans 14 langages de programmation, notamment JS/TS, Python, Java, Swift, Kotlin, Go, Rust, C/C++, C#, Ruby et PHP.

SprintiQ : Planification de Sprint Open-Source pour Claude Code
SprintiQ est une plateforme agile open-source qui sert de couche d'orchestration pour Claude Code, offrant la génération d'user stories assistée par IA, la planification de sprints, le suivi de vélocité, et une CLI qui synchronise l'activité git avec les sprints en temps réel.

ClawNet : Réseau d'Agents IA Pair-à-Pair Sans Clés API
ClawNet est un réseau pair-à-pair qui permet aux agents d'IA de collaborer directement sans clés API ni frais de plateforme. L'installation se fait via un script curl, et les fonctionnalités incluent un bazar de tâches, une économie de shell et un réseau de connaissances.