Codebook Lossless LLM Compression : Réduction de 10 à 25 % de la RAM grâce au Bitwise Packing

✍️ OpenClawRadar📅 Publié: March 15, 2026🔗 Source
Codebook Lossless LLM Compression : Réduction de 10 à 25 % de la RAM grâce au Bitwise Packing
Ad

Un développeur a publié un code de preuve de concept pour la compression LLM sans perte qui réduit l'utilisation de la mémoire de 10 à 25 % grâce à un regroupement générique bit à bit des poids indexés. La technique échange une partie de la vitesse d'inférence contre une taille de modèle plus petite, permettant d'exécuter des modèles plus volumineux sur du matériel à VRAM limitée.

Fonctionnement

Le développeur a commencé par se demander combien de valeurs uniques existent réellement dans les couches LLM. L'analyse a révélé que si le fp16 utilise 16 bits, la plupart des modèles n'utilisent qu'environ 12 à 13 bits de valeurs uniques. En regroupant ces valeurs en blocs, la technique obtient une compression sans perte de précision.

Caractéristiques de performance

  • Réduction de RAM : 10-25 %+ sur les modèles testés
  • Impact sur la vitesse : Vitesse d'inférence approximativement divisée par deux dans les tests d'exemple
  • Matériel de test : NVIDIA P2200 (5 Go) et CPU, avec des mises à jour en développement pour AMD MI50 (32 Go)
Ad

Détails d'implémentation

Le développeur a travaillé sur ce projet pendant plusieurs semaines en utilisant des assistants de codage IA, dont Claude, Qwen et Gemini. Le dépôt comprend à la fois des versions sans perte et avec perte/équilibrées, bien que la version avec perte n'ait pas encore été largement testée.

Le développeur suggère que cette approche de compression pourrait servir à mesurer la « compacité » d'un modèle – à quel point il utilise efficacement son espace de paramètres.

Disponibilité du code

Le code de preuve de concept est disponible sur GitHub : https://github.com/bigattichouse/Codebook-Quantization

📖 Lire la source complète : r/LocalLLaMA

Ad

👀 See Also

Open-source local hook bascule automatiquement entre les modèles Claude pour réduire les coûts d'IA
Tools

Open-source local hook bascule automatiquement entre les modèles Claude pour réduire les coûts d'IA

Un développeur a créé un crochet local pour Cursor et Claude Code qui analyse les invites et sélectionne automatiquement le modèle Claude approprié (Haiku, Sonnet ou Opus) avant d'envoyer les requêtes. L'outil utilise des règles de mots-clés pour classer les tâches et bloquer les scénarios de surcoût, avec une analyse rétrospective montrant une réduction des coûts de 50 à 70 %.

OpenClawRadar
TechDebtMCP v2.0.0 : Serveur MCP pour l'analyse de la dette technique dans 14 langues
Tools

TechDebtMCP v2.0.0 : Serveur MCP pour l'analyse de la dette technique dans 14 langues

TechDebtMCP v2.0.0 est un serveur MCP qui connecte Claude aux bases de code pour trouver, mesurer et hiérarchiser la dette technique dans 14 langages de programmation, notamment JS/TS, Python, Java, Swift, Kotlin, Go, Rust, C/C++, C#, Ruby et PHP.

OpenClawRadar
SprintiQ : Planification de Sprint Open-Source pour Claude Code
Tools

SprintiQ : Planification de Sprint Open-Source pour Claude Code

SprintiQ est une plateforme agile open-source qui sert de couche d'orchestration pour Claude Code, offrant la génération d'user stories assistée par IA, la planification de sprints, le suivi de vélocité, et une CLI qui synchronise l'activité git avec les sprints en temps réel.

OpenClawRadar
ClawNet : Réseau d'Agents IA Pair-à-Pair Sans Clés API
Tools

ClawNet : Réseau d'Agents IA Pair-à-Pair Sans Clés API

ClawNet est un réseau pair-à-pair qui permet aux agents d'IA de collaborer directement sans clés API ni frais de plateforme. L'installation se fait via un script curl, et les fonctionnalités incluent un bazar de tâches, une économie de shell et un réseau de connaissances.

OpenClawRadar