コードブック ロスレス LLM 圧縮:ビット単位パッキングによる10〜25%のRAM削減

開発者が、インデックス化された重みのビット単位の汎用パッキングによりメモリ使用量を10〜25%削減するロスレスLLM圧縮の概念実証コードを公開しました。この技術は、一部の推論速度を犠牲にしてモデルサイズを小さくすることで、VRAMが限られたハードウェアでより大きなモデルを実行可能にします。
仕組み
開発者はまず、LLMレイヤーに実際に存在する固有の値の数を調査しました。分析の結果、fp16は16ビットを使用しますが、ほとんどのモデルは約12〜13ビットの固有の値しか利用していないことが明らかになりました。これらの値をブロックにパッキングすることで、精度を損なうことなく圧縮を実現しています。
性能特性
- RAM削減: テスト済みモデル全体で10〜25%以上
- 速度への影響: 例示テストでは推論速度が約半分に
- テストハードウェア: NVIDIA P2200 (5GB) と CPU、AMD MI50 (32GB) 向けの更新を開発中
実装の詳細
開発者は、Claude、Qwen、GeminiなどのAIコーディングアシスタントを使用して数週間にわたりこのプロジェクトに取り組みました。リポジトリにはロスレス版とロッシー/バランス版の両方が含まれていますが、ロッシー版はまだ十分にテストされていません。
開発者は、この圧縮手法がモデルの「コンパクトさ」—パラメータ空間をどれだけ効率的に使用しているか—を測定する方法として役立つ可能性を示唆しています。
コードの入手先
概念実証コードはGitHubで入手可能です: https://github.com/bigattichouse/Codebook-Quantization
📖 Read the full source: r/LocalLLaMA
👀 See Also

6GB GPUでのミーティング要約: qwen3.5:0.8Bは57秒で動作、Granite 4 350Mは幻覚を起こす
VoiceFlow v1.6.0 は、ローカルの会議録音と要約機能を追加しました。6GBのRTX 3060でサブ10億パラメータモデルをベンチマーク: qwen3.5:0.8Bは2.2GB VRAMで57秒かけて構造化された要約を生成し、Granite 4 350Mはひどく幻覚を起こします。

CodeTalk: オープンソースツールがClaude Code CLIに音声フィードバック機能を追加
CodeTalkは、Microsoftのedge-ttsを使用してClaude Code CLIの応答に音声による観察を追加するPythonツールです。Claudeが埋め込んだテキストを抽出し、自然なニューラルTTSでスピーカーを通じて再生します。

自然言語オートエンコーダ:クロードの内部表現をテキストに変換する
Transformer Circuits Threadが、Claudeの内部活性化を可読テキストにデコードするNatural Language Autoencodersを公開。GitHubリポジトリとインタラクティブデモも利用可能。

Cortex v1.2では、LLMによる情報強化、引用付きQ&A、およびコンフリクト解決機能が追加されました。
OpenClawエージェント向けのローカルメモリレイヤーであるCortexが、v1.2をリリースしました。デフォルトでLLMによる拡張エンリッチメントが有効化され、引用付きの質問応答コマンド、改善された重複排除と競合解決機能が追加されています。このツールには、統一された設定管理と意図ベースの検索事前フィルタリングも含まれています。