コードブック ロスレス LLM 圧縮:ビット単位パッキングによる10〜25%のRAM削減

開発者が、インデックス化された重みのビット単位の汎用パッキングによりメモリ使用量を10〜25%削減するロスレスLLM圧縮の概念実証コードを公開しました。この技術は、一部の推論速度を犠牲にしてモデルサイズを小さくすることで、VRAMが限られたハードウェアでより大きなモデルを実行可能にします。
仕組み
開発者はまず、LLMレイヤーに実際に存在する固有の値の数を調査しました。分析の結果、fp16は16ビットを使用しますが、ほとんどのモデルは約12〜13ビットの固有の値しか利用していないことが明らかになりました。これらの値をブロックにパッキングすることで、精度を損なうことなく圧縮を実現しています。
性能特性
- RAM削減: テスト済みモデル全体で10〜25%以上
- 速度への影響: 例示テストでは推論速度が約半分に
- テストハードウェア: NVIDIA P2200 (5GB) と CPU、AMD MI50 (32GB) 向けの更新を開発中
実装の詳細
開発者は、Claude、Qwen、GeminiなどのAIコーディングアシスタントを使用して数週間にわたりこのプロジェクトに取り組みました。リポジトリにはロスレス版とロッシー/バランス版の両方が含まれていますが、ロッシー版はまだ十分にテストされていません。
開発者は、この圧縮手法がモデルの「コンパクトさ」—パラメータ空間をどれだけ効率的に使用しているか—を測定する方法として役立つ可能性を示唆しています。
コードの入手先
概念実証コードはGitHubで入手可能です: https://github.com/bigattichouse/Codebook-Quantization
📖 Read the full source: r/LocalLLaMA
👀 See Also

Qwen 3.5 チャットテンプレートリリース:エージェントワークフローのための21件のバグ修正を実施
開発者がQwen 3.5モデル向けに修正済みチャットテンプレートを公開し、ツール呼び出しのクラッシュ、並列呼び出しの分離、エージェントループの安定性など21のバグに対処しました。llama.cpp、Open WebUI、vLLMなどのプラットフォームでテスト済みのドロップイン置換です。

GANスキル for Claude コード:アイデアを洗練する敵対的AIツール
Claude Codeのスキルである/ganは、敵対的AIの役割を用いて、識別器と生成器の交互のフェーズを通じてアイデアを批評・改善します。強度モード、多言語出力、強制役割選択などの機能は、自己反復を通じて開発されました。

NPCterm: AIエージェント向けMCP経由の完全PTYターミナルエミュレータ
NPCtermは、MCP(Model Context Protocol)を介して公開される、AIエージェント向けのヘッドレス・インメモリ完全PTY端末エミュレータです。15個のMCPツールを備え、端末制御、プロセス状態検出、およびTUIアプリケーションのサポートを提供します。

深層競争分析のためのマルチエージェントシステム(Claude対応)
ある開発者は、単一プロンプトのAIクエリによる表面的な競合分析の問題に対処するため、3つの連続した波で構造化された複数ソースのリサーチを実行するマルチエージェントシステムを構築しました。