PrismMLのBonsai 1-bit Qwenモデルをテスト:8GB VRAMで107 t/sの生成速度を達成

Bonsaiモデル:PrismMLによる1ビットQwen量子化
PrismMLは、Qwen3モデル(8B、4B、1.7Bパラメータ)の1ビット量子化バージョンであるBonsaiをリリースしました。これらのモデルは極端な量子化を使用してメモリ要件を劇的に削減しつつ、特定のタスクで使用可能な性能を維持しています。
テストによる性能ベンチマーク
RTX 4060(8GB VRAM)でのテスト結果:
- 107トークン/秒の生成速度
- >1114トークン/秒のプロンプト処理速度
- Q4量子化モデルと比較して大幅に低いRAM使用量
比較として、同じハードウェアで同じプロンプトを使用した場合、Qwen 3.5 4B Q4は56トークン/秒を達成しました。
実用的な意義
メモリ使用量の削減により、8GB VRAMシステムで8Bパラメータモデルを実行可能になります。より小さなモデルは、メモリ節約により長いコンテキストウィンドウで使用できます。
品質評価
初期テストはテキスト要約に焦点を当て、モデルは良好な性能を示しました。テスト担当者は、コーディングやツール使用能力は評価していないと述べています。
技術的制限
現在の実装にはCPU推論の問題があります。GPUなしのミニPCでテストした場合:
- llama.cppフォークは正常にコンパイルされる
- モデルは読み込まれるが、プロンプト処理中にハングする
- 分析によると、CPU実装は存在せず、FP32に逆量子化して通常の推論を試みている可能性があり、CPUでは極端に遅くなるだろう
技術的可能性
1ビットモデルは、帯域幅とメモリ要件だけでなく、計算要件も削減できる可能性があります。1ビット行列の行列乗算はXOR演算を使用でき、浮動小数点演算よりもはるかに高速です。XOR演算後にFP16にスケーリングする場合でも、大幅な計算節約が可能であり、CPUのみの推論やエッジコンピューティングのシナリオに利益をもたらす可能性があります。
セットアップ詳細
テスト担当者は以下をダウンロード:
- 8B Bonsaiモデル
- PrismMLのllama.cppフォーク
- Windows(CUDA)でテスト実施
📖 Read the full source: r/LocalLLaMA
👀 See Also

Claude Opus 4.7がリリース、ハイブリッド推論と100万トークンのコンテキストウィンドウを搭載
Anthropicは、コーディング、視覚、複雑な多段階タスクにおいてより強力なパフォーマンスを発揮する、100万トークンのコンテキストウィンドウを持つハイブリッド推論モデル「Claude Opus 4.7」をリリースしました。価格は入力100万トークンあたり5ドル、出力100万トークンあたり25ドルからです。

OpenRouterユーザーがSonnet 4.5の思考ブロックで無効な署名バグを報告
OpenRouterを介したClaude Sonnet 4.5の拡張思考モードに影響するバグにより、署名検証の失敗が発生しています。

AnthropicがClaudeコミュニティアンバサダープログラムを開始
Anthropicは、Claude Community Ambassadorsプログラムを立ち上げました。このプログラムは、地域の開発者ミートアップを主催し、世界中のビルダーたちをつなぐためのリソースを提供します。プログラムは、あらゆる背景や地域からの参加者に開かれています。

ClaudeコードキャッシュのバグによりAPIコストが10~20倍増加する可能性あり
Claude Codeの2つのキャッシュバグにより、APIコストが10〜20倍に静かに増加する可能性があります。これらの問題はRedditで報告され、Hacker Newsで議論されました。