Bonsai 1.7B 三元モデル、M4 Max上で自律調整されたMetalカーネルにより442 T/sを達成

Bonsai 1.7B — PrismMLによる三項モデル — が、Apple Silicon向けに自律的にチューニングされたMetalカーネルを用いて最適化されました。この作業は、エージェンティック進化探索を6時間実行してカスタムGPUカーネルを生成した、Agents2Agentsの自律エンジニアリングエージェントataによって行われました。
ベンチマーク結果
同じBonsai/Q2_0コミットのアップストリームのllama.cppと、M4 Max上で(同一モデルファイル、同一のllama-bench -p 512 -n 128 -r 10 -fa 1 -ngl 99設定)比較した測定結果:
- デコード (tg128): 311.66 → 442.42 t/s (+42.0%)
- プリフィル (pp512): 4250.32 → 4622.63 t/s (+8.8%)
参考までに、Bonsai 8Bのホワイトペーパーでは、Apple Silicon上のMLXアップストリームQ2_0デコードは235 t/sと報告されています。このビルドでは、カスタムMetalカーネルにより1.7Bバリアントで442 t/sを達成しています(異なるフレームワーク、より小さいモデル — スタック内の余力を示す方向性のある指標)。
含まれるもの
このビルドは、MシリーズMac向けのドロップイン最適化推論パッケージです(arm64のみ)。358 MBのtar.xz内:
chat.sh— インタラクティブREPLcomplete.sh— 非インタラクティブ補完bench.sh— ベンチマークの再現server.sh— :8080でOpenAI互換HTTP APIBonsai-1.7B-Q2_0.gguf— モデルファイル(442 MB)
クイックスタート
tar -xJf bonsai-1.7b-ternary-M4Max.tar.xz
cd bonsai-1.7b-ternary-M4Max
./chat.sh技術的詳細
すべてのMetalカーネルは、人間の介入なしにataによって作成および調整されました。作業は、Bonsai 1.7B Q2_0のデコードパスに形状特化した、matvec / FFN / KVキャッシュ層でのカスタムGPUカーネルに焦点を当てました。数値出力はリファレンスビルドと一致します(top-1トークンの一致を確認済み)。M4 Maxでテスト済み。M1+でも比例した改善が期待されます。
注意事項
- Apple Siliconのみ(arm64) — Intel MacやCPUのみのビルドはありません。
- 数値はM4 Maxのもの。M1/M2/M3はメモリ帯域幅が少ないため、より低くなります。
- モデルはQ2_0量子化 — F16と比較してわずかな精度差があります。
📖 全文はこちら: HN AI Agents
👀 See Also
AIの給与がサンフランシスコの住宅価格を押し上げ、中央値が過去最高の176万ドルに
2026年5月のサンフランシスコの住宅価格の中央値が176万ドルに達し、OpenAIやAnthropicのAI関連労働者の富が押し上げている。現金代わりにAI企業の株式を受け入れる売り手もいる。

オラクル、社内LLM利用にもかかわらずOpenJDKでのAI生成コードを禁止
オラクルはOpenJDKへのAI生成コードの提供を禁止し、セキュリティと知的財産リスクを挙げている。これは、AIがオラクルのコードを書いているというラリー・エリソンCEOの発言と矛盾している。

Claude Code v2.1.218 修正 /code-review、MCP 認証、Windows パス破損の問題
Claude Code v2.1.218 では、/code-review がバックグラウンドサブエージェントとして実行され、Windows の \u プレフィックス付きパスの破損を修正し、スクリーンリーダーのサポートを改善し、MCP 認証の過剰カウントを修正しました。

Claude Codeのリークで隠しペットシステム発見:アスキーアニメーション付きガチャメカニックス
流出したClaude Codeの分析により、18種類の種族、レアリティ階層、ASCIIアニメーションを備えた隠しコンパニオンペットシステムが明らかになりました。このシステムはユーザーIDから決定論的ハッシュを使用して種族データを保存せずにユニークなペットを生成します。