Bonsai 1.7B 三元モデル、M4 Max上で自律調整されたMetalカーネルにより442 T/sを達成

Bonsai 1.7B — PrismMLによる三項モデル — が、Apple Silicon向けに自律的にチューニングされたMetalカーネルを用いて最適化されました。この作業は、エージェンティック進化探索を6時間実行してカスタムGPUカーネルを生成した、Agents2Agentsの自律エンジニアリングエージェントataによって行われました。
ベンチマーク結果
同じBonsai/Q2_0コミットのアップストリームのllama.cppと、M4 Max上で(同一モデルファイル、同一のllama-bench -p 512 -n 128 -r 10 -fa 1 -ngl 99設定)比較した測定結果:
- デコード (tg128): 311.66 → 442.42 t/s (+42.0%)
- プリフィル (pp512): 4250.32 → 4622.63 t/s (+8.8%)
参考までに、Bonsai 8Bのホワイトペーパーでは、Apple Silicon上のMLXアップストリームQ2_0デコードは235 t/sと報告されています。このビルドでは、カスタムMetalカーネルにより1.7Bバリアントで442 t/sを達成しています(異なるフレームワーク、より小さいモデル — スタック内の余力を示す方向性のある指標)。
含まれるもの
このビルドは、MシリーズMac向けのドロップイン最適化推論パッケージです(arm64のみ)。358 MBのtar.xz内:
chat.sh— インタラクティブREPLcomplete.sh— 非インタラクティブ補完bench.sh— ベンチマークの再現server.sh— :8080でOpenAI互換HTTP APIBonsai-1.7B-Q2_0.gguf— モデルファイル(442 MB)
クイックスタート
tar -xJf bonsai-1.7b-ternary-M4Max.tar.xz
cd bonsai-1.7b-ternary-M4Max
./chat.sh技術的詳細
すべてのMetalカーネルは、人間の介入なしにataによって作成および調整されました。作業は、Bonsai 1.7B Q2_0のデコードパスに形状特化した、matvec / FFN / KVキャッシュ層でのカスタムGPUカーネルに焦点を当てました。数値出力はリファレンスビルドと一致します(top-1トークンの一致を確認済み)。M4 Maxでテスト済み。M1+でも比例した改善が期待されます。
注意事項
- Apple Siliconのみ(arm64) — Intel MacやCPUのみのビルドはありません。
- 数値はM4 Maxのもの。M1/M2/M3はメモリ帯域幅が少ないため、より低くなります。
- モデルはQ2_0量子化 — F16と比較してわずかな精度差があります。
📖 全文はこちら: HN AI Agents
👀 See Also

ジェンセン・フアンのGTC 2026におけるOpenClaw主張とNVIDIAの戦略の分析
NVIDIA CEO ジェンセン・フアンのGTC 2026基調講演におけるOpenClawの成長、エージェントのセキュリティリスク、NVIDIA独自ソリューションに関する主張のファクトチェック。情報源は技術的根拠を検証しつつ、NVIDIAのビジネス戦略を分析しています。

AIピンポン:あらゆる返信がChatGPTのスクリーンショットになるとき
開発者らは、同僚や上司、さらにはGitHubのコメント投稿者から、文脈を無視したAI生成の回答が大量に送りつけられ、時間を無駄にしていると報告。HNの議論は、高まる不満を捉えている。
Opus 4.7の注意劣化:256kコンテキストでMRCRスコアが92%から59%に低下
Opus 4.7 は MRCR v2 8-needle テストにおいて大幅なリコール低下を示しています。256k コンテキストでは 91.9% から 59.2%、1M では 78.3% から 32.2% に低下しています。Anthropic は MRCR を廃止し Graphwalks に移行していますが、この劣化はユーザーの報告と一致しています。

スタンフォード大学CS25トランスフォーマー講座、一般公開へ ライブ配信も実施
スタンフォード大学のCS 25 Transformersセミナーが一般公開され、2025年1月23日午後4時30分から5時50分(PDT)に講義が開始されます。Skilling Auditoriumでの対面参加またはZoomでの参加が可能で、録画はオンラインで公開されます。