Bonsai 27B:初の27Bクラスモデルがスマートフォンで動作 — ベンチマークスコアとスペック

PrismMLは、スマートフォン上で動作し収まる初の270億パラメータクラスモデルBonsai 27Bをリリースしました。Qwen 3.6 27Bをベースに、極端な低ビット量子化(3値または2値の重み)を採用し、モデルサイズを16ビット精度の54 GBから3.9 GB(1ビット版)または5.9 GB(3値版)に縮小しています。
2つのバリアント:3値 vs 1ビット
- 3値Bonsai 27B:重みは{−1, 0, +1}でFP16グループ単位スケーリング、実効ビット数1.71/重み。サイズ:5.9 GB。完全な推論、ツール呼び出し、エージェント機能を備え、ラップトップを対象としています。
- 1ビットBonsai 27B:2値重み{−1, +1}、実効ビット数1.125/重み。サイズ:3.9 GB。iPhone 17 Proのメモリ予算に収まります。
両バリアントとも、ネットワーク全体(埋め込み、アテンション、MLP、LMヘッド)を低ビットで実行し、高精度エスケープハッチはありません。262Kトークンコンテキスト、マルチモーダルビジョン(4ビットビジョンタワー)、投機的復号をサポートします。
ベンチマークスコア(思考モード)
15ベンチマークスイート全体で:
- 数学(GSM8K、MATH-500、AIME25、AIME26):Qwen 3.6 27B 95.3、3値 93.4、1ビット 91.7
- コーディング(HumanEval+、MBPP+、LiveCodeBench):88.7 → 86.0 → 81.9
- エージェント/ツール呼び出し(BFCL v3、TauBench):80.0 → 74.0 → 66.0
- 指示追従(IFEval、IFBench):78.4 → 71.8 → 65.8
- 知識/STEM(MMLU-Redux、MuSR):83.1 → 77.0 → 73.4
- ビジョン(MMMU Pro、OCRBench):72.6 → 65.2 → 59.6
- 全体:85.0 → 80.5(95%保持)→ 76.1(90%保持)
数学とコーディングの低下が最も小さく、エージェントワークロードにとって重要です。1ビット版の3.9 GBはフル精度の2Bモデルより小さいながら、27Bクラスの知能を提供します。
エージェントにとってローカル実行が重要な理由
エージェントワークロードでは、多くのシーケンシャルなモデル呼び出しが必要であり、各呼び出しでコンテキストを運び、構造化された出力を生成します。クラウドのみの実行では、ステップごとのレイテンシ、トークンコストの蓄積、プライベートデータ(スクリーンショット、ファイル)のネットワーク送信が発生します。ローカルで実行することで、これらの制約がなくなります。Bonsai 27Bは、デバイス上でのマルチステップ推論、ツール呼び出し、コンピュータ使用エージェントループを可能にします。
ライセンスと入手方法
両バリアントとも、Apache 2.0ライセンスの下で本日から利用可能です。
📖 全文ソース: HN AI Agents
👀 See Also

Claude Code 2.1.80では、レート制限の可視化、MCPプッシュメッセージング、およびメモリ改善が追加されました。
Claude Code バージョン2.1.80では、ステータスラインでのレート制限表示、--channelsフラグによるMCPプッシュメッセージング、インラインプラグイン設定の導入、そして起動時のメモリ使用量を80MB削減しました。

Google DeepMind社員、軍事AI契約巡り組合結成を投票
ロンドンを拠点とするGoogle DeepMindの従業員が労働組合結成を決議し、米国およびイスラエル軍とのAI契約を停止するようGoogleに要求。倫理ガイドラインの削除を懸念。

基本をナビゲート:新規ユーザーがOpenClawのガイダンスを求める
OpenClaw初心者がAIコーディングエージェントの複雑さを探求する中で、Redditで助けを求めています。技術コミュニティはアドバイスとリソースを提供して支援しています。

Claudeアプリが米国App Storeチャート首位を獲得、AIアシスタントがトップ10を席巻
アンソロピック社のClaudeは現在、米国App Storeのトップアプリチャートで第1位を獲得しており、ChatGPTが第2位、Google Geminiが第4位となっています。トップ10には、ショッピング、ソーシャルメディア、ユーティリティアプリの中に3つのAIアシスタントが含まれています。