Bonsai 27B:初の27Bクラスモデルがスマートフォンで動作 — ベンチマークスコアとスペック

PrismMLは、スマートフォン上で動作し収まる初の270億パラメータクラスモデルBonsai 27Bをリリースしました。Qwen 3.6 27Bをベースに、極端な低ビット量子化(3値または2値の重み)を採用し、モデルサイズを16ビット精度の54 GBから3.9 GB(1ビット版)または5.9 GB(3値版)に縮小しています。
2つのバリアント:3値 vs 1ビット
- 3値Bonsai 27B:重みは{−1, 0, +1}でFP16グループ単位スケーリング、実効ビット数1.71/重み。サイズ:5.9 GB。完全な推論、ツール呼び出し、エージェント機能を備え、ラップトップを対象としています。
- 1ビットBonsai 27B:2値重み{−1, +1}、実効ビット数1.125/重み。サイズ:3.9 GB。iPhone 17 Proのメモリ予算に収まります。
両バリアントとも、ネットワーク全体(埋め込み、アテンション、MLP、LMヘッド)を低ビットで実行し、高精度エスケープハッチはありません。262Kトークンコンテキスト、マルチモーダルビジョン(4ビットビジョンタワー)、投機的復号をサポートします。
ベンチマークスコア(思考モード)
15ベンチマークスイート全体で:
- 数学(GSM8K、MATH-500、AIME25、AIME26):Qwen 3.6 27B 95.3、3値 93.4、1ビット 91.7
- コーディング(HumanEval+、MBPP+、LiveCodeBench):88.7 → 86.0 → 81.9
- エージェント/ツール呼び出し(BFCL v3、TauBench):80.0 → 74.0 → 66.0
- 指示追従(IFEval、IFBench):78.4 → 71.8 → 65.8
- 知識/STEM(MMLU-Redux、MuSR):83.1 → 77.0 → 73.4
- ビジョン(MMMU Pro、OCRBench):72.6 → 65.2 → 59.6
- 全体:85.0 → 80.5(95%保持)→ 76.1(90%保持)
数学とコーディングの低下が最も小さく、エージェントワークロードにとって重要です。1ビット版の3.9 GBはフル精度の2Bモデルより小さいながら、27Bクラスの知能を提供します。
エージェントにとってローカル実行が重要な理由
エージェントワークロードでは、多くのシーケンシャルなモデル呼び出しが必要であり、各呼び出しでコンテキストを運び、構造化された出力を生成します。クラウドのみの実行では、ステップごとのレイテンシ、トークンコストの蓄積、プライベートデータ(スクリーンショット、ファイル)のネットワーク送信が発生します。ローカルで実行することで、これらの制約がなくなります。Bonsai 27Bは、デバイス上でのマルチステップ推論、ツール呼び出し、コンピュータ使用エージェントループを可能にします。
ライセンスと入手方法
両バリアントとも、Apache 2.0ライセンスの下で本日から利用可能です。
📖 全文ソース: HN AI Agents
👀 See Also

レポートによると、パランティアのAIが米軍全体に組み込まれる予定です。
ある報告によると、米軍はPalantirのAI技術を全軍に組み込む計画を立てているとのことです。この記事はHacker Newsに投稿され、37ポイントを獲得し、24件のコメントが寄せられました。

オープンソースモデルは、ベンチマークでClaude Opus 4.6に匹敵するか、あるいは上回る性能を示しています。
DeepSeek V3.2、DeepSeek R1、Kimi K2.5、MiniMax M2.5は、MMLU-Pro、速度、ツール使用、推論を含む5つの主要ベンチマークのうち4つでClaude Opus 4.6を上回り、大幅に低コストです。

OpenClawの使い勝手と経済的実現性に対する懸念が浮上
OpenClawは、参入障壁の高さ、法外なコスト、セキュリティ問題、誤解を招くメモリ機能などで批判されています。MemU Botのような代替ソリューションが推奨されています。

文法ベースの手法、著者分析においてAIに匹敵または凌駕
マンチェスター大学の研究によると、文法ベースの著者分析手法であるLambdaGは、ほとんどのテストデータセットにおいて主要なAIシステムと同等以上の性能を示し、より高い透明性と低い計算コストを提供することがわかりました。