Bonsai 27B:初の27Bクラスモデルがスマートフォンで動作 — ベンチマークスコアとスペック

PrismMLは、スマートフォン上で動作し収まる初の270億パラメータクラスモデルBonsai 27Bをリリースしました。Qwen 3.6 27Bをベースに、極端な低ビット量子化(3値または2値の重み)を採用し、モデルサイズを16ビット精度の54 GBから3.9 GB(1ビット版)または5.9 GB(3値版)に縮小しています。
2つのバリアント:3値 vs 1ビット
- 3値Bonsai 27B:重みは{−1, 0, +1}でFP16グループ単位スケーリング、実効ビット数1.71/重み。サイズ:5.9 GB。完全な推論、ツール呼び出し、エージェント機能を備え、ラップトップを対象としています。
- 1ビットBonsai 27B:2値重み{−1, +1}、実効ビット数1.125/重み。サイズ:3.9 GB。iPhone 17 Proのメモリ予算に収まります。
両バリアントとも、ネットワーク全体(埋め込み、アテンション、MLP、LMヘッド)を低ビットで実行し、高精度エスケープハッチはありません。262Kトークンコンテキスト、マルチモーダルビジョン(4ビットビジョンタワー)、投機的復号をサポートします。
ベンチマークスコア(思考モード)
15ベンチマークスイート全体で:
- 数学(GSM8K、MATH-500、AIME25、AIME26):Qwen 3.6 27B 95.3、3値 93.4、1ビット 91.7
- コーディング(HumanEval+、MBPP+、LiveCodeBench):88.7 → 86.0 → 81.9
- エージェント/ツール呼び出し(BFCL v3、TauBench):80.0 → 74.0 → 66.0
- 指示追従(IFEval、IFBench):78.4 → 71.8 → 65.8
- 知識/STEM(MMLU-Redux、MuSR):83.1 → 77.0 → 73.4
- ビジョン(MMMU Pro、OCRBench):72.6 → 65.2 → 59.6
- 全体:85.0 → 80.5(95%保持)→ 76.1(90%保持)
数学とコーディングの低下が最も小さく、エージェントワークロードにとって重要です。1ビット版の3.9 GBはフル精度の2Bモデルより小さいながら、27Bクラスの知能を提供します。
エージェントにとってローカル実行が重要な理由
エージェントワークロードでは、多くのシーケンシャルなモデル呼び出しが必要であり、各呼び出しでコンテキストを運び、構造化された出力を生成します。クラウドのみの実行では、ステップごとのレイテンシ、トークンコストの蓄積、プライベートデータ(スクリーンショット、ファイル)のネットワーク送信が発生します。ローカルで実行することで、これらの制約がなくなります。Bonsai 27Bは、デバイス上でのマルチステップ推論、ツール呼び出し、コンピュータ使用エージェントループを可能にします。
ライセンスと入手方法
両バリアントとも、Apache 2.0ライセンスの下で本日から利用可能です。
📖 全文ソース: HN AI Agents
👀 See Also

注意ゲーティング:AI記憶システムにおける選択的忘却の課題
OpenClawボットの5層メモリシステムを構築している開発者が、重要な限界を特定しました。現在のアプローチは想起に焦点を当てていますが、集中タスク中に無関係な情報を抑制するメカニズムが欠けており、人間の注意ゲーティングに似ています。

AI依存の罠:LLMへの過度な依存が中核スキルを損なう理由
AIチャットボットへの過度の依存が、批判的思考、文章作成、調査、学習能力の衰退につながるという逆張りの主張。

AWS上でのClaude PlatformがGAに:マネージドエージェント、コード実行、IAMによる完全なAPI互換性
AWS上のClaude Platformは、ネイティブのClaude API機能(マネージドエージェント、コード実行、スキル)をAWSのお客様に提供し、IAM認証、CloudTrailログ、およびコミットメントの解約に対応します。

Claude Max 20x プラン: 発表にもかかわらず制限増加未適用 — ユーザーが数学で確認
有料のClaude Max 20x(月200ドル)ユーザーが、Anthropicが発表した2倍のセッション制限と1.5倍の週間制限の引き上げが自分のアカウントに適用されていないと報告。数学的な証明を提供し、サポートからの完全な無反応を共有。