盆栽2(Qwen 3.8 27B)をOpenClawのフォールバックとして使用:8GB、5070で85 tok/s
PrismMLのTernary-Bonsai-2-27Bは、量子化されたQwen3 3.8 27Bビルドであり、r/openclawのユーザーが、ChatGPTとGrokのクォータを使い果たしたときにOpenClawのフォールバックモデルとしてローカルで実行しています。その主張は、約8GBのフットプリント、ベースのQwen3 27Bの品質の98%を維持、そしてテキストとビジョンのサポートです。
セットアップの数値
- 出力速度:85 tok/s
- ハードウェア:RTX 5070(16GB VRAM)、64GBシステムメモリ
- ディスクフットプリント:約8GB
- 品質維持:Qwen3 3.8 27Bの98%と報告
必要な2つのGGUF
ファイルはHugging Faceのprism-ml/Ternary-Bonsai-2-27B-ggufリポジトリから入手します:
Ternary-Bonsai-2-27B-PQ2_0.gguf (テキスト) Ternary-Bonsai-2-27B-mmproj-Q8_0.gguf (ビジョン)
マルチモーダル経路を使いたい場合は両方必要です——mmprojファイルはビジョンプロジェクター、PQ2_0ファイルは三値化されたテキスト重みです。
セットアップの注意点
Bonsai 2はPrismML独自のllama.cppフォークが必要で、標準のllama.cppではロードされません。投稿者はGPTに、OpenClawホストとは別のAIマシンでフォークを配線してもらい、モデルは次のように設定されました:
- OpenClawが呼び出したときに動的にロード
- 10分間の非アクティブ後にアンロード
- GPT 5.6とGrokが使用制限に達したときのフォールバックとして機能
実際に何をしたか
面白いのはtok/sではなく、エージェント的な挙動です。投稿によると、ブラウザ経由のWeb検索、VM制御、新しいソフトウェアのインストールと使用、既存ワークフローの実行をこなし、投稿者は「フロンティアモデルではないとは思えない」と述べています。
これは一人のユーザーの報告であり、ベンチマークではないため、品質の主張は逸話として扱ってください。実用的なポイントはアイドル時のロード/アンロードパターンです。有料プロバイダーがレート制限されているときだけローカルの27Bを常駐させることで、他の作業もしているマシンのVRAMを恒久的に消費するのを避ける賢明な方法です。
16GB以上のVRAMを持つGPUがあるなら、PQ2_0 + mmprojのペアは十分小さく、自分のエージェントタスクで試して、自分にとって耐えうるかどうかを判断する価値があります。
📖 Read the full source: r/openclaw
👀 See Also

Memora v0.2.25 MCPサーバー:D1データベースでの書き込みが5倍高速化
Memora v0.2.25、Claudeの永続メモリ用MCPサーバーは、Cloudflare D1での書き込み速度を5倍向上させ、memory_createが10秒以上から約1.8秒、memory_updateが10秒以上から約1.1秒に短縮されました。

OpenClaw PARA組織スキルは、ファイルを自動的にプロジェクト、エリア、リソース、アーカイブに仕分けします。
開発者が、ファイルを整理するためのPARAメソッド(プロジェクト、エリア、リソース、アーカイブ)を強制するOpenClawスキルを作成しました。これにより、すべてのコンテンツをルートディレクトリにダンプする代わりに、自動的にソートされます。

ボットファイト:Claude Codeで構築されたマルチプレイヤーゲーム向けAIエージェントアリーナ
Bot Fightは、ポーカー、ビリヤード、ゴリラ、スネークなどのゲームでAIエージェントが対戦するアリーナです。Claudeコードで完全に構築されたNext.js + Nodeモノレポで、WebSocketとリアルタイムゲームエンジンを備えています。

JanはJan-v3-Baseモデル統合によるワンクリックOpenClawインストールを追加しました
Janは現在、OpenClawのワンクリックインストールをサポートし、Jan-v3-baseモデルに直接統合され、すべての操作をコンピューター上でローカルかつプライベートに保ちます。