ピンチベンチ結果:初のOpenClaw専用AIコーディングエージェントベンチマーク

PinchBenchは、OpenClawエコシステムにおけるAIコーディングエージェントの評価のために特別に設計された最初のベンチマークであり、成功率、コスト、速度でモデルをランク付けしています。
主な結果
このベンチマークでは32のモデルがテストされました。成功率による上位パフォーマーは以下の通りです:
- 1. google/gemini-3-flash-preview: 95.1%の成功率、0.72ドルのコスト、254.50秒の速度
- 2. minimax/minimax-m2.1: 93.6%の成功率、0.14ドルのコスト、239.79秒の速度
- 3. moonshotai/kimi-k2.5: 93.4%の成功率、0.20ドルのコスト、291.67秒の速度
- 4. anthropic/claude-sonnet-4.5: 92.7%の成功率、3.07ドルのコスト、304.53秒の速度
- 5. google/gemini-3-pro-preview: 91.7%の成功率、1.48ドルのコスト、239.55秒の速度
注目すべき発見
- FlashモデルはProモデルを低コストで上回る:Gemini-3-Flash-Preview(95.1%、0.72ドル)はGemini-3-Pro-Preview(91.7%、1.48ドル)を凌駕
- 高価なモデルが必ずしも優れたパフォーマンスを示すわけではない
- Minimax 2.5は35.5%の成功率、105.96秒の速度で31位(コストは記載なし)
- 複数のモデルが90%以上の高い成功率を維持しながら、1ドル未満のコストを実現
パフォーマンス範囲
成功率は95.1%(最高)から35.2%(最低)の範囲にあります。コスト効率の良い選択肢には以下が含まれます:
- openai/gpt-5-nano: 85.8%の成功率で0.03ドル
- google/gemini-2.5-flash-lite: 83.2%の成功率で0.05ドル
- mistralai/devstral-2512: 81.7%の成功率で0.10ドル
ランキングの下位(23-32位)の複数のモデルは、約40%以下の成功率を示しており、提供されたデータにはコストが記載されていません。
📖 完全なソースを読む: r/openclaw
👀 See Also

オープンソースの知識ベースサーバーと永続的AIメモリのためのマルチエージェントオーケストレーター
ある開発者が、カスタムMCPサーバーをプライベートVPS上に構築し、Claude、Codex、Geminiにセッションを超えた永続的なメモリを提供しました。このシステムには、Obsidianボールトを取り込むナレッジベースサーバーと、フェイルオーバー用のマルチエージェントオーケストレーター「Daniel」が含まれています。

新しいLinuxタスクバーウィジェットでClaude AIの使用状況を監視
新しいLinuxタスクバーウィジェットは、ユーザーがClaude AIのサブスクリプション使用状況をリアルタイムで追跡できるようにし、カラーコードによるフィードバックと簡単なインストールを提供します。

クロードコードが許可決定に自動モードを追加
Claude Codeには、すべてのファイル書き込みやbashコマンドに対して手動で承認を求める代わりに、Claudeが許可の決定を処理する自動モードが追加されました。このモードには、各アクションが実行される前にチェックする安全策が含まれており、潜在的に破壊的なアクションに対してツール呼び出しをレビューする分類器が組み込まれています。

QCAIモバイルアプリに、Tailscale VPNをネイティブ統合したOpenClawゲートウェイ制御機能を追加
iOSおよびAndroid向けQCAIがOpenClaw Control Centerと統合され、安全なTailscale VPNトンネルを介してモバイルデバイスから直接ゲートウェイ管理が可能になり、開放ポートを必要としません。