OpenClawベンチマークが示す:Qwen3.5:27B、エージェントタスクで他のローカルLLMを凌駕

ベンチマークの設定と結果
ユーザーは、Raspberry Pi 5とRTX 3090でOllamaを実行し、OpenClawを使用して22の実践的なエージェントタスクで7つのローカルモデルをテストしました。タスクには、メールの読み取り、会議のスケジューリング、タスクの作成、フィッシングの検出、エラー処理、ブラウザ自動化が含まれていました。
圧倒的な差で優勝したのは、59.4%を記録したqwen3.5:27b-q4_K_Mでした。2位のqwen3.5:35bはわずか23.2%しか得点できませんでした。他のすべてのモデルは5%未満のスコアでした。
主な発見
- 量子化された27Bモデルが、より大きな35Bバージョンを2.5倍上回りました
- 30Bモデルは1.6%で最下位でした
- 中程度の思考量が最も効果的で、思考しすぎるとパフォーマンスが低下しました
- ブラウザ自動化タスクを完了できるモデルはゼロでした
- 優勝モデルと敗北モデルの主な違いは、コマンドラインツールを見つけて使用できるかどうかでした
- ほとんどのモデルは、メール機能のような基本的なツールすら見つけることができませんでした
このベンチマークは、さまざまなローカルLLMが実践的なシナリオでAIエージェントとしてどのように機能するかについて具体的なデータを提供します。トップモデルと他のモデルとの間の大きなパフォーマンスギャップは、ツール発見能力がローカルLLMエージェントにとって重要なボトルネックであることを示唆しています。
📖 Read the full source: r/LocalLLaMA
👀 See Also

リレー:OpenClaw AIエージェントのためのオープンソース制御プレーン
Relayは、Claude CoworkのようなワークフローをOpenClawに提供するElectronデスクトップアプリです。お客様のインフラストラクチャ上で動作し、選択したLLMモデルを使用でき、承認ゲートやエクスポート可能な監査証跡などの組み込みガバナンス機能を備えています。

Bridge Claude Codeをチャットアプリに接続してリモート対話を実現
cc-connectというGitHubプロジェクトは、Claude CodeをSlackやTelegramなどのメッセージングプラットフォームに接続し、ローカルマシンを公開せずにリモートでのやり取りを可能にします。エージェントはローカルで実行され、小さなブリッジがエージェントとチャットアプリ間のメッセージを中継します。

Claudeタグ: マルチプレイヤーAIコラボレーションのためのSlack上の@Claude
AnthropicがSlackでClaude Tagを発表 — チャンネルで@Claudeをメンションし、ツールを付与して非同期タスクを委任。プロダクトチームのコードの65%がClaudeによって生成。

Mneme: 永続的なメモリを備えたフリーのローカルファーストClaudeチャットクライアント
Mnemeは、階層型メモリ、エンティティ追跡、日次サマリーを備え、Anthropic API経由でSonnet 4.5をサポートする、無料のオープンソース、ローカルファーストのClaudeチャットクライアントです。