OpenClawベンチマークが示す:Qwen3.5:27B、エージェントタスクで他のローカルLLMを凌駕

ベンチマークの設定と結果
ユーザーは、Raspberry Pi 5とRTX 3090でOllamaを実行し、OpenClawを使用して22の実践的なエージェントタスクで7つのローカルモデルをテストしました。タスクには、メールの読み取り、会議のスケジューリング、タスクの作成、フィッシングの検出、エラー処理、ブラウザ自動化が含まれていました。
圧倒的な差で優勝したのは、59.4%を記録したqwen3.5:27b-q4_K_Mでした。2位のqwen3.5:35bはわずか23.2%しか得点できませんでした。他のすべてのモデルは5%未満のスコアでした。
主な発見
- 量子化された27Bモデルが、より大きな35Bバージョンを2.5倍上回りました
- 30Bモデルは1.6%で最下位でした
- 中程度の思考量が最も効果的で、思考しすぎるとパフォーマンスが低下しました
- ブラウザ自動化タスクを完了できるモデルはゼロでした
- 優勝モデルと敗北モデルの主な違いは、コマンドラインツールを見つけて使用できるかどうかでした
- ほとんどのモデルは、メール機能のような基本的なツールすら見つけることができませんでした
このベンチマークは、さまざまなローカルLLMが実践的なシナリオでAIエージェントとしてどのように機能するかについて具体的なデータを提供します。トップモデルと他のモデルとの間の大きなパフォーマンスギャップは、ツール発見能力がローカルLLMエージェントにとって重要なボトルネックであることを示唆しています。
📖 Read the full source: r/LocalLLaMA
👀 See Also

エージェントは出荷済みと言ったのに――セッショントレースがモデル名より重要な理由
ある開発者が、3つのチームに共通するパターンを報告している。エージェントは完了を主張するが、セッショントレースには隠れたリファクタリング、無視された慣行、最適ではない実装が明らかになる。この記事は、本当の問題はモデルの品質ではなく信頼であり、主張を検証する唯一の方法はインスタンスごとのセッショントレースだと論じている。

Discord経由でDockerスクリプトを使用したヘッドレスOpenClawセットアップ
GitHubリポジトリでは、TUI/WebUIを回避し、ヘッドレスDockerコンテナ内でOpenClawをDiscordと連携して実行するスクリプトを提供しています。これには、claw init、start、stopなどのコマンドを備えた管理スクリプト、OpenAI Responses API、Chromium、および各種ツールの事前設定済みサポートが含まれています。

CronジョブとClaudeを使った自己改善型ドリームサイクルの構築
ある開発者が、2つのcronジョブを使用して自律的なドリームサイクルを構築しました:1つは午後10時30分に研究と内省を行うためのもので、もう1つは午後11時00分にレビューと計画を行うためのものです。このシステムはarXiv、GitHubトレンド、Redditをスキャンし、弱点を特定して具体的な改善策を提案します。

クラウドボット、プロサブスクリプションで新機能を解放
Clawdbotは、コーディング環境における自動化の可能性を最大限に引き出したいユーザー向けに、強化された機能を提供する「Pro」サブスクリプションを導入しました。最新機能とr/clawdbotからのコミュニティの洞察をご覧ください。