オープンソースのベンチマークランナー:OpenClawエージェントを実際のワークフローでテスト

Redditユーザーが、personal_agent_eval (リポジトリ: github.com/javiersgjavi/personal_agent_eval) というオープンソースツールを公開しました。これは、公開されたおもちゃのデータセットではなく、現実的で複雑なワークフローでOpenClawエージェントをベンチマークするためのものです。
ワークフロー
テストケースをYAMLファイルで定義します。これには以下が含まれます:
- 入力メッセージ
- 期待されるアーティファクト
- 評価基準
- 決定論的チェック
- 実行プロファイルと判定プロファイル
ランナーは実際のOpenClawインスタンスに対してケースを実行し、出力を保存し、実行を評価し、レポートとチャートを生成します。
主要機能:実際のワークスペースのインポート
メモリ、スキル、ファイル、プロンプト、コンテキストを含む、実際のOpenClawワークスペースをインポートできます。模造品ではありません。エージェントは実際のOpenClawインスタンスで動作し、日々使用しているエージェントそのものをテストします。
プライベート評価セット
作者は、公開ベンチマークが陳腐化するのを避けるため、プライベート評価セットを公開しないことを明示しています。ただし、リポジトリにはサンプルケース、設定、評価プロファイル、決定論的チェック、チャート生成が含まれており、独自のプライベートスイートを構築できます。
エージェント支援用のSKILL.md
リポジトリ内のSKILL.mdファイルは、エージェントが新しいベンチマークケース、実行プロファイル、評価基準、決定論的チェックを定義するのに十分なコンテキストを提供し、手動編集を減らすように設計されています。
サンプル結果(作者のプライベート実行)
作者は単一実行の比較を共有しました(指標は不明、おそらく加重平均0〜10):
Claude Opus 4.6 - 9.44 GLM 5.1 - 9.31 GPT-5.5 - 9.31 Claude Sonnet 4.6 - 9.25 DeepSeek V4 Flash - 8.61 Gemma 4 31B - 8.39 DeepSeek V4 Pro - 8.28 Kimi K2.6 - 7.97
スコアよりも興味深いのは、失敗のパターンです。一部のモデルは推論は得意ですがツール操作が不器用で、安価なモデルは長いタスクや状態を保持するタスクで性能が低下します。いくつかの失敗はモデルの動作に起因し、他はベンチマークによって露呈したOpenClawやツールのエッジケースです。
対象ユーザー
実際の作業でエージェントを使用し、漠然とした印象や一般的なリーダーボードではなく、自身のプライベートタスクでモデルを比較したいOpenClawユーザー向けです。
📖 全文ソース: r/openclaw
👀 See Also

本を司書と共に:読書管理とネタバレなしのおすすめ
OpenClawスキルが読書生活を記録し、所有する未読本から優先的に推薦、時間と共に嗜好の変化を学習します。

Chromeflow: Claude向けウェブUIタスクを自動化するChrome拡張機能
Chromeflowは、Claude Codeで構築された無料のオープンソースChrome拡張機能およびMCPサーバーで、Claudeにブラウザ制御を与え、Stripe、Supabase、SendGridなどの設定といった手動のWeb UIタスクを自動化します。クリックする要素をハイライト表示し、フィールドを自動入力し、保存ボタンをクリックし、APIキーを.envファイルに直接書き込みます。

CodeLedgerとVibecopのアップデート:マルチエージェントAIコーディングのコストと品質追跡機能
CodeLedgerは現在、ローカルのセッションファイルを読み取ることで、Claude Code、Codex CLI、Cline、Gemini CLIにわたる支出を追跡します。一方、Vibecopは新しいLLM専用検出器と複数のAIコーディングツール向けのワンコマンドセットアップを追加し、自動化された品質チェックを提供します。

Claude価格改定後の代替AIコーディング環境
ある開発者が、現在のAIコーディングセットアップを共有しています。主要モデルとしてGPT 5.4を使用し、ChatGPTサブスクリプションに含まれるCodexをフォールバックとして、さらにMinimax 2.7をバックアップとしてコーディングプランの価格で利用しています。