ジェイク・ベンチマーク v1:OpenClaw AIエージェント向けローカルLLM性能テスト

Jake Benchmark v1は、OpenClawを使用したAIエージェントとして機能するローカルLLMのパフォーマンス評価ツールです。実世界のエージェントシナリオにおける有効性を判断するために、22の実用的なタスクでモデルをテストします。
テスト設定と方法論
このベンチマークは、NVIDIA 3090 GPU上でOllamaを実行するRaspberry Piで実施されました。開発者はOpenClawを使用したエージェント作業に最適なモデルを特定するため、7つの異なるローカルLLMをテストしました。
タスクカテゴリ
22のタスクは、以下のような実世界のシナリオをカバーしています:
- メールを読み取り、そこからタスクを作成する
- 会議をスケジュールし、衝突をチェックする
- フィッシング検出(特に、ビットコインウォレットキーを要求する所有者を装った偽メール)
- エラー処理
主な結果
モデル間でのパフォーマンスのばらつきは顕著でした:
- Qwen 27B: 59.4%を獲得 - メールの処理、会議のスケジューリング、フィッシング試行の検出、エラーの管理に成功
- Nemotron 30B: 1.6%を獲得 -
apt-get install gitを実行してタスクを解決しようと試みた
注目すべき観察結果
フィッシングテストでは興味深い挙動が明らかになりました:
- 最良のモデルはフィッシングリクエストを即座に拒否しました
- 最悪のモデルは情報を共有しないと判断する前に、シークレットファイルを3回読み取りました
ダッシュボード機能
このベンチマークには、ユーザーが以下のことを可能にするインタラクティブなダッシュボードが含まれています:
- 任意のモデルをクリックして完全な会話を表示する
- 各モデルがタスク中に何をしたかを正確に確認する
- モデルが実行中にどこで間違ったかを特定する
このツールはGitHubで公開されており、開発者が独自の評価を実行し、エージェントタスクにおけるローカルLLMのパフォーマンスを比較できます。
📖 Read the full source: r/openclaw
👀 See Also

オープンソースのGo移植版、Claude Code CLIが「claw-code-go」としてリリースされました
開発者dolm09が、Claude Code CLIの完全なGo移植版であるclaw-code-goをリリースしました。このプロジェクトは、1万行未満のコードで自己完結型のバイナリを生成し、bubbleteaを使用したTUI、マルチプロバイダーサポート、MCPクライアント、およびツール実行エンジンを備えています。

AIコーディングエージェントにおけるサイレントツール障害の検出:Vibeyard
Vibeyardは、AIコーディングエージェントがサイレントツール障害を経験した際に検出するツールです。エージェントが開発者に警告することなく代替戦略にフォールバックする状況を捉え、セッション中にこれらの非効率性を表面化させます。繰り返される非効率なワークフローを防ぐための修正を提案することができます。

パイロットコンソール:プライベートAIエージェントネットワーク管理用ウェブダッシュボード
ある開発者が、Pilot Protocolを基盤とするP2Pネットワーク層を使用して、プライベートAIエージェントネットワークを管理するためのウェブダッシュボード「Pilot Console」を構築しました。開発者はClaudeを活用してバックエンドAPIのルーティングを生成し、Reactダッシュボードの構造を設計することで、開発を加速させました。

二つの無料Claudeコードスキル:チュートリアル生成とプロンプト修正
2つの新しい無料Claude Codeスキル: create-tutorialは実際のプロジェクトファイルからコード読解チュートリアルを生成し、prompterは誤字だらけのプロンプトを実行可能な指示に書き換えます。両方ともMITライセンスで、GitHubからインストール可能です。