AIエージェントの一貫性に関する研究:主要な知見と実践的ポイント

エージェントの一貫性に関する研究結果
r/ClaudeAIで共有された研究は、AIエージェント開発における重要な課題である「自己矛盾」を調査しています。これは、同一のタスクに対してエージェントが異なる回答を出す現象です。この研究では、3つの主要モデルを用いて、一貫したプロンプトと入力による3,000件の実験が実施されました。
主要な性能指標
- 一貫性のあるエージェントは80〜92%の精度を達成
- 一貫性のないエージェントは25〜60%の精度に低下
- これは32〜55ポイントの性能差に相当
乖離パターン
研究では、エージェントの一貫性の欠如に特定のパターンを特定しました:
- 乖離の69%は最初のツール呼び出しで発生
- 初期検索クエリが重要な失敗ポイント
- 正しい初期呼び出しは下流での収束につながる
- 誤った初期呼び出しは実行を散乱させる
実用的な診断シグナル
パス長は低コストな診断シグナルとして機能します:3ステップのタスクで8ステップを要するエージェントは、通常、詳細ではなく「迷子」状態です。
即時テストの推奨
実用的な教訓は明確です:エージェントを3〜5回並行して実行してください。軌跡が一致すれば出力を信頼できます。散乱する場合は、その実装をリリースすべきではありません。
研究リソース
完全な論文はhttps://arxiv.org/abs/2602.11619で入手可能で、詳細な解説はhttps://amcortex.substack.com/p/run-your-agent-10-times-you-wontに掲載されています。
📖 完全なソースを読む: r/ClaudeAI
👀 See Also

アンソロピック、新クレジットシステムでOpenClawを制限:詳細と影響
Anthropicが再びOpenClawを制限します。2026年6月15日より、プログラムによるすべての利用は、月間上限付きで繰り越し不可の別のクレジットプールに移行し、APIレート超過課金が適用されます。

Claude Code v2.1.68: Opus 4.6はデフォルトで中程度の労力を設定し、ultrathinkキーワードを再導入しました
Claude Code v2.1.68では、MaxおよびTeamサブスクライバー向けにOpus 4.6のデフォルト努力レベルをmediumに変更し、高努力のための「ultrathink」キーワードを再導入し、旧Opus 4および4.1モデルをファーストパーティAPIから削除しました。

DeepSeek有料APIがプロンプトをトレーニングに使用 — OpenClawユーザーが知っておくべきこと
DeepSeekの公式APIは、有料ティアであってもプロンプトをトレーニングに使用します。Geminiは無料のAI Studioでのみログを記録します。OpenClawは現在デフォルトでDeepSeek V4 Flashを使用しています。個人データを処理する際は注意してください。

Claude Code v2.1.136: オートモードでのハード拒否、MCP OAuth修正、40以上のバグ修正
Anthropicは、自動モード分類ルールのhard_deny設定、/clear後のMCPサーバー消失の修正、OAuthトークン更新の同時実行問題、および40以上のバグ修正を含むClaude Code v2.1.136をリリースしました。