AIコーディングエージェントのためのクロスモデルレビューループが重大な設計上の欠陥を捕捉

クロスモデルレビューの仕組み
r/ClaudeAIの開発者が、Codex、Claude Code、CursorなどのAIコーディングエージェントに共通する問題に対処するシステムを構築しました。その問題とは、計画が誰にも仮定を検証されることなく実行されてしまうことです。この解決策では、実行開始前にすべての計画を、異なるアーキテクチャとトレーニングデータを持つ第二のAIモデルにルーティングします。
主要な実装詳細
レビュアーモデルは読み取り専用で、コードに触れることはできません。計画に対して異議を唱えることしかできません。この制約は、「編集できるようになった瞬間、それは批評家ではなくなり、妥協を始める」ため、非常に重要です。システムはラウンド上限付きの自動ループを実行します。問題が見つかった場合、計画は修正のために戻され、合格するか上限に達するまで繰り返されます。
システムが検出するもの
- 実際にはロールバックしないロールバック計画
- 実際のセキュリティホールがある権限設計
- 古い状態から進める/進めないの決定を行うレビューゲート
- 第二のモデルが全体の流れを追跡するまで首尾一貫しているように聞こえる多段階計画
重要な設計上の決定
- スコープ付きレビューコンテキストにより、レビュアーがリポジトリの無関係な部分を読む時間を無駄にすることが防止されます
- レビュアーのペルソナ(デリバリーリスク、再現性、パフォーマンスコスト、安全性コンプライアンス)により、異なる種類の問題が検出されます
- ライブTUIダッシュボードは、フェーズ、ラウンド、判定、重大度、コスト、履歴を1つのターミナルビューで表示します
- システムは異なるプランナーと連携します。Claude CodeはネイティブのExitPlanModeフックを使用し、Codexやその他のオーケストレーターは明示的なゲートを使用します
実際の成果
開発者はこのシステムを、システム自体の構築に役立てました。「Codexが計画し、Claudeが計画をレビューし、設計は複数ラウンドにわたって収束しました。」このツールはMITライセンスで、GitHubでrival-reviewとして利用可能です。
📖 Read the full source: r/ClaudeAI
👀 See Also

ユーザーエクスペリエンス:ローカルLLMでのOpenClawからHermes Agentへの切り替え
ある開発者が、RX 9070 XT(16GB VRAM)上でQwen3.5-9Bを使用し、OpenClawからHermes Agentに切り替えた経験を報告しました。Hermesは複雑なタスクを5回の正しいツール呼び出しで完了し、OpenClawの50以上のステップと比較して2分30秒速く、RAG、ツール呼び出し、永続メモリ機能を維持しながら実行されました。

clarp: 6月15日の従量課金前におけるClaude-pのオープンソース代替ツール
Claude -p は 6 月 15 日から従量課金制に移行します。clarp は、ローカルワークフロー向けのオープンソース CLI で、バイナリ名を claude から clarp に変更するだけで置き換えられます。

Claude Code v2.1.141: 新環境変数、フック機能の拡張、およびバグ修正
AnthropicがClaude Code v2.1.141をリリース。新しい環境変数(CLAUDE_CODE_PLUGIN_PREFER_HTTPS、ANTHROPIC_WORKSPACE_ID)、hooks用のterminalSequenceフィールド、カレントワーキングディレクトリによるエージェント一覧表示、そして20以上のバグ修正を含む。

スタンフォード大学の研究者がOpenJarvisを公開:オンデバイスAIエージェントのためのローカルファーストフレームワーク
スタンフォード大学の研究者が、ツール、メモリ、学習機能を備えたオンデバイス個人AIエージェント構築のためのローカルファーストフレームワーク「OpenJarvis」を公開しました。このプロジェクトには、開発者が探索できるGitHubリポジトリとウェブサイトリンクが含まれています。