ライバルレビュー:AIエージェント計画のためのクロスモデルレビューループ

概要
Rival-reviewは、AIコーディングエージェントが適切なプレッシャーテストなしに実行を開始する、もっともらしい計画を立てるという一般的なパターンに対処するツールです。核となる考え方はシンプルで、計画を提案するモデルとレビューするモデルを分けることです。
仕組み
ループはシンプルです:
- プランナーが計画を作成
- Claudeがスコープされたコンテキストに対してレビュー
- 問題点は修正のために戻される
- ゲートが通過するか最大ラウンドに達するまでループ継続
第2のモデルは、実装開始前に読み取り専用パスで計画を監査します。このクロスモデルレビューは、単なる「計画の磨き上げ」以上のものを検出します:
- 実際にはロールバックしないロールバック計画
- 実際のセキュリティホールがある権限設計
- 古い状態から進める/中止する決定を行うレビューゲート
- 第2のモデルが全体の流れを確認するまで一貫しているように聞こえる多段階計画
主要な設計上の選択
いくつかの設計上の選択が非常に重要であることが判明しました:
- レビュアーは読み取り専用でなければならない
- 自動ループには厳格なラウンド上限が必要
- スコープされたコンテキストが非常に重要
- ライブターミナルダッシュボードにより、レビューループが不透明ではなく検査可能になる
実装の詳細
このツールはさまざまなプランナーと連携します:
- Claude Codeはネイティブの計画終了フックを使用可能
- Codexやその他のオーケストレーターは明示的なプランナーゲートを使用可能
作成者は、このツール自体の構築に活用しました:Codexが計画を立て、Claudeがレビューし、設計は複数ラウンドにわたって収束しました。
入手方法
このツールはMITライセンスで、GitHubで入手可能です:github.com/alexw5702-afk/rival-review。
📖 Read the full source: r/LocalLLaMA
👀 See Also

Visdiff: Claudeのフロントエンドコード生成のための視覚的フィードバックループ
Visdiffは、Claudeのフロントエンドコード生成における視覚的な精度のギャップに対処します。レンダリングされた出力をFigmaデザインとピクセル単位で比較し、差異をループにフィードバックして一致するまで繰り返します。

OpenClawエージェントのためのHarrier埋め込みを用いた局所意味記憶検索
MicrosoftのHarrierモデルを使用してローカル埋め込みサーバーを実行し、Ollama互換APIを公開、OpenClawのmemorySearch設定を接続して、外部サービスを使わずにローカルセマンティックメモリ検索を実現する方法。

cortex-engine MCPサーバーは、永続メモリとマルチエージェントサポートを追加します
cortex-engine v0.4.0は、AIエージェントに永続的な長期記憶を提供するオープンソースのMCPサーバーです。observe()、query()、believe()、dream()などのツールを備えており、複数のエージェントを分離されたメモリ名前空間でサポートするようになりました。

AIコードレビューベンチマーク:Claude、Gemini、Codex、Qwen、MiniMaxの比較
ベンチマークテストでは、既知のバグを含む15件のMilvusプルリクエストに対して5つのAIモデルを評価しました。Claudeは生モードで53%のバグを検出し、モデル間の敵対的議論により検出率は80%に向上しました。