Rival-Review: Ein Cross-Modell-Review-Loop für KI-Agenten-Pläne

Was es ist
Rival-review ist ein Tool, das ein häufiges Muster angeht, bei dem KI-Coding-Agenten plausibel klingende Pläne erstellen, die mit der Ausführung beginnen, ohne angemessen auf ihre Robustheit geprüft worden zu sein. Die Kernidee ist einfach: Das Modell, das den Plan vorschlägt, ist nicht das Modell, das ihn überprüft.
Wie es funktioniert
Der Ablauf ist unkompliziert:
- Der Planer schreibt einen Plan
- Claude überprüft ihn anhand des definierten Kontexts
- Probleme gehen zur Überarbeitung zurück
- Die Schleife wird fortgesetzt, bis die Prüfung bestanden ist oder die maximale Rundenanzahl erreicht ist
Das zweite Modell überprüft den Plan in einem schreibgeschützten Durchlauf, bevor die Implementierung beginnt. Diese übergreifende Modellprüfung erkennt Dinge, die über reine "Planpolitur" hinausgehen:
- Rollback-Pläne, die tatsächlich kein Rollback durchführen
- Berechtigungskonzepte mit echten Sicherheitslücken
- Prüfschritte, die Go/No-Go-Entscheidungen auf Basis veralteter Zustände treffen
- Mehrstufige Pläne, die kohärent klingen, bis ein zweites Modell den gesamten Ablauf durchgeht
Wesentliche Design-Entscheidungen
Mehrere Design-Entscheidungen erwiesen sich als sehr wichtig:
- Der Prüfer muss schreibgeschützt arbeiten
- Die automatische Schleife benötigt eine feste Rundenobergrenze
- Ein klar definierter Kontext ist sehr wichtig
- Ein Live-Terminal-Dashboard macht die Prüfschleife einsehbar statt undurchsichtig
Implementierungsdetails
Das Tool funktioniert mit verschiedenen Planern:
- Claude Code kann einen nativen Plan-Exit-Hook nutzen
- Codex und andere Orchestratoren können eine explizite Planer-Prüfung verwenden
Der Ersteller nutzte es, um es selbst mit aufzubauen: Codex plante, Claude überprüfte, und das Design entwickelte sich über mehrere Runden hinweg.
Verfügbarkeit
Das Tool ist unter MIT-Lizenz verfügbar und auf GitHub zu finden unter github.com/alexw5702-afk/rival-review.
📖 Read the full source: r/LocalLLaMA
👀 Siehe auch

Foreman: Open-Source-Slack-Bot für die Fernsteuerung von lokalem Claude-Code
Foreman ist ein kostenloser, quelloffener Slack-Bot, der eine Fernsteuerung für lokal laufende Claude Code-Instanzen bereitstellt. Er ermöglicht Entwicklern, Aufgaben von ihrem Handy an Claude zu senden, während sie weiterhin vollen lokalen Zugriff auf Dateisystem, Tools und Umgebung behalten.

Meisterung der Antropic-Abonnement-Modi: Haiku, Sonett und Opus
Entdecken Sie die innovativen Abonnements von Antropic – Haiku, Sonett und Opus – die darauf ausgelegt sind, Ihr KI-Coding-Erlebnis mit maßgeschneiderten Funktionen und Preisen zu verbessern.

Contrails: Frühes Alpha-Externes Governance-Layer für KI-Agenten
Constrails ist eine externe Laufzeit-Governance-Schicht für KI-Agenten, die eine Kontrollebene zwischen Agenten und ihren Werkzeugen platziert. Sie implementiert Fähigkeitsprüfungen, Risikobewertungen, Richtlinienauswertungen und Audit-Protokollierung. Das frühe Alpha-Projekt zielt darauf ab, Sicherheitsbedenken zu adressieren, indem Kontrollen außerhalb des Agenten selbst verlagert werden.

NGX-OS: Netzwerkbetriebssystem für KI entwickelt mit eBPF und MCP-Integration
NGX-OS ist ein Netzwerkbetriebssystem, das von Grund auf für die KI-Integration entwickelt wurde und eBPF für Echtzeit-Telemetrie sowie MCP für den direkten Zugriff von LLMs auf Netzwerkstatusdaten ohne Übersetzungsschichten nutzt.