Rival-Review : Une boucle d'évaluation croisée pour les plans d'agents IA

✍️ OpenClawRadar📅 Publié: April 15, 2026🔗 Source
Rival-Review : Une boucle d'évaluation croisée pour les plans d'agents IA
Ad

Ce que c'est

Rival-review est un outil qui aborde un schéma courant où les agents d'IA de codage élaborent des plans plausibles qui démarrent l'exécution sans avoir été correctement testés sous pression. L'idée centrale est simple : le modèle qui propose le plan n'est pas celui qui le révise.

Comment ça fonctionne

La boucle est simple :

  • Le planificateur écrit un plan
  • Claude le révise par rapport au contexte défini
  • Les problèmes sont renvoyés pour révision
  • La boucle continue jusqu'à ce que la validation soit passée ou que le nombre maximal de tours soit atteint

Le second modèle audite le plan en lecture seule avant le début de l'implémentation. Cette révision croisée entre modèles détecte des éléments qui ne sont pas seulement des "améliorations de plan" :

  • Des plans de retour arrière qui ne permettent pas réellement de revenir en arrière
  • Des conceptions d'autorisations avec de véritables failles de sécurité
  • Des portes de révision prenant des décisions d'approbation/rejet basées sur des états obsolètes
  • Des plans multi-étapes qui semblent cohérents jusqu'à ce qu'un second modèle parcoure l'ensemble du flux
Ad

Choix de conception clés

Plusieurs choix de conception se sont avérés très importants :

  • Le réviseur doit être en lecture seule
  • La boucle automatique nécessite une limite stricte de tours
  • Le contexte défini est très important
  • Un tableau de bord de terminal en direct rend la boucle de révision inspectable au lieu d'être opaque

Détails d'implémentation

L'outil fonctionne avec différents planificateurs :

  • Claude Code peut utiliser un crochet natif de sortie de plan
  • Codex et autres orchestrateurs peuvent utiliser une porte de planification explicite

Le créateur l'a utilisé pour aider à le construire lui-même : Codex a planifié, Claude a révisé, et la conception a convergé sur plusieurs tours.

Disponibilité

L'outil est sous licence MIT et disponible sur GitHub à github.com/alexw5702-afk/rival-review.

📖 Read the full source: r/LocalLLaMA

Ad

👀 See Also

Pipeline de Contenu Multi-Agent pour le Code Claude avec Portes de Qualité
Tools

Pipeline de Contenu Multi-Agent pour le Code Claude avec Portes de Qualité

Un développeur a créé un pipeline de contenu à six agents pour Claude Code qui sépare les tâches de recherche, rédaction, édition et SEO avec des contrôles qualité entre les étapes. Le système s'arrête pour une approbation manuelle avant publication et permet des réexécutions individuelles des agents.

OpenClawRadar
Compétence d'Audit SEO OpenClaw Lancée pour l'Analyse Technique de Sites Web
Tools

Compétence d'Audit SEO OpenClaw Lancée pour l'Analyse Technique de Sites Web

Une nouvelle compétence OpenClaw effectue des audits SEO complets avec la commande 'seo audit [url]', vérifiant le SEO technique, la qualité du contenu, les éléments on-page, les données structurées, les métriques de performance, les images et la préparation à la recherche IA, produisant un score de santé et un plan d'action priorisé.

OpenClawRadar
Prompt-Master : Compétence Claude pour générer des invites précises d'outils d'IA
Tools

Prompt-Master : Compétence Claude pour générer des invites précises d'outils d'IA

Prompt-Master est une compétence Claude gratuite qui rédige des prompts précis pour divers outils d'IA, notamment Cursor, Claude Code, GPT, Midjourney, Kling et Eleven Labs. L'outil a atteint plus de 600 étoiles sur GitHub et traite plus de 4000 visites.

OpenClawRadar
Méthode d'Évolution du Code Triple les Performances des LLM sur le Benchmark ARC-AGI-2
Tools

Méthode d'Évolution du Code Triple les Performances des LLM sur le Benchmark ARC-AGI-2

Les chercheurs ont obtenu une amélioration de 2,8x sur le benchmark ARC-AGI-2 en utilisant l'évolution de code avec des modèles à poids ouvert, atteignant 34 % de précision à 2,67 $ par tâche. La même méthode a permis à Gemini 3.1 Pro d'atteindre 95 % de précision à 8,71 $ par tâche.

OpenClawRadar