Rival-Review: Um Ciclo de Revisão Intermodelos para Planos de Agentes de IA

O Que É
Rival-review é uma ferramenta que aborda um padrão comum em que agentes de IA de codificação criam planos que parecem plausíveis e começam a execução sem serem devidamente testados sob pressão. A ideia central é simples: o modelo que propõe o plano não é o modelo que o revisa.
Como Funciona
O ciclo é direto:
- O planejador escreve um plano
- Claude o revisa com base no contexto delimitado
- Problemas são devolvidos para revisão
- O ciclo continua até que a aprovação seja obtida ou o número máximo de rodadas seja atingido
O segundo modelo audita o plano em uma passagem somente leitura antes do início da implementação. Essa revisão entre modelos captura questões que vão além de simples "polimento do plano":
- Planos de reversão que na verdade não revertem as alterações
- Projetos de permissão com vulnerabilidades reais de segurança
- Portões de revisão que tomam decisões de prosseguir/parar com base em estado desatualizado
- Planos de múltiplas etapas que parecem coerentes até que um segundo modelo percorra todo o fluxo
Principais Escolhas de Design
Várias escolhas de design acabaram sendo muito importantes:
- O revisor deve ser somente leitura
- O ciclo automático precisa de um limite rígido de rodadas
- O contexto delimitado importa muito
- Um painel de terminal ao vivo torna o ciclo de revisão inspecionável em vez de opaco
Detalhes de Implementação
A ferramenta funciona com diferentes planejadores:
- Claude Code pode usar um gancho nativo de saída de plano
- Codex e outros orquestradores podem usar um portão de planejamento explícito
O criador a usou para ajudar a construir a própria ferramenta: Codex planejou, Claude revisou, e o design convergiu ao longo de múltiplas rodadas.
Disponibilidade
A ferramenta é licenciada pelo MIT e está disponível no GitHub em github.com/alexw5702-afk/rival-review.
📖 Read the full source: r/LocalLLaMA
👀 See Also

CipherClaw: Usando uma Persona de Segurança para Auditar Código com Claude
Um desenvolvedor utilizou o CipherClaw, uma persona CLAUDE.md chamada TALON, para fazer o Claude Code pensar como um arquiteto de segurança. Executá-lo em um aplicativo Next.js revelou 17 descobertas de segurança, incluindo vulnerabilidades críticas como endpoints não autenticados retornando dados de administrador e tokens de autenticação embutidos no código.

SkyClaw: Runtime de Agente de IA Autônomo Baseado em Rust
SkyClaw é um runtime autônomo para agentes de IA construído em Rust com um binário de 7,1 MB que fica ocioso com 14 MB de RAM e inicia em menos de um segundo. Ele opera com cinco princípios de engenharia, incluindo autonomia, robustez e eficiência brutal.

A Ilusão do Trabalho Concluído no Claude Code: Por Que Revisar o Caminho do Agente Importa Mais do que o Diff
Claude Code pode gerar um diff limpo, testes que passam e um bom resumo — mas ainda assim perder problemas reais de comportamento, segurança ou restrições de arquitetura. O autor argumenta que revisar a cadeia de ações (planos, arquivos lidos, comandos executados, saída de testes) agora é essencial, não apenas o diff final.

CrabMeat v0.1.0: Um Gateway de Agente Centrado em Segurança que Não Confia no LLM com o Limite de Segurança
CrabMeat v0.1.0 é um gateway WebSocket para cargas de trabalho LLM agentivas que impõe segurança no nível arquitetural: indireção de IDs de capacidade, classes de efeito, instruções fixas IRONCLAD_CONTEXT, cadeia de auditoria à prova de adulteração, filtro de vazamento de saída em streaming e sem modo YOLO.