Loop de Revisão Intermodelo para Agentes de Codificação de IA Detecta Falhas Críticas de Planejamento

✍️ OpenClawRadar📅 Publicado: April 16, 2026🔗 Source
Loop de Revisão Intermodelo para Agentes de Codificação de IA Detecta Falhas Críticas de Planejamento
Ad

Como Funciona a Revisão entre Modelos

Um desenvolvedor no r/ClaudeAI criou um sistema que aborda um problema comum com agentes de IA de codificação como Codex, Claude Code e Cursor: os planos são executados sem que ninguém questione suas premissas primeiro. A solução encaminha cada plano através de um segundo modelo de IA com arquitetura e dados de treinamento diferentes antes que a execução comece.

Detalhes Principais da Implementação

O modelo revisor é somente leitura e não pode tocar no código—ele só pode questionar o plano. Essa restrição é crítica porque "no momento em que pode editar, ele para de ser um crítico e começa a comprometer". O sistema executa um loop automático com um limite de rodadas: os planos voltam para revisão se problemas forem encontrados até que sejam aprovados ou atinjam o limite.

O que o Sistema Identifica

  • Planos de reversão que na verdade não revertem
  • Projetos de permissão com brechas de segurança reais
  • Portões de revisão tomando decisões de prosseguir/parar com base em estado desatualizado
  • Planos de múltiplas etapas que parecem coerentes até um segundo modelo percorrer todo o fluxo
Ad

Decisões Críticas de Design

  • Contexto de revisão delimitado impede que o revisor perca tempo lendo partes irrelevantes do repositório
  • Personas do revisor (risco de entrega, reprodutibilidade, custo de desempenho, conformidade de segurança) identificam diferentes tipos de problemas
  • Um painel TUI ao vivo mostra fase, rodada, veredito, gravidade, custo e histórico em uma única visualização de terminal
  • O sistema funciona com diferentes planejadores: Claude Code usa um gancho nativo ExitPlanMode enquanto Codex e outros orquestradores usam um portão explícito

Resultados Práticos

O desenvolvedor usou o sistema para ajudar a construí-lo: "Codex planejou, Claude revisou os planos, e o design convergiu através de múltiplas rodadas." A ferramenta é licenciada sob MIT e disponível como rival-review no GitHub.

📖 Read the full source: r/ClaudeAI

Ad

👀 See Also

Quatro Ganchos do Claude Impelem a Consistência de Voz e Tom em Textos Escritos por IA
Tools

Quatro Ganchos do Claude Impelem a Consistência de Voz e Tom em Textos Escritos por IA

Um desenvolvedor criou um sistema usando quatro ganchos do Claude Code para impedir que cópias geradas por IA se desviem da identidade da marca. O sistema bloqueia a edição de arquivos de cópia (.tsx, .md) até que um agente revisor valide o conteúdo em relação a um guia VOICE-AND-TONE.md.

OpenClawRadar
Alfred Beta Lançado: Alternativa Simplificada ao OpenClaw para Usuários Não Técnicos
Tools

Alfred Beta Lançado: Alternativa Simplificada ao OpenClaw para Usuários Não Técnicos

Alfred é uma nova ferramenta em beta que fornece aproximadamente 70% da funcionalidade do OpenClaw com complexidade significativamente reduzida, apresentando configurações padrão simples para conexões de aplicativos, memória, modos de uso e infraestrutura, enquanto permite personalização.

OpenClawRadar
7 comandos de barra, $0.45/post: Este pipeline do Claude Code executa uma operação completa de conteúdo SEO
Tools

7 comandos de barra, $0.45/post: Este pipeline do Claude Code executa uma operação completa de conteúdo SEO

Um desenvolvedor disponibilizou como open source um pipeline de 7 comandos do Claude Code que lida com pesquisa SEO, escrita, otimização e publicação. Custa $0,45/post (API Perplexity), é executado em 15 min/dia. Resultados: 18× mais impressões mensais em 12 meses.

OpenClawRadar
Pu.sh: Um Harness de Agente de Codificação com 400 Linhas de Script Shell do HN
Tools

Pu.sh: Um Harness de Agente de Codificação com 400 Linhas de Script Shell do HN

Pu.sh é um harness portátil para agentes de codificação em 400 linhas de shell (sh, curl, awk), suportando Anthropic + OpenAI, 7 ferramentas, REPL, checkpoint/resume e modo pipe — com 90 testes sem API.

OpenClawRadar