Rival-Review: Um Ciclo de Revisão Intermodelos para Planos de Agentes de IA

O Que É
Rival-review é uma ferramenta que aborda um padrão comum em que agentes de IA de codificação criam planos que parecem plausíveis e começam a execução sem serem devidamente testados sob pressão. A ideia central é simples: o modelo que propõe o plano não é o modelo que o revisa.
Como Funciona
O ciclo é direto:
- O planejador escreve um plano
- Claude o revisa com base no contexto delimitado
- Problemas são devolvidos para revisão
- O ciclo continua até que a aprovação seja obtida ou o número máximo de rodadas seja atingido
O segundo modelo audita o plano em uma passagem somente leitura antes do início da implementação. Essa revisão entre modelos captura questões que vão além de simples "polimento do plano":
- Planos de reversão que na verdade não revertem as alterações
- Projetos de permissão com vulnerabilidades reais de segurança
- Portões de revisão que tomam decisões de prosseguir/parar com base em estado desatualizado
- Planos de múltiplas etapas que parecem coerentes até que um segundo modelo percorra todo o fluxo
Principais Escolhas de Design
Várias escolhas de design acabaram sendo muito importantes:
- O revisor deve ser somente leitura
- O ciclo automático precisa de um limite rígido de rodadas
- O contexto delimitado importa muito
- Um painel de terminal ao vivo torna o ciclo de revisão inspecionável em vez de opaco
Detalhes de Implementação
A ferramenta funciona com diferentes planejadores:
- Claude Code pode usar um gancho nativo de saída de plano
- Codex e outros orquestradores podem usar um portão de planejamento explícito
O criador a usou para ajudar a construir a própria ferramenta: Codex planejou, Claude revisou, e o design convergiu ao longo de múltiplas rodadas.
Disponibilidade
A ferramenta é licenciada pelo MIT e está disponível no GitHub em github.com/alexw5702-afk/rival-review.
📖 Read the full source: r/LocalLLaMA
👀 See Also

Gemma 4 26B vs Qwen 3.5 27B: Benchmark de Fluxo de Trabalho Empresarial Local em RTX 4090
Um desenvolvedor testou o Gemma 4 26B e o Qwen 3.5 27B em uma estação de trabalho RTX 4090 para 18 tarefas reais de operador de negócios. O Gemma venceu por 13 a 5, mostrando velocidade mais rápida e melhor disciplina para trabalho de execução diária, enquanto o Qwen se destacou em pensamento estratégico mais amplo.

Plugin OpenClaw Context Meter Mostra Porcentagem de Uso de Token do Telegram
Um novo plugin OpenClaw exibe a porcentagem de uso de tokens após cada resposta do bot do Telegram, mostrando valores como '45k / 200k (22%)' e detectando eventos de compactação. O plugin evita problemas de OOM ao codificar as janelas de contexto em vez de usar execSync.

OpenLobster: Agente de IA Auto-hospedado em Go com Pegada de 30MB de RAM
OpenLobster é um assistente de IA auto-hospedado escrito em Go que roda como um único binário com uso de 30MB de RAM e inicialização a frio de 200ms. Ele suporta múltiplos provedores de LLM incluindo Ollama, OpenRouter e qualquer endpoint compatível com OpenAI, com memória armazenada em um banco de dados de grafos.

HN SOTA: Rastreando a Popularidade de Modelos de Codificação via Comentários do Hacker News
HN SOTA é um pipeline atualizado diariamente que coleta comentários do Hacker News, usa o Gemini para identificar modelos de codificação da lista do OpenRouter e registra o sentimento por menção em uma planilha pública do Google. Os 10 principais modelos por menções em uma janela de 10 dias são exibidos.