Clonando o harness gerador-avaliador da Anthropic com Kiro CLI: Construção de site em 12 iterações

✍️ OpenClawRadar📅 Publicado: May 17, 2026🔗 Source
Clonando o harness gerador-avaliador da Anthropic com Kiro CLI: Construção de site em 12 iterações
Ad

Um desenvolvedor replicou o design do harness Generator-Avaliador da Anthropic para aplicativos de longa duração, inspirado em GANs. A arquitetura: um Planejador (executado uma vez) e depois um loop Generator ↔ Avaliador por 12 iterações. Cada agente é um processo CLI separado com contexto compartilhado zero, comunicando-se apenas por meio de arquivos (spec.md, eval-report.md). O Avaliador usa Playwright para navegar no site ao vivo — não apenas ler o código.

Detalhes Principais da Arquitetura

  • Página limpa por invocação: Cada agente começa do zero, lê apenas seus arquivos de entrada. Previne ansiedade de contexto.
  • Playwright MCP para teste: Navega, clica, redimensiona viewports. Captura bugs visuais que a revisão de código nunca pegaria.
  • Habilidade de design frontend da Anthropic: Penaliza explicitamente padrões genéricos de IA (fonte Inter, gradientes roxos, layouts de cartão). Força a tomada de riscos criativa.
  • Iteração contínua, não repetir em caso de falha: Todas as 12 rodadas são executadas independentemente. Cada uma melhora.
Ad

Resultados e Estatísticas

Iteração 1: funcional, mas esquecível. Iteração 4: O Generator mudou para "Terminal Noir" — IBM Plex Mono, âmbar sobre preto, texturas de grão, scanlines. Iterações 5-12: polimento, acessibilidade, correções responsivas, suporte a movimento reduzido.

  • Tempo total: 3h 20min
  • Iterações: 12 (generator + avaliador cada)
  • Linhas de código escritas manualmente: 0 (alguns problemas visuais corrigidos depois)
  • Tecnologias: Next.js, Tailwind, Framer Motion, TypeScript

Resultado ao Vivo

https://mnemo-mcp.github.io/Mnemo/

Principal Conclusão

O modelo é o motor. O harness — restrições, loops de feedback e estrutura adversarial — determina se você obtém porcaria de IA ou algo genuinamente distinto.

📖 Leia a fonte completa: r/ClaudeAI

Ad

👀 See Also

Fluxo de Trabalho de Relatórios de Usuário do OpenClaw com Minimax 2.7 para Edição de Markdown
Use Cases

Fluxo de Trabalho de Relatórios de Usuário do OpenClaw com Minimax 2.7 para Edição de Markdown

Um usuário descreve o uso do Minimax 2.7 via Openrouter como uma alternativa de menor custo ao Claude Cowork para pesquisa e escrita em Markdown, integrando-o com OpenClaw, notas de voz no Telegram, Obsidian e Syncthing para um fluxo de trabalho de edição semi-ao vivo.

OpenClawRadar
Claude Code vs Codex: A Divisão do Fluxo de Trabalho de um Builder
Use Cases

Claude Code vs Codex: A Divisão do Fluxo de Trabalho de um Builder

Um desenvolvedor compartilha uma divisão prática: Claude Code para trabalho focado em repositório com diffs limpos, Codex para tarefas confusas que envolvem várias ferramentas, como navegador, documentação e teste de aplicativos.

OpenClawRadar
Usando o Claude Code para Corrigir Problemas de Configuração do OpenClaw
Use Cases

Usando o Claude Code para Corrigir Problemas de Configuração do OpenClaw

Um desenvolvedor usou o Claude Code para corrigir configurações do OpenClaw, heartbeat, memória, tarefas cron e outros problemas de configuração após falhar com a configuração manual e a troca de versões.

OpenClawRadar
Fadiga de Codificação Agentiva: Por Que Mais Agentes Não o Salvarão
Use Cases

Fadiga de Codificação Agentiva: Por Que Mais Agentes Não o Salvarão

O post no blog de Sid argumenta que a codificação agentiva comprime o fluxo natural do desenvolvimento, forçando os desenvolvedores a um ciclo constante de fadiga de decisão e esgotamento. A solução não são mais agentes — é uma verificação melhor, mas construir isso é um beco sem saída.

OpenClawRadar