Clonando o harness gerador-avaliador da Anthropic com Kiro CLI: Construção de site em 12 iterações

Um desenvolvedor replicou o design do harness Generator-Avaliador da Anthropic para aplicativos de longa duração, inspirado em GANs. A arquitetura: um Planejador (executado uma vez) e depois um loop Generator ↔ Avaliador por 12 iterações. Cada agente é um processo CLI separado com contexto compartilhado zero, comunicando-se apenas por meio de arquivos (spec.md, eval-report.md). O Avaliador usa Playwright para navegar no site ao vivo — não apenas ler o código.
Detalhes Principais da Arquitetura
- Página limpa por invocação: Cada agente começa do zero, lê apenas seus arquivos de entrada. Previne ansiedade de contexto.
- Playwright MCP para teste: Navega, clica, redimensiona viewports. Captura bugs visuais que a revisão de código nunca pegaria.
- Habilidade de design frontend da Anthropic: Penaliza explicitamente padrões genéricos de IA (fonte Inter, gradientes roxos, layouts de cartão). Força a tomada de riscos criativa.
- Iteração contínua, não repetir em caso de falha: Todas as 12 rodadas são executadas independentemente. Cada uma melhora.
Resultados e Estatísticas
Iteração 1: funcional, mas esquecível. Iteração 4: O Generator mudou para "Terminal Noir" — IBM Plex Mono, âmbar sobre preto, texturas de grão, scanlines. Iterações 5-12: polimento, acessibilidade, correções responsivas, suporte a movimento reduzido.
- Tempo total: 3h 20min
- Iterações: 12 (generator + avaliador cada)
- Linhas de código escritas manualmente: 0 (alguns problemas visuais corrigidos depois)
- Tecnologias: Next.js, Tailwind, Framer Motion, TypeScript
Resultado ao Vivo
https://mnemo-mcp.github.io/Mnemo/
Principal Conclusão
O modelo é o motor. O harness — restrições, loops de feedback e estrutura adversarial — determina se você obtém porcaria de IA ou algo genuinamente distinto.
📖 Leia a fonte completa: r/ClaudeAI
👀 See Also

O fluxo de trabalho Claude MCP automatiza o reengajamento de leads no LinkedIn com restrições adaptativas
Um desenvolvedor criou um fluxo de trabalho usando Claude com MCP para reengajar automaticamente conexões antigas do LinkedIn, identificando leads, gerando mensagens contextuais e lidando com restrições da plataforma de forma adaptativa. De 7 leads direcionados, 5 mensagens foram enviadas com sucesso enquanto 2 foram ignoradas devido a restrições do LinkedIn.

Desenvolvedor Lança Jogo HTML5 Usando a Versão Gratuita do Claude Chat
Um desenvolvedor com 20 anos de experiência em programação de jogos em C utilizou a versão gratuita do Claude Chat para criar um jogo de tiro espacial moderno em HTML5 ao longo de 30 dias, trabalhando cerca de uma hora por dia. O jogo inclui sons procedurais, IA de inimigos, sistemas de aprimoramento e mecânicas de ondas.

Movendo a lógica do agente de IA para YAML: Execute pelo Telegram, VS Code e CLI
Um desenvolvedor moveu sua lógica de negócios do agente de IA para fora do OpenClaw para um arquivo YAML, usando o OE Runtime como servidor HTTP. O mesmo agent.yaml agora roda a partir do Telegram, VS Code, CLI e HTTP sem duplicação.

Opus 4.8 vs Sonnet 4.6 para Análises: Dados Reais de um Painel SaaS
Uma SaaS com 310 clientes profissionais testou Claude Opus 4.8 vs Sonnet 4.6 para análise de tendências, resumos mensais e detecção de anomalias. Opus detectou anomalias sutis que Sonnet perdeu, mas custou 2,1x por chamada.