Fluxo de trabalho estruturado supera modo de plano e superpoderes no benchmark AI DES

Uma publicação no Reddit compartilha resultados do novo benchmark de Simulação de Eventos Discretos (SED) assistida por IA. A submissão que utilizou o fluxo de trabalho Ouroboros (ooo) dentro do Claude Code ficou em 1º lugar, superando tanto o modo de planejamento nativo do Claude quanto as pilhas de 'superpoderes' de skills grossas.
Detalhes do benchmark
O benchmark testa a compreensão completa de um sistema real — um sistema de transporte em mina com caminhões, pontos de carregamento, pontos de descarga, rotas e filas. As submissões são julgadas em:
- Compreensão da estrutura do sistema
- Abstração em um modelo de simulação de eventos discretos
- Projeto de eventos, mudanças de estado e KPIs
- Produção de código de simulação executável
- Interpretação dos resultados (gargalos, throughput, tempos de espera)
- Geração de artefatos legíveis por humanos (diagramas de topologia, animações)
Desempenho do Ouroboros
A submissão do Ouroboros incluiu código SED funcional, um diagrama de topologia do sistema de mineração e uma animação dos caminhões transportando minério. Notavelmente, quando o servidor MCP falhou durante a execução, o Ouroboros recorreu a um caminho baseado em skills e concluiu a tarefa — demonstrando recuperação e redirecionamento em implantações reais.
Comparação
- Modo de planejamento (planejamento leve) — linha de base decente
- Superpoderes / pilhas de skills grossas — pior que o modo de planejamento nesta tarefa
- Ouroboros (estruturado: esclarecer → planejar → executar → avaliar → recuperar → iterar) — melhor
O resultado sugere que estruturar o fluxo de trabalho em torno da definição do problema, planejamento, execução, avaliação e recuperação é mais eficaz do que acumular mais instruções e skills maiores.
Ouroboros: https://github.com/Q00/ouroboros
Benchmark: https://simulation-bench.fly.dev/
📖 Leia a fonte completa: r/ClaudeAI
👀 See Also

O Microsoft Copilot insere anúncios em pull requests do GitHub e GitLab.
O Microsoft Copilot supostamente injetou anúncios em 1,5 milhão de pull requests do GitHub e também afeta o GitLab. Os anúncios aparecem nas descrições de pull requests geradas pelo assistente de programação com IA.

Na IA, os 41% Dependem dos -59%
O economista-chefe da Apollo detalha as margens de lucro da IA por camada da cadeia de valor: Modelos e Apps operam com -59%, enquanto Silício e Equipamentos chegam a 41%. O boom é financiado por investidores, não por clientes.

Os modelos Bonsai 1-bit Qwen da PrismML testados: 107 t/s de geração em 8GB de VRAM
Os modelos Bonsai da PrismML são versões quantizadas de 1 bit do Qwen3 8B, 4B e 1.7B que alcançam 107 tokens/segundo na geração e >1114 t/s no processamento de prompts em uma RTX 4060 com 8GB de VRAM, com requisitos de memória significativamente reduzidos.

Usuário do Claude Pro relata que janela de 5 horas de uso foi queimada com um único comando sem saída
Um usuário do Claude Pro relata que um único prompt consumiu toda a sua janela de uso de 5 horas, retornando apenas texto de planejamento e nenhuma entrega. O incidente destaca problemas com o consumo de tokens durante o raciocínio interno e a falta de salvaguardas.