Flujo de trabajo estructurado supera al modo de planificación y a los superpoderes en el benchmark AI DES

Un post de Reddit comparte los resultados del nuevo benchmark de simulación de eventos discretos (DES) asistida por IA. El envío que utilizó el flujo de trabajo Ouroboros (ooo) dentro de Claude Code ocupó el primer lugar, superando tanto al modo plan integrado de Claude como a las pilas de superpoderes fat-skill.
Detalles del benchmark
El benchmark evalúa la comprensión completa de un sistema del mundo real: un sistema de acarreo minero con camiones, puntos de carga, puntos de descarga, rutas y colas. Los envíos se juzgan según:
- Comprensión de la estructura del sistema
- Abstracción en un modelo de simulación de eventos discretos
- Diseño de eventos, cambios de estado y KPIs
- Producción de código de simulación ejecutable
- Interpretación de resultados (cuellos de botella, rendimiento, tiempos de espera)
- Generación de artefactos legibles por humanos (diagramas de topología, animaciones)
Rendimiento de Ouroboros
El envío de Ouroboros incluyó código DES funcional, un diagrama de topología del sistema minero y una animación de camiones acarreando mineral. Notablemente, cuando el servidor MCP falló durante la ejecución, Ouroboros recurrió a una ruta basada en habilidades y completó la tarea, demostrando recuperación y redireccionamiento en despliegues reales.
Comparación
- Modo plan (planificación ligera): línea base decente
- Superpoderes / pilas fat-skill: peores que el modo plan en esta tarea
- Ouroboros (estructurado: clarificar → planificar → ejecutar → evaluar → recuperar → iterar): el mejor
El resultado sugiere que estructurar el flujo de trabajo en torno a la definición del problema, planificación, ejecución, evaluación y recuperación es más efectivo que acumular más instrucciones y habilidades más grandes.
Ouroboros: https://github.com/Q00/ouroboros
Benchmark: https://simulation-bench.fly.dev/
📖 Read the full source: r/ClaudeAI
👀 Ver también

Claude Code v2.1.202: Tamaños de flujo de trabajo dinámicos, /review revertido y más de 20 correcciones
Agrega ajuste dinámico de tamaño de flujo de trabajo en /config, revierte /review a una pasada única, corrige fallos de handshake mTLS, bucles de dictado por voz, reanudación lenta de sesión con muchos worktrees de git y más.
El costo ambiental de la IA: 945 TWh de energía y agua para 1.300 millones de personas para 2030
Un informe de la Universidad de la ONU cuantifica la huella de la IA en 2030: 945 TWh de electricidad, agua equivalente a las necesidades del África subsahariana y terreno dos veces el área de Yakarta.

Desarrollador Reemplaza Asistente Virtual de $25/hora con Agentes de IA, Enfrenta Implicaciones Éticas
Un desarrollador reemplazó a un asistente virtual de $25/hora con agentes de IA que manejan seguimientos, programación, seguimiento de leads y actualizaciones de CRM. La configuración de IA cuesta alrededor de $1,000/mes y realiza las tareas más rápido y de manera más consistente que el asistente humano.

Qwen 3.6 27B a 52.8 tps TG en AMD MI50s: Precisión completa, sin MTP, sin cuantización
Un usuario de Reddit evalúa Qwen3.6-27B en ocho AMD MI50 (tarjetas de 2018) usando un fork de vllm con ROCm 7.2.1, logrando 52.8 tps TG y 1569 tps PP con precisión completa y sin MTP.