Flujo de trabajo estructurado supera al modo de planificación y a los superpoderes en el benchmark AI DES

✍️ OpenClawRadar📅 Publicado: 1 de mayo de 2026🔗 Source
Flujo de trabajo estructurado supera al modo de planificación y a los superpoderes en el benchmark AI DES
Ad

Un post de Reddit comparte los resultados del nuevo benchmark de simulación de eventos discretos (DES) asistida por IA. El envío que utilizó el flujo de trabajo Ouroboros (ooo) dentro de Claude Code ocupó el primer lugar, superando tanto al modo plan integrado de Claude como a las pilas de superpoderes fat-skill.

Detalles del benchmark

El benchmark evalúa la comprensión completa de un sistema del mundo real: un sistema de acarreo minero con camiones, puntos de carga, puntos de descarga, rutas y colas. Los envíos se juzgan según:

  • Comprensión de la estructura del sistema
  • Abstracción en un modelo de simulación de eventos discretos
  • Diseño de eventos, cambios de estado y KPIs
  • Producción de código de simulación ejecutable
  • Interpretación de resultados (cuellos de botella, rendimiento, tiempos de espera)
  • Generación de artefactos legibles por humanos (diagramas de topología, animaciones)
Ad

Rendimiento de Ouroboros

El envío de Ouroboros incluyó código DES funcional, un diagrama de topología del sistema minero y una animación de camiones acarreando mineral. Notablemente, cuando el servidor MCP falló durante la ejecución, Ouroboros recurrió a una ruta basada en habilidades y completó la tarea, demostrando recuperación y redireccionamiento en despliegues reales.

Comparación

  • Modo plan (planificación ligera): línea base decente
  • Superpoderes / pilas fat-skill: peores que el modo plan en esta tarea
  • Ouroboros (estructurado: clarificar → planificar → ejecutar → evaluar → recuperar → iterar): el mejor

El resultado sugiere que estructurar el flujo de trabajo en torno a la definición del problema, planificación, ejecución, evaluación y recuperación es más efectivo que acumular más instrucciones y habilidades más grandes.

Ouroboros: https://github.com/Q00/ouroboros
Benchmark: https://simulation-bench.fly.dev/

📖 Read the full source: r/ClaudeAI

Ad

👀 Ver también

Claude Code v2.1.202: Tamaños de flujo de trabajo dinámicos, /review revertido y más de 20 correcciones
Noticias

Claude Code v2.1.202: Tamaños de flujo de trabajo dinámicos, /review revertido y más de 20 correcciones

Agrega ajuste dinámico de tamaño de flujo de trabajo en /config, revierte /review a una pasada única, corrige fallos de handshake mTLS, bucles de dictado por voz, reanudación lenta de sesión con muchos worktrees de git y más.

OpenClawRadar
🦀
Noticias

El costo ambiental de la IA: 945 TWh de energía y agua para 1.300 millones de personas para 2030

Un informe de la Universidad de la ONU cuantifica la huella de la IA en 2030: 945 TWh de electricidad, agua equivalente a las necesidades del África subsahariana y terreno dos veces el área de Yakarta.

OpenClawRadar
Desarrollador Reemplaza Asistente Virtual de $25/hora con Agentes de IA, Enfrenta Implicaciones Éticas
Noticias

Desarrollador Reemplaza Asistente Virtual de $25/hora con Agentes de IA, Enfrenta Implicaciones Éticas

Un desarrollador reemplazó a un asistente virtual de $25/hora con agentes de IA que manejan seguimientos, programación, seguimiento de leads y actualizaciones de CRM. La configuración de IA cuesta alrededor de $1,000/mes y realiza las tareas más rápido y de manera más consistente que el asistente humano.

OpenClawRadar
Qwen 3.6 27B a 52.8 tps TG en AMD MI50s: Precisión completa, sin MTP, sin cuantización
Noticias

Qwen 3.6 27B a 52.8 tps TG en AMD MI50s: Precisión completa, sin MTP, sin cuantización

Un usuario de Reddit evalúa Qwen3.6-27B en ocho AMD MI50 (tarjetas de 2018) usando un fork de vllm con ROCm 7.2.1, logrando 52.8 tps TG y 1569 tps PP con precisión completa y sin MTP.

OpenClawRadar