Flujo de Trabajo del Consejo Multi-Modelo para Agentes de Codificación de IA

Un desarrollador ha creado una herramienta de flujo de trabajo basada en web que utiliza múltiples modelos de IA para revisar tareas de programación antes de pasarlas a agentes de programación. En lugar de solicitar directamente a un agente, la herramienta implementa un enfoque de "consejo" donde diferentes modelos analizan primero la tarea.
Cómo funciona el consejo
El flujo de trabajo ejecuta tres modelos específicos con roles distintos:
- Arquitecto (GPT-4o): Redacta un plan utilizando tu base de código real
- Escéptico (Claude): Intenta desmontar el plan y encontrar casos límite
- Sintetizador (Gemini): Reconstruye el plan en un prompt listo para agentes
Detalles de la herramienta
Los usuarios pegan su idea y opcionalmente suben archivos del proyecto. El sintetizador crea un archivo PLAN.md con restricciones explícitas "NO HACER" extraídas de tus patrones de programación. El desarrollador señala que adjuntar este PLAN.md como @PLAN.md en la interfaz Composer de Claude cambia notablemente lo que hace el agente de programación.
La herramienta está disponible en https://council-gray.vercel.app y requiere que los usuarios aporten sus propias claves de API. Nada se almacena en el servidor.
El desarrollador construyó esto después de observar que algunas personas ya estaban haciendo revisiones similares con múltiples modelos manualmente en pestañas del navegador. Están buscando comentarios sobre si este enfoque realmente mejora la salida o si es sobreingeniería en su flujo de trabajo.
📖 Read the full source: r/ClaudeAI
👀 Ver también

Planificación de modo de refactorización Claude Code Prompt Improver v0.5.3 e investigación priorizando subagentes
v0.5.3 añade un hook PreToolUse para mejorar la legibilidad del modo plan (reescrituras limpias, sin historial de decisiones) y traslada la investigación de prompts vagos a subagentes Task/Explore en Haiku para ahorrar tokens del contexto principal. El plugin ahora funciona en Windows y tiene más de 1.4K estrellas en GitHub.

Resultados de Referencia para Modelos Locales Pequeños y de OpenRouter en la Tarea Agéntica de Texto a SQL
Un desarrollador probó múltiples modelos locales pequeños y de OpenRouter utilizando un punto de referencia personalizado de agente de texto a SQL que convierte consultas en inglés a SQL con rondas de depuración. El punto de referencia incluye 25 preguntas, se ejecuta en menos de 5 minutos y revela a los mejores modelos como kimi-k2.5 y variantes de Qwen 3.5.

Mi Agente Construyó Su Propio Sistema de Interocepción — Ahora Tiene Deseos

Pruebas de referencia de tonterías: resistencia de LLM a indicaciones sin sentido
El Bullshit Benchmark evalúa si los modelos de IA identifican y rechazan indicaciones obviamente absurdas en lugar de generar respuestas incorrectas con confianza. Los resultados muestran que los modelos Claude tienen un rendimiento significativamente mejor que los modelos Gemini en la detección de preguntas sin sentido.