Los agentes de codificación con IA tienen dificultades para gestionar el contexto en bases de código grandes.

El cuello de botella de la ejecución no es el problema
Observaciones del uso en bases de código reales muestran que los agentes de codificación con IA dedican consistentemente un tiempo significativo al descubrimiento en lugar de a la ejecución. Cada vez que un agente aborda una nueva tarea, realiza entre 15 y 20 llamadas a herramientas para actividades de orientación, que incluyen:
- Buscar rutas con grep
- Leer middleware
- Verificar tipos
Para cuando el agente comienza a escribir código, ya ha consumido una parte sustancial de su ventana de contexto en trabajo de descubrimiento.
Evidencia de enfoques simplificados
Vercel demostró este problema desde la dirección opuesta al eliminar el 80% de las herramientas de su agente y darle acceso a bash en su lugar. Este enfoque resultó en un 100% de precisión, sugiriendo que la capacidad de ejecución no es el factor limitante.
De manera similar, Pi (el agente de codificación minimalista) prueba el mismo punto con solo 4 herramientas y un prompt de sistema que contiene menos de 1.000 tokens.
El verdadero desafío: Gestión del contexto
Si la ejecución está efectivamente resuelta, el problema realmente difícil se convierte en la gestión del contexto. Varios factores contribuyen a este desafío:
- Las bases de código grandes no caben en ninguna ventana de contexto actual
- Las tareas largas acumulan salidas de herramientas que desplazan el razonamiento inicial fuera de la ventana de atención
- Los entornos dinámicos cambian entre sesiones
- La investigación "Lost in the Middle" muestra que los modelos razonan mejor al inicio de su ventana de contexto — exactamente cuando los agentes aún están buscando
El autor ha publicado un análisis más detallado explorando estos problemas y sus implicaciones para el desarrollo de agentes de codificación con IA.
📖 Read the full source: r/LocalLLaMA
👀 Ver también

Psiquiatra de Melbourne rechaza nuevos pacientes que no consienten la toma de notas con IA
Un psiquiatra de Melbourne ahora exige que los nuevos pacientes consientan la transcripción con IA de las sesiones o sean derivados a otro lugar, lo que genera preocupaciones sobre la seguridad de los datos y la precisión.

Modelos locales vs en la nube: Qwen-3.6-27B, Gemma-4-31B, Claude Haiku, Codex-Spark en generación de código complejo
Un usuario probó Qwen-3.6-27B (q4_k_m) localmente en una RTX 5080 contra Gemma-4-31B, Claude Haiku 4.5 y Codex-Spark basados en API en una tarea compleja de código. Solo Codex-Spark produjo código completo (pero con errores de importación); todos los demás fallaron parcialmente. Costo: Gemma usó $0.112 por 803k tokens de entrada.

MCP no es más que bibliotecas reempaquetadas: déjà vu una vez más
Un debate en Reddit argumenta que el MCP de Anthropic es esencialmente un reempaquetado de bibliotecas de programación, estableciendo paralelismos con el diseño de herramientas smolagents de Hugging Face y cuestionando si construir nuevos MCP o mejorar la documentación de bibliotecas existentes.

Evolución de la Arquitectura de Caché KV: Desde GPT-2 hasta Mamba
El análisis de los costos de memoria de la caché KV muestra que GPT-2 utilizaba 300 KiB/token, Llama 3 lo redujo a 128 KiB/token con atención de consultas agrupadas, y DeepSeek V3 logró 68.6 KiB/token con atención latente multi-cabezal. Mamba/SSMs eliminan por completo la caché KV mediante estados ocultos de tamaño fijo.