Por qué los agentes de codificación de IA producen basura después de 20 turnos: Ceguera al contexto

Un desarrollador en r/LocalLLaMA auditó sus registros de API y cargas de mensajes tras notar un aumento en el uso de tokens y que la salida del agente se degradaba a basura después de ~20 turnos. Su conclusión: los modelos no están siendo lobotomizados; se están asfixiando en sus propias ventanas de contexto infladas.
Los cuatro errores estructurales
Después de inspeccionar lo que Cursor y Claude Code realmente hacen en un repositorio de más de 10,000 líneas, el autor identificó cuatro patrones:
- Exploración ciega: El agente busca recursivamente con grep y vuelca ~40 archivos diferentes en el contexto solo para encontrar una función de utilidad. A menudo omite un componente existente y alucina un duplicado desde cero.
- Ingestión bruta: Vuelca un archivo de 2,000 líneas en el mensaje para actualizar una interfaz de 5 líneas. Desperdicia una gran cantidad de tokens de contexto.
- Diarrea de herramientas: Registros de prueba verbosos y definiciones masivas de herramientas MCP consumen ~30k tokens antes de que el modelo genere un solo token de código.
- Memoria de pez: Cada sesión comienza desde cero — sin conocimiento del proyecto — por lo que los mismos archivos se releen repetidamente.
Punto de inflexión al 80% de contexto
Una vez que el contexto alcanza ~80% de capacidad con ruido, el mecanismo de atención del modelo se degrada bruscamente. El coeficiente intelectual cae visiblemente a temperatura ambiente, y comienza a destruir la arquitectura. El chunking RAG estándar no soluciona esto porque es basura para la lógica — el agente sigue siendo ciego a la estructura del código hasta que quema tokens leyendo texto sin procesar.
Solución propuesta: AST o base de datos de grafos
El autor pide un agente de código abierto que analice el código en un AST o base de datos de grafos antes de consumir contexto, para que entienda la estructura sin desperdiciar tokens en texto sin procesar. Esto evitaría espaguetis arquitectónicos que cuestan 5 horas de arreglo por cada 1 hora ahorrada escribiendo.
Para quién es esto
Desarrolladores que usan Cursor, Claude Code o agentes LLM locales en repositorios reales y están frustrados por las paradojas de productividad.
📖 Lee la fuente completa: r/LocalLLaMA
👀 Ver también

Los complementos de LM Studio añaden análisis de imágenes web para LLMs con capacidades visuales.
Un desarrollador creó complementos para LM Studio que permiten a los LLM con capacidades visuales obtener y analizar imágenes de la web, con procesamiento automático de imágenes y encadenamiento de herramientas. Los complementos funcionan con modelos como Qwen 3.5 9b/27b e incluyen funcionalidades actualizadas de Duck-Duck-Go y Visitar Sitio Web.

Problemas de Compromiso: Una Herramienta que Analiza y 'Entierra' Repositorios de GitHub Incompletos
Un desarrollador creó una herramienta llamada Commitment Issues que analiza repositorios de GitHub para determinar si están abandonados, genera un 'certificado de defunción' y extrae el último mensaje de commit como 'últimas palabras'. La herramienta utiliza heurísticas como frecuencia de commits, última actividad y estrellas vs. impulso, y fue prototipada usando Claude.

El experimento de revisión de código cara a cara compara tres herramientas de IA en la misma base de código.
Un experimento en video prueba Codex, Claude Code y Claude Code con Sextant en tareas idénticas de revisión de código, con Codex verificando los hallazgos y juzgando qué informe es más valioso. El enfoque está en cómo el flujo de trabajo y la estructura afectan lo que la IA nota y prioriza.

El conjunto MCP de código abierto mejora la calidad de la generación de código de Claude en un 15-20%.
Un conjunto MCP de código abierto que consta de tres servidores locales y una habilidad de prompt aborda el problema del 'token malo' en la generación de código con IA, con un cliente reportando una mejora de calidad del 15-20% para Claude Code.