Por qué los agentes de codificación de IA producen basura después de 20 turnos: Ceguera al contexto

Un desarrollador en r/LocalLLaMA auditó sus registros de API y cargas de mensajes tras notar un aumento en el uso de tokens y que la salida del agente se degradaba a basura después de ~20 turnos. Su conclusión: los modelos no están siendo lobotomizados; se están asfixiando en sus propias ventanas de contexto infladas.
Los cuatro errores estructurales
Después de inspeccionar lo que Cursor y Claude Code realmente hacen en un repositorio de más de 10,000 líneas, el autor identificó cuatro patrones:
- Exploración ciega: El agente busca recursivamente con grep y vuelca ~40 archivos diferentes en el contexto solo para encontrar una función de utilidad. A menudo omite un componente existente y alucina un duplicado desde cero.
- Ingestión bruta: Vuelca un archivo de 2,000 líneas en el mensaje para actualizar una interfaz de 5 líneas. Desperdicia una gran cantidad de tokens de contexto.
- Diarrea de herramientas: Registros de prueba verbosos y definiciones masivas de herramientas MCP consumen ~30k tokens antes de que el modelo genere un solo token de código.
- Memoria de pez: Cada sesión comienza desde cero — sin conocimiento del proyecto — por lo que los mismos archivos se releen repetidamente.
Punto de inflexión al 80% de contexto
Una vez que el contexto alcanza ~80% de capacidad con ruido, el mecanismo de atención del modelo se degrada bruscamente. El coeficiente intelectual cae visiblemente a temperatura ambiente, y comienza a destruir la arquitectura. El chunking RAG estándar no soluciona esto porque es basura para la lógica — el agente sigue siendo ciego a la estructura del código hasta que quema tokens leyendo texto sin procesar.
Solución propuesta: AST o base de datos de grafos
El autor pide un agente de código abierto que analice el código en un AST o base de datos de grafos antes de consumir contexto, para que entienda la estructura sin desperdiciar tokens en texto sin procesar. Esto evitaría espaguetis arquitectónicos que cuestan 5 horas de arreglo por cada 1 hora ahorrada escribiendo.
Para quién es esto
Desarrolladores que usan Cursor, Claude Code o agentes LLM locales en repositorios reales y están frustrados por las paradojas de productividad.
📖 Lee la fuente completa: r/LocalLLaMA
👀 Ver también

Extensión de Chrome Cowork automatiza la eliminación de datos personales de corredores de datos
Un usuario de Reddit informa que, al usar la extensión Chrome Cowork con una conexión a Gmail, se automatizó el llenado de formularios, la redacción de correos electrónicos y la verificación de solicitudes de eliminación para borrar datos personales de los principales proveedores de datos en tan solo unas horas.

Adelantado: Un Complemento de Código Claude que Obliga a Pensar Antes de Programar
Upfront es un complemento de Claude Code con 20 habilidades que desafía a los desarrolladores antes de generar código. Utiliza tres comandos: /upfront:feature para cuestionar requisitos vagos, /upfront:plan para dividir el trabajo en fases de ~400 LOC, y /upfront:build para ejecutar con TDD y revisión por fase.

SmallClaw V1.0.3 Agrega Soporte para Webhooks, Automatización n8n y Servidor MCP
SmallClaw V1.0.3 introduce endpoints de webhook para activadores de servicios externos, flujos de trabajo de automatización local con n8n y conexiones de servidor MCP para integración de herramientas. La actualización mantiene el enfoque de la herramienta en ejecutarse con LLMs locales pequeños.

Wisepanel MCP Server permite la deliberación multi-LLM en Claude Code y Cursor
Wisepanel lanzó un servidor MCP que ejecuta deliberaciones multiagente directamente desde Claude Code, Cursor o cualquier cliente MCP, utilizando un sistema de mejora de contexto divergente con los modelos ChatGPT, Claude, Gemini y Perplexity.