Degradación de la Calidad del Contexto en Agentes de IA: Las Tasas de Alucinación Aumentan con el Número de Tokens

✍️ OpenClawRadar📅 Publicado: 28 de marzo de 2026🔗 Source
Degradación de la Calidad del Contexto en Agentes de IA: Las Tasas de Alucinación Aumentan con el Número de Tokens
Ad

Resultados de Pruebas de Rendimiento de Ventana de Contexto

Un desarrollador probó la degradación de la calidad del contexto en diferentes conteos de tokens en agentes de IA, revelando problemas significativos de rendimiento a medida que aumenta el tamaño del contexto.

Hallazgos Clave de las Pruebas

Las pruebas midieron varias métricas críticas:

  • Tasas de alucinación por tamaño de contexto:
    • 10K tokens: ~3%
    • 50K tokens: ~11%
    • 200K tokens: ~28%
    • 1M tokens: no está claro, pero la tendencia muestra una degradación creciente
  • Precisión de recuperación: Ningún modelo probado (incluyendo GPT-4, Claude o modelos locales) logró un 90% de recuperación en información de las primeras 10 interacciones una vez que el contexto superó los 50K tokens.
  • Eficiencia de tokens: Con 200K tokens, el porcentaje de contexto realmente relevante para la consulta actual cae por debajo del 12% en la mayoría de las tareas del agente, lo que significa que aproximadamente 188K tokens añaden ruido que el modelo debe procesar.
Ad

Análisis del Problema

El problema parece ser de falta de atención más que de olvido. El contexto inicial compite con el contexto reciente, y el contexto reciente generalmente gana debido a una mayor relevancia posicional. Esto hace que las restricciones establecidas al inicio de las sesiones (como "usar PostgreSQL, sin ORMs") se diluyan progresivamente a medida que se acumula más contexto.

Para la interacción 89 con 200K tokens, la atención del modelo está tan dispersa en el contexto que las restricciones iniciales efectivamente desaparecen.

Soluciones Actuales y Limitaciones

Muchos desarrolladores añaden bases de datos vectoriales para recuperar "recuerdos" relevantes, lo que ayuda en cierta medida. Sin embargo, este enfoque recupera contenido semánticamente similar en lugar de lo que el agente necesita para un razonamiento correcto. Por ejemplo, "usar PostgreSQL" no es semánticamente similar a "escríbeme un endpoint de inicio de sesión" aunque necesita estar en contexto para una ejecución adecuada.

El desarrollador está buscando comentarios sobre si estos hallazgos coinciden con experiencias en producción y qué enfoques han funcionado realmente para otros.

📖 Leer la fuente completa: r/LocalLLaMA

Ad

👀 Ver también

Claude Opus 4.7 añade soporte para imágenes de alta resolución, presupuestos de tareas y elimina el pensamiento extendido.
Noticias

Claude Opus 4.7 añade soporte para imágenes de alta resolución, presupuestos de tareas y elimina el pensamiento extendido.

Claude Opus 4.7 introduce soporte de imágenes de alta resolución de hasta 2576px/3.75MP, una nueva función de presupuesto de tareas para controlar el uso de tokens en bucles agentes, y elimina los presupuestos de pensamiento extendido en favor del pensamiento adaptativo.

OpenClawRadar
Claude Code v2.1.77 Lanzamiento: Límites de Tokens, Controles de Sandbox y Correcciones de Errores
Noticias

Claude Code v2.1.77 Lanzamiento: Límites de Tokens, Controles de Sandbox y Correcciones de Errores

Claude Code v2.1.77 aumenta los límites máximos de tokens de salida predeterminados para Claude Opus 4.6 a 64k tokens y añade una configuración de sistema de archivos sandbox allowRead. La versión incluye más de 30 correcciones para problemas que van desde la gestión de memoria hasta el comportamiento de la interfaz de usuario de terminal.

OpenClawRadar
Kimi K2.7-Code: Modelo de codificación de código abierto con mejor eficiencia de tokens
Noticias

Kimi K2.7-Code: Modelo de codificación de código abierto con mejor eficiencia de tokens

Moonshot AI lanzó Kimi K2.7-Code, un modelo open-source de imagen-texto a texto con eficiencia mejorada de tokens para tareas de programación. Disponible en Hugging Face con 334 me gusta y soporte de inferencia Novita.

OpenClawRadar
Los Autoencoders de Lenguaje Natural de Anthropic convierten las activaciones de Claude en inglés legible — Así es como
Noticias

Los Autoencoders de Lenguaje Natural de Anthropic convierten las activaciones de Claude en inglés legible — Así es como

Anthropic presenta los Autoencoders de Lenguaje Natural (NLAs) que convierten las activaciones internas de Claude en explicaciones en texto plano, revelando el razonamiento del modelo sobre rimas, conciencia de pruebas de seguridad y detección de trampas.

OpenClawRadar