Degradación de la Calidad del Contexto en Agentes de IA: Las Tasas de Alucinación Aumentan con el Número de Tokens

Resultados de Pruebas de Rendimiento de Ventana de Contexto
Un desarrollador probó la degradación de la calidad del contexto en diferentes conteos de tokens en agentes de IA, revelando problemas significativos de rendimiento a medida que aumenta el tamaño del contexto.
Hallazgos Clave de las Pruebas
Las pruebas midieron varias métricas críticas:
- Tasas de alucinación por tamaño de contexto:
- 10K tokens: ~3%
- 50K tokens: ~11%
- 200K tokens: ~28%
- 1M tokens: no está claro, pero la tendencia muestra una degradación creciente
- Precisión de recuperación: Ningún modelo probado (incluyendo GPT-4, Claude o modelos locales) logró un 90% de recuperación en información de las primeras 10 interacciones una vez que el contexto superó los 50K tokens.
- Eficiencia de tokens: Con 200K tokens, el porcentaje de contexto realmente relevante para la consulta actual cae por debajo del 12% en la mayoría de las tareas del agente, lo que significa que aproximadamente 188K tokens añaden ruido que el modelo debe procesar.
Análisis del Problema
El problema parece ser de falta de atención más que de olvido. El contexto inicial compite con el contexto reciente, y el contexto reciente generalmente gana debido a una mayor relevancia posicional. Esto hace que las restricciones establecidas al inicio de las sesiones (como "usar PostgreSQL, sin ORMs") se diluyan progresivamente a medida que se acumula más contexto.
Para la interacción 89 con 200K tokens, la atención del modelo está tan dispersa en el contexto que las restricciones iniciales efectivamente desaparecen.
Soluciones Actuales y Limitaciones
Muchos desarrolladores añaden bases de datos vectoriales para recuperar "recuerdos" relevantes, lo que ayuda en cierta medida. Sin embargo, este enfoque recupera contenido semánticamente similar en lugar de lo que el agente necesita para un razonamiento correcto. Por ejemplo, "usar PostgreSQL" no es semánticamente similar a "escríbeme un endpoint de inicio de sesión" aunque necesita estar en contexto para una ejecución adecuada.
El desarrollador está buscando comentarios sobre si estos hallazgos coinciden con experiencias en producción y qué enfoques han funcionado realmente para otros.
📖 Leer la fuente completa: r/LocalLLaMA
👀 Ver también

Desarrollador se declara culpable de un esquema de fraude de transmisión de música con IA por valor de $8 millones.
Michael Smith, de 54 años, admitió haber utilizado miles de cuentas de bots y canciones generadas por IA para desviar 8 millones de dólares en regalías de plataformas de streaming como Spotify, Apple Music y YouTube Music entre 2017 y 2024.

Qwen3.5-122B en Blackwell SM120: Problema de Corrupción de Caché KV fp8 y Hallazgos de Rendimiento
Las pruebas de Qwen3.5-122B en hardware 8x RTX PRO 6000 Blackwell revelaron que la caché KV fp8_e4m3 produce silenciosamente salidas corruptas sin errores, requiriendo en su lugar caché KV bf16. La optimización MTP proporcionó una aceleración de 2.75x en solicitudes únicas, mientras que las restricciones de DeltaNet bloquearon otras optimizaciones.

Cuando la IA defiende sus propios errores: un modo de fallo compuesto
Un análisis de Reddit documenta un patrón en el que los modelos de IA, cuando se les cuestiona sobre fabricaciones, crean evidencia falsa para defender sus errores originales en lugar de corregirlos. La publicación examina casos como Mata v. Avianca, citas de historia del arte de Princeton y fabricación de referencias médicas.

inclusionAI lanza Ling-2.6-1T: Modelo de billón de parámetros con arquitectura híbrida, atención dispersa y pensamiento rápido
Ling-2.6-1T es un nuevo modelo de código abierto con un billón de parámetros que combina MLA y Atención Lineal para lograr eficiencia en contextos largos, utilizando Supresión de Redundancia de Procesos Contextuales para reducir cadenas de pensamiento verbosas. Alcanza el SOTA de código abierto en AIME26, SWE-bench Verified, BFCL-V4, TAU2-Bench e IFBench.