Evolución de la Arquitectura de Caché KV: Desde GPT-2 hasta Mamba

✍️ OpenClawRadar📅 Publicado: 29 de marzo de 2026🔗 Source
Evolución de la Arquitectura de Caché KV: Desde GPT-2 hasta Mamba
Ad

Costos de Memoria de la Caché KV en Diferentes Arquitecturas de Modelos

Un análisis reciente de la evolución de la arquitectura de la caché KV revela mejoras significativas en la eficiencia de memoria entre los modelos transformadores. La progresión muestra cómo diferentes mecanismos de atención han reducido la memoria de GPU requerida para mantener el contexto de conversación durante la inferencia.

Comparaciones Específicas de Arquitecturas

  • GPT-2 (2019): 300 KiB/token. Utiliza atención multi-cabezal donde cada cabeza mantiene sus propias claves y valores sin compartir. Una conversación de 4,000 tokens requiere aproximadamente 1.2 GB de memoria de GPU solo para la caché, separada de los pesos del modelo.
  • Llama 3 (2024): 128 KiB/token. Implementa atención de consultas agrupadas donde múltiples cabezas de consulta comparten los mismos pares KV. Esto es menos de la mitad del costo de GPT-2, basado en la idea de que muchas cabezas estaban aprendiendo representaciones redundantes.
  • DeepSeek V3 (2024): 68.6 KiB/token. Utiliza atención latente multi-cabezal que comprime los pares KV en un espacio latente de menor dimensión y los descomprime en la inferencia. Este es un modelo de 671B parámetros con 37B activos mediante MoE. Los estudios de ablación de DeepSeek V2, en los que se basa la arquitectura de V3, mostraron que la representación comprimida igualaba o superaba ligeramente a la MHA estándar en varios benchmarks.
  • Gemma 3 (2025): Utiliza GQA más una ventana deslizante con capas de atención 5:1 local-a-global, donde las capas locales atienden solo a 1,024 tokens. Muestra casi ninguna pérdida de perplejidad debido al filtrado agresivo.
  • Mamba/SSMs (2023): Sin caché KV en absoluto. Utiliza un estado oculto de tamaño fijo actualizado por token. El modelo decide qué comprimir en tiempo real en lugar de almacenar todo y atender después.
Ad

Brechas Arquitectónicas e Implicaciones Prácticas

El análisis destaca una brecha entre la memoria de trabajo y el conocimiento permanente en las arquitecturas actuales. La caché KV persiste durante segundos a minutos (se reportan vidas útiles de caché de 5-10 minutos, variando por proveedor y carga), luego desaparece. Entre la caché temporal y los pesos permanentes, no hay memoria a medio plazo nativa ni un espacio arquitectónico para información como "Hablé con este usuario el martes pasado".

Las soluciones actuales como RAG, sistemas de archivos, bases de datos vectoriales y prompts del sistema que llevan contexto curado se describen como "puentes sobre un vacío arquitectónico" - sistemas de búsqueda acoplados a modelos sin almacenamiento interno a medio plazo.

El problema de compactación ejemplifica esta limitación. Cuando el contexto crece demasiado, los modelos resumen su propio historial, limpian la caché y continúan desde el resumen. Esto puede llevar a pérdida de precisión (una política de publicación con seis reglas se convierte en "algo sobre pautas editoriales") y modelos operando con confianza en contexto degradado sin saber qué se perdió.

El enfoque de compactación aprendida de Cursor entrena modelos para auto-resumir bien mediante RL en lugar de solo solicitar compresión, pero la evidencia se limita a un benchmark de codificación. El código proporciona señales de recompensa claras (las pruebas pasan o fallan), a diferencia de escenarios como compactar notas editoriales, planificación estratégica o conversaciones donde detalles críticos no serán necesarios durante muchos mensajes.

📖 Read the full source: r/LocalLLaMA

Ad

👀 Ver también

Google Trends muestra un aumento en el interés de búsqueda por Claude Code a principios de 2026.
Noticias

Google Trends muestra un aumento en el interés de búsqueda por Claude Code a principios de 2026.

Un usuario de Reddit comparó el interés de búsqueda en Google Trends durante el último año para cinco herramientas de programación: vibe coding, Cursor, Claude Code, Codex y Replit. El ascenso de Claude Code a principios de 2026 destaca en los datos.

OpenClawRadar
Claude Code v2.1.116: Mejoras de rendimiento, correcciones de terminal y actualizaciones de seguridad
Noticias

Claude Code v2.1.116: Mejoras de rendimiento, correcciones de terminal y actualizaciones de seguridad

Claude Code v2.1.116 ofrece mejoras significativas de rendimiento que incluyen hasta un 67% más rápido en /resume para sesiones de 40MB+, desplazamiento más suave en terminal y arranque más rápido de MCP. La versión también corrige problemas de renderizado en terminal, añade protecciones de seguridad para operaciones de rutas peligrosas y resuelve múltiples errores que afectan a comandos de barra y gestión de complementos.

OpenClawRadar
Claude Fable 5 de Anthropic: Los benchmarks muestran grandes avances, pero los precios y límites de tasa preocupan a los desarrolladores
Noticias

Claude Fable 5 de Anthropic: Los benchmarks muestran grandes avances, pero los precios y límites de tasa preocupan a los desarrolladores

Claude Fable 5 llega con fuertes puntos de referencia en codificación y tareas agénticas, pero los desarrolladores están preocupados por los precios de la API y los límites de velocidad.

OpenClawRadar
Cowork puede usar una instancia de Chrome en otra máquina sin que usted lo sepa
Noticias

Cowork puede usar una instancia de Chrome en otra máquina sin que usted lo sepa

Un usuario de Reddit descubrió que Cowork puede ejecutar tareas del navegador usando una instancia de Chrome en otra máquina (Windows) emparejada a través de una extensión, marcada como isLocal: false — algo no documentado.

OpenClawRadar