La Reutilización de la Caché KV para Conversaciones Largas en Apple Silicon Logra una Aceleración de 200 Veces

✍️ OpenClawRadar📅 Publicado: 15 de marzo de 2026🔗 Source
La Reutilización de la Caché KV para Conversaciones Largas en Apple Silicon Logra una Aceleración de 200 Veces
Ad

Qué es Esto

Un desarrollador compartió resultados experimentales de implementar la reutilización de caché KV (clave-valor) basada en sesiones para inferencia de LLM local en Apple Silicon utilizando el framework MLX. El objetivo era hacer conversaciones largas (100K+ tokens) prácticas eliminando la necesidad de reprocesar todo el contexto en cada turno.

Hallazgos Clave y Puntos de Referencia

El enfoque central consistió en mantener la caché KV en memoria a lo largo de los turnos de conversación y procesar solo los tokens nuevos. Esta idea simple produjo mejoras dramáticas en el rendimiento:

  • Mejora de 200x en TTFT con Contexto de 100K: Sin caché: 126 segundos. Con caché: 0.5 segundos. Esto representa una reducción del 99.9% en tokens procesados.
  • Números de Sesión del Mundo Real: Pruebas con un modelo Qwen3.5-397B en un Mac Studio M3 Ultra 512GB durante una sesión de agente OpenClaw de 266 mensajes mostraron:
    • Tasa de aciertos de caché: 93.8%
    • TTFT para aciertos de caché (<500 tokens nuevos): 1.0-1.3 segundos
    • TTFT para un fallo completo de caché (124K tokens): 528 segundos (8.8 minutos)
Ad

Lo que No Funcionó

El desarrollador probó varios intentos de optimización que fallaron o degradaron el rendimiento:

  • Recorte de Tokens de Pensamiento: Intentar eliminar los tokens de razonamiento interno del modelo de la caché para ahorrar espacio causó un comportamiento patológico. Las respuestas se volvieron un 31% más largas y la calidad disminuyó, ya que el modelo hace referencia a su razonamiento pasado a lo largo de los turnos.
  • Rotación de Caché KV (8192 tokens): Si bien esto proporcionó la mejor tasa de tokens por segundo (TPS), hizo que el modelo perdiera contexto anterior, con una caída significativa en el recuerdo (a 4 de 8 elementos).
  • Cuantización de 8 bits de KV: Esto resultó en una caída del 16.5% en TPS, ya que la sobrecarga computacional superó los ahorros de ancho de banda de memoria.

Implementación y Hardware

La implementación es parte de un proyecto personal de código abierto llamado SoloHeaven, disponible bajo licencia MIT en GitHub: https://github.com/joongom/mlx-soloheaven. El README contiene tablas completas de puntos de referencia.

Las pruebas se realizaron en un Mac Studio M3 Ultra con 512GB de RAM y 4TB de almacenamiento, utilizando los siguientes modelos convertidos para MLX:

  • Qwen3.5-122B-A10B-bf16
  • Qwen3.5-397B-A17B-MLX-8bit

📖 Read the full source: r/LocalLLaMA

Ad

👀 Ver también

Habilidad de Lanzamiento de Productos Claude AI: Guías Estructuradas para Lanzamientos de Productos de IA
Herramientas

Habilidad de Lanzamiento de Productos Claude AI: Guías Estructuradas para Lanzamientos de Productos de IA

Una habilidad gratuita de Claude proporciona seis manuales de lanzamiento probados en batalla que cubren estrategia, preparación, mensajería y ejecución de canales para lanzamientos de productos de IA. El repositorio incluye materiales en inglés y chino organizados por etapa de lanzamiento.

OpenClawRadar
Marco de Código Abierto Utiliza CLI de Claude Code para Monitoreo Automatizado de Repositorios de GitHub
Herramientas

Marco de Código Abierto Utiliza CLI de Claude Code para Monitoreo Automatizado de Repositorios de GitHub

Un desarrollador ha liberado como código abierto un marco de trabajo que ejecuta Claude Code CLI en un cronograma cron para triar la actividad de GitHub en múltiples repositorios. La herramienta incluye seguimiento de estado, deduplicación, notificaciones de Discord y un sistema de preverificación que evita costos de API cuando no ha habido cambios.

OpenClawRadar
El usuario de Claude Code construye un complemento nvm para capturar el contexto de resolución de problemas.
Herramientas

El usuario de Claude Code construye un complemento nvm para capturar el contexto de resolución de problemas.

Un desarrollador creó un complemento de Claude llamado nvm (memoria no volátil) que convierte el historial de sesiones de Claude en tarjetas de markdown que documentan decisiones de resolución de problemas e ideas reutilizables. La herramienta aborda el problema de perder el rastro de cómo se resolvieron los problemas al usar asistentes de codificación con IA.

OpenClawRadar
Servidor de memoria MCP de código abierto con gráfico de conocimiento y funciones de aprendizaje
Herramientas

Servidor de memoria MCP de código abierto con gráfico de conocimiento y funciones de aprendizaje

Un servidor MCP de código abierto escrito en Rust proporciona memoria persistente para agentes de IA con arquitectura de grafo de conocimiento, aprendizaje hebbiano y búsqueda híbrida. Tiene 7.6 MB con latencia submilisegundo y funciona con cualquier cliente compatible con MCP.

OpenClawRadar