Profundización en la Cuantización de Caché KV de Qwen: PPL, Divergencia KL y Resultados Asimétricos de K/V

Evaluaciones de seguimiento para Qwen 3.6-35B-A3B Q8 con cuantización de caché KV usando el fork TheTom TurboQuant (feature/turboquant-kv-cache) en un M5 Max. Esta ronda cubre perplejidad, divergencia KL, combinaciones asimétricas K/V y un punto de datos de profundidad de 64K.
Resultados de Calidad (Perplejidad + Divergencia KL)
Tamaño de contexto 4096 en wikitext-2. Se usó f16 como línea base para logits.
- q8_0: PPL 5.7433, KL 0.0016, acuerdo de token top-1 98.64% — esencialmente gratis en contexto de 4K (delta PPL -0.0005 dentro de ±0.036 stderr).
- turbo3 (~4.9x): PPL 5.8092, KL 0.0199, acuerdo top-1 93.93% — ~1% de aumento en PPL, 5pp de desacuerdo de tokens.
- turbo4 (~3.8x): PPL 5.7810, KL 0.0131, acuerdo top-1 95.28% — se sitúa entre q8_0 y turbo3, consistente con la relación de compresión.
El costo de calidad escala con la compresión, sin sorpresas.
Barrido Asimétrico K/V
Decode tok/s con llama-bench, mismas banderas que el barrido simétrico. Configuraciones clave:
-ctk q8_0 -ctv turbo4destaca: en 256K iguala el rendimiento de q8_0 simétrico (27.1 vs 26.6 tg), cabe en 512K donde q8_0 simétrico se quedó sin memoria. Ofrece calidad de prefill de q8_0 con techo de contexto de turbo4.-ctk q8_0 -ctv turbo3: truco similar pero peor decode (cuantización V más ajustada penaliza la generación).-ctk f16 -ctv turbo4: roto en Metal — el kernel FlashAttention no acelera esta combinación, recurre a atención genérica con deccuantización. En 8K es 34 veces más lento que f16 simétrico; en 128K es 78 veces más lento (4.1 t/s pp). No usar.
Ejemplo de decode tok/s a profundidad 128K: q8_0 K/turbo4 V 41.0, q8_0 K/turbo3 V 38.2, f16 K/turbo4 V 2.8.
Fila de Profundidad 64K
Las siete configuraciones a profundidad 65536 (pp512 / tg128 tok/s):
- f16 simétrico: 602.0 / 59.8
- q8_0 simétrico: 479.2 / 57.9
- turbo3 simétrico: 469.8 / 49.9
- turbo4 simétrico: 418.0 / 55.2
- q8_0 K / turbo4 V: 468.2 / 55.9
- q8_0 K / turbo3 V: 465.6 / 52.6
- f16 K / turbo4 V: 8.3 / 4.9
Las curvas de prefill casi convergen en 64K: turbo3 (470) dentro del 2% de q8_0 (479). El régimen limitado por ancho de banda comienza entre 64K y 128K.
Recomendación Actualizada
Para agentes de codificación (contexto profundo, muchos tokens generados): usar -ctk q8_0 -ctv turbo4. Calidad q8_0 en K, ahorros de turbo4 en V, cabe en 512K. Para RAG o QA por lotes (prefill pesado, decode más pequeño), q8_0 simétrico o turbo4 siguen siendo viables.
📖 Leer la fuente completa: r/LocalLLaMA
👀 Ver también

Seis Paralelismos Respaldados por la Investigación entre los Modos de Falla de los LLM y la Cognición del TDAH
Un desarrollador con TDAH identifica seis paralelismos entre los patrones de fallo de los LLM y la ciencia cognitiva del TDAH, respaldados por investigaciones independientes sobre procesamiento asociativo, confabulación, limitaciones de la memoria de trabajo, completado de patrones, dependencia de la estructura y continuidad del hilo.

Rankings de la Tienda de Aplicaciones de Claude en 7 Países
Claude ocupó el puesto #1 en Estados Unidos y Canadá, #3 en Francia y Alemania, #4 en el Reino Unido, #8 en Italia y #22 en Japón en las clasificaciones de aplicaciones gratuitas de App Store capturadas simultáneamente el 1 de marzo de 2026 a las 09:00 UTC.

Fundador de OpenClaw, Peter Steinberger: Multijugador en la nube, servidores de equipo y colaboración agente a agente en el episodio 7 de The ClawCast
En el Episodio 7 de The ClawCast, el fundador de OpenClaw, Peter Steinberger, responde preguntas de la comunidad sobre flujos de trabajo multijugador en la nube, servidores de equipo, colaboración agente a agente, memoria y enrutamiento de modelos.

Nvidia RTX Spark: Superchip de 1 petaflop lleva agentes de IA local a PC con Windows
Nvidia presenta RTX Spark, un superchip de 1 petaflop para PCs Windows, que permite ejecutar agentes de IA locales con hasta 128 GB de memoria unificada y pila CUDA/RTX completa. Llegará este otoño en laptops y desktops de ASUS, Dell, HP, Lenovo, Microsoft Surface y MSI.