Bench de caché KV de Qwen 3.6-35B-A3B: f16 vs q8_0 vs Turbo3 vs Turbo4 en M5 Max hasta 1M de contexto

✍️ OpenClawRadar📅 Publicado: 28 de abril de 2026🔗 Source
Bench de caché KV de Qwen 3.6-35B-A3B: f16 vs q8_0 vs Turbo3 vs Turbo4 en M5 Max hasta 1M de contexto
Ad

Un usuario de Reddit realizó un barrido de profundidad en Qwen 3.6-35B-A3B Q8 usando el fork TurboQuant Metal de llama.cpp de TheTom (GitHub: TheTom/llama-cpp-turboquant, rama feature/turboquant-kv-cache) en una MacBook Pro M5 Max con 128 GB de memoria unificada. Probaron cuatro tipos de caché KV: f16, q8_0, turbo3 (3 bits) y turbo4 (4 bits), K y V simétricos, con flash-attn activado y mlock activado, desde 0 hasta 1M tokens de contexto.

Hardware y compilación

M5 Max, 128 GB de memoria unificada. Compilado con cmake -B build -DGGML_METAL=ON. Usaron llama-bench, 3 repeticiones por celda, flash-attn activado, mlock activado. 8 horas de tiempo real durante la noche.

Rendimiento de generación (tok/s)

Profundidadf16q8_0turbo3turbo4
089.487.479.579.7
8K84.279.272.271.2
32K72.667.861.561.8
128K44.440.736.037.7
256KOOM26.622.925.5
512KOOMOOM13.316.0
1MOOMOOM6.5OOM

Rendimiento de procesamiento de prompt (tok/s)

Profundidadf16q8_0turbo3turbo4
02962294829042854
8K2098162316531439
32K1063802784678
128K321245253206
256KOOM124128101
512KOOMOOM6656
1MOOMOOM30OOM
Ad

Conclusiones clave

  • A profundidad 0, f16 lidera por poco en prefill; turbo3 es ~10% más lento en decodificación.
  • A 128K, el prefill de turbo3 (253 tok/s) iguala a q8_0 (245 tok/s) — el caché más pequeño reduce la presión del ancho de banda.
  • A 256K, turbo3 gana en prefill +27% sobre turbo4 (128 vs 101), pero turbo4 gana en decodificación +11% (25.5 vs 22.9). A 512K, la brecha de decodificación se amplía a +20% (turbo4 16.0 vs turbo3 13.3).
  • turbo3 es el único tipo de caché que cabe en contexto de 1M (6.5 tok/s de decodificación). Memoria a 1M: ~89 GB (37 GB de pesos, ~52 GB de caché KV).

Recomendaciones según la carga de trabajo

  • Agentes de codificación (contexto profundo, muchos tokens generados): turbo4
  • RAG / QA por lotes (prefill pesado, respuestas cortas): turbo3
  • Contexto de 1M: solo turbo3
  • Interactivo corto (<32K): f16 si cabe, si no q8_0

Advertencias

Esto es un solo M5 Max. Los puntos de cruce probablemente cambien con el ancho de banda de memoria y los núcleos de GPU. Solo se probó K/V simétrico. Combinaciones asimétricas (por ejemplo, -ctk q8_0 -ctv turbo4) no se evaluaron. El fork de TheTom es de nivel de investigación, no está integrado en la rama principal de llama.cpp.

📖 Lee la fuente completa: r/LocalLLaMA

Ad

👀 Ver también

La Inferencia de IA es Obviamente Rentable: Desglosando la Economía
Noticias

La Inferencia de IA es Obviamente Rentable: Desglosando la Economía

Los proveedores de inferencia de IA de frontera reportan márgenes brutos del 70-80%. Las estimaciones de costos muestran ~$1 por millón de tokens para servir un modelo de 70B, mientras que el precio de API es de $4.50+ por millón de tokens.

OpenClawRadar
La razón del proyecto Zig para su estricta política anti-LLM en contribuciones
Noticias

La razón del proyecto Zig para su estricta política anti-LLM en contribuciones

Zig impone una prohibición total a las contribuciones asistidas por LLM: nada de IA para informes de errores, PR o comentarios. El vicepresidente Loris Cro explica la filosofía del "póquer de contribuyentes": revisar PR es una inversión para hacer crecer contribuyentes de confianza, no solo para incorporar código.

OpenClawRadar
Pantheon-Reasoning-27B: Un modelo de RP de razonamiento denso de Gryphe
Noticias

Pantheon-Reasoning-27B: Un modelo de RP de razonamiento denso de Gryphe

Gryphe lanza Pantheon-Reasoning-27B, un ajuste fino sin censura de Qwen 3.6 27B con trazas de razonamiento completas para juegos de rol. Construido sobre datos de Pantheon, Opus-4.6-Reasoning-24k, WorldSim, aventuras de texto y RP general. Cuantizaciones GGUF disponibles.

OpenClawRadar
Claude Certified Architect Foundations (CCA-F) Examen: Puntuación 985/1000 — Guía de Estudio y Prueba Simulada
Noticias

Claude Certified Architect Foundations (CCA-F) Examen: Puntuación 985/1000 — Guía de Estudio y Prueba Simulada

Un usuario de Reddit comparte haber obtenido 985/1000 en el nuevo examen Claude Certified Architect Foundations (CCA-F). Incluye perspectivas prácticas sobre ingeniería de prompts, ventanas de contexto y flujos de trabajo Humano en el Bucle, además de enlaces a cursos de formación, cookbook y un examen de práctica gratuito.

OpenClawRadar