Bench du cache KV Qwen 3.6-35B-A3B : f16 vs q8_0 vs Turbo3 vs Turbo4 sur M5 Max jusqu'à 1M de contexte

✍️ OpenClawRadar📅 Publié: April 28, 2026🔗 Source
Bench du cache KV Qwen 3.6-35B-A3B : f16 vs q8_0 vs Turbo3 vs Turbo4 sur M5 Max jusqu'à 1M de contexte
Ad

Un utilisateur de Reddit a effectué un balayage de profondeur sur Qwen 3.6-35B-A3B Q8 en utilisant le fork TurboQuant Metal de TheTom de llama.cpp (GitHub: TheTom/llama-cpp-turboquant, branche feature/turboquant-kv-cache) sur un MacBook Pro M5 Max avec 128 Go de mémoire unifiée. Ils ont testé quatre types de cache KV : f16, q8_0, turbo3 (3 bits) et turbo4 (4 bits), K et V symétriques, avec flash-attn activé et mlock activé, de 0 à 1M de tokens de contexte.

Matériel et compilation

M5 Max, 128 Go de mémoire unifiée. Compilé avec cmake -B build -DGGML_METAL=ON. Utilisation de llama-bench, 3 répétitions par cellule, flash-attn activé, mlock activé. 8 heures de temps réel pendant la nuit.

Débit de génération (tok/s)

Profondeurf16q8_0turbo3turbo4
089,487,479,579,7
8K84,279,272,271,2
32K72,667,861,561,8
128K44,440,736,037,7
256KOOM26,622,925,5
512KOOMOOM13,316,0
1MOOMOOM6,5OOM

Débit de traitement des prompts (tok/s)

Profondeurf16q8_0turbo3turbo4
02962294829042854
8K2098162316531439
32K1063802784678
128K321245253206
256KOOM124128101
512KOOMOOM6656
1MOOMOOM30OOM
Ad

Principaux enseignements

  • À profondeur 0, f16 mène de justesse sur le préremplissage ; turbo3 est ~10% plus lent en décodage.
  • À 128K, le préremplissage de turbo3 (253 tok/s) égalise q8_0 (245 tok/s) — un cache plus petit réduit la pression sur la bande passante.
  • À 256K, turbo3 gagne le préremplissage de +27% par rapport à turbo4 (128 contre 101), mais turbo4 gagne le décodage de +11% (25,5 contre 22,9). À 512K, l'écart en décodage s'élargit à +20% (turbo4 16,0 contre turbo3 13,3).
  • turbo3 est le seul type de cache qui tient dans 1M de contexte (6,5 tok/s en décodage). Mémoire à 1M : ~89 Go (37 Go de poids, ~52 Go de cache KV).

Recommandations selon la charge de travail

  • Agents de codage (contexte profond, nombreux tokens générés) : turbo4
  • RAG / QA par lots (préremplissage lourd, réponses courtes) : turbo3
  • Contexte de 1M : turbo3 uniquement
  • Interactif court (<32K) : f16 si ça tient, sinon q8_0

Limitations

Ceci est un seul M5 Max. Les points de croisement changent probablement avec la mémoire et les cœurs GPU. Seul K/V symétrique a été testé. Les combinaisons asymétriques (par ex., -ctk q8_0 -ctv turbo4) n'ont pas été évaluées. Le fork de TheTom est de niveau recherche, pas encore intégré dans llama.cpp principal.

📖 Lire la source complète : r/LocalLLaMA

Ad

👀 See Also

Kimi K2.6 bat Claude, GPT-5.5 et Gemini dans un défi de codage avec une stratégie de glissement agressive
News

Kimi K2.6 bat Claude, GPT-5.5 et Gemini dans un défi de codage avec une stratégie de glissement agressive

Lors du Word Gem Puzzle du jour 12 du AI Coding Contest, le modèle open-weights Kimi K2.6 de Moonshot AI a marqué 22 points de match (7-1-0), surpassant GPT-5.5 (16), Claude Opus 4.7 (12) et Gemini Pro 3.1 (9). MiMo V2-Pro a pris la deuxième place. Kimi a gagné en glissant de manière agressive.

OpenClawRadar
sseanliu/VisionClaw apporte une assistance IA en temps réel aux lunettes intelligentes Meta Ray-Ban
News

sseanliu/VisionClaw apporte une assistance IA en temps réel aux lunettes intelligentes Meta Ray-Ban

VisionClaw de sseanliu propose une révolutionnaire assistance IA pour les lunettes intelligentes Meta Ray-Ban, combinant la voix, la vision et les actions agentiques alimentées par Gemini Live et OpenClaw.

OpenClawRadar
Opus 4.6 La Pensée Étendue obtient de moins bons résultats sur les problèmes de diagrammes de physique
News

Opus 4.6 La Pensée Étendue obtient de moins bons résultats sur les problèmes de diagrammes de physique

Les tests montrent que Claude Opus 4.6 avec la réflexion étendue échoue systématiquement aux problèmes de physique impliquant l'interprétation de diagrammes visuels, tandis que Gemini 3.1 Pro réussit. Désactiver la réflexion étendue permet à Opus 4.6 de résoudre correctement et plus rapidement les mêmes problèmes.

OpenClawRadar
"L'IA de façade" : des entreprises britanniques se rebaptisent sociétés d'IA malgré des liens faibles
News

"L'IA de façade" : des entreprises britanniques se rebaptisent sociétés d'IA malgré des liens faibles

Des responsables RP rapportent que des entreprises britanniques les forcent à présenter de l'automatisation ordinaire comme de l'IA, 50 % des communiqués de presse liés à l'IA étant envoyés sous contrainte. Exemples : AllBirds se tourne vers l'acquisition de GPU IA et une société immobilière qualifie un scanner portable d'outil IA.

OpenClawRadar