Analyse approfondie de la quantification du cache KV de Qwen : PPL, divergence KL et résultats asymétriques K/V

✍️ OpenClawRadar📅 Publié: April 29, 2026🔗 Source
Analyse approfondie de la quantification du cache KV de Qwen : PPL, divergence KL et résultats asymétriques K/V
Ad

Benchmarks de suivi pour Qwen 3.6-35B-A3B Q8 avec quantification du cache KV en utilisant le fork TheTom TurboQuant (feature/turboquant-kv-cache) sur un M5 Max. Cette série couvre la perplexité, la divergence KL, les combinaisons K/V asymétriques et un point de données à 64K de profondeur.

Résultats de qualité (Perplexité + divergence KL)

Taille de contexte 4096 sur wikitext-2. f16 utilisé comme référence pour les logits.

  • q8_0 : PPL 5,7433, KL 0,0016, accord top-1 de 98,64 % — essentiellement gratuit à 4K de contexte (delta PPL -0,0005 dans ±0,036 d'écart type).
  • turbo3 (~4,9x) : PPL 5,8092, KL 0,0199, accord top-1 de 93,93 % — ~1 % d'augmentation de PPL, 5 pp de désaccord sur les tokens.
  • turbo4 (~3,8x) : PPL 5,7810, KL 0,0131, accord top-1 de 95,28 % — se situe entre q8_0 et turbo3, cohérent avec le taux de compression.

Le coût en qualité augmente avec la compression, sans surprise.

Balayage K/V asymétrique

Tokens/s en décodage avec llama-bench, mêmes options que le balayage symétrique. Configurations clés :

  • -ctk q8_0 -ctv turbo4 se démarque : à 256K, le débit correspond au q8_0 symétrique (27,1 contre 26,6 tg), tient dans 512K là où le q8_0 symétrique manquait de mémoire. Offre une pré-remplissage de qualité q8_0 avec un plafond de contexte de type turbo4.
  • -ctk q8_0 -ctv turbo3 : astuce similaire mais décodage moins bon (quantification V plus serrée pénalise la génération).
  • -ctk f16 -ctv turbo4 : cassé sur Metal — le noyau FlashAttention ne gère pas cette combinaison en voie rapide, retombe sur une attention générique de déquantification. À 8K, c'est 34 fois plus lent que le f16 symétrique ; à 128K, c'est 78 fois plus lent (4,1 t/s en pré-remplissage). À ne pas utiliser.

Exemple de tokens/s en décodage à 128K de profondeur : q8_0 K/turbo4 V 41.0, q8_0 K/turbo3 V 38.2, f16 K/turbo4 V 2.8.

Ad

Ligne à 64K de profondeur

Les sept configurations à une profondeur de 65536 (pp512 / tg128 en tokens/s) :

  • f16 symétrique : 602.0 / 59.8
  • q8_0 symétrique : 479.2 / 57.9
  • turbo3 symétrique : 469.8 / 49.9
  • turbo4 symétrique : 418.0 / 55.2
  • q8_0 K / turbo4 V : 468.2 / 55.9
  • q8_0 K / turbo3 V : 465.6 / 52.6
  • f16 K / turbo4 V : 8.3 / 4.9

Les courbes de pré-remplissage convergent presque à 64K : turbo3 (470) à 2% près de q8_0 (479). Le régime limité par la bande passante s'enclenche entre 64K et 128K.

Recommandation mise à jour

Pour les agents de codage (contexte profond, nombreux tokens générés) : utilisez -ctk q8_0 -ctv turbo4. Qualité q8_0 sur K, économies turbo4 sur V, tient dans 512K. Pour le RAG ou le QA par lots (pré-remplissage lourd, décodage plus léger), le q8_0 ou turbo4 symétrique reste viable.

📖 Lire la source complète : r/LocalLLaMA

Ad

👀 See Also

Fiche technique du modèle Claude Opus 4.7 publiée
News

Fiche technique du modèle Claude Opus 4.7 publiée

Anthropic a publié la fiche technique du modèle Claude Opus 4.7, fournissant une documentation technique pour leur dernier modèle d'IA. Le matériel source semble être un document PDF contenant les spécifications système et les détails techniques.

OpenClawRadar
Le développeur de Claude Code reconnaît une faille dans la pensée adaptative et propose une solution de contournement.
News

Le développeur de Claude Code reconnaît une faille dans la pensée adaptative et propose une solution de contournement.

Boris Charny, créateur de Claude Code, a confirmé une faille dans la fonction de pensée adaptative qui entraîne une dégradation des performances. Les utilisateurs rencontrant des problèmes même avec les paramètres effort=élevé peuvent utiliser CLAUDE_CODE_DISABLE_ADAPTIVE_THINKING=1 comme solution temporaire.

OpenClawRadar
1,2B de modèle local bat 1T de clouds au poker : l'agression l'emporte sur la connaissance en format push-or-fold
News

1,2B de modèle local bat 1T de clouds au poker : l'agression l'emporte sur la connaissance en format push-or-fold

Un modèle Liquid de 1,2B a remporté 2 des 5 tournois de Texas Hold'em contre des modèles allant jusqu'à 1T de paramètres, car dans un format à tapis court, ne jamais se coucher rapportait plus de jetons que de jouer intelligemment.

OpenClawRadar
Sortie de Claude-Code v2.1.25 : Correction de l'erreur de validation
News

Sortie de Claude-Code v2.1.25 : Correction de l'erreur de validation

Claude-Code v2.1.25 corrige un problème de validation d'en-tête bêta affectant les utilisateurs de la passerelle sur Bedrock et Vertex, avec une solution de contournement spécifique via une variable d'environnement.

OpenClawRadar