Benchmark de Quantification Qwen 3.6 27B : Q4_K_M Surpasse Q8_0 en Compromis Pratiques

Un utilisateur de Reddit a benchmarké Qwen 3.6 27B dans trois variantes de quantification GGUF (BF16, Q4_K_M, Q8_0) en utilisant llama-cpp-python via le framework Neo AI Engineer. L'évaluation a porté sur 664 échantillons au total répartis sur trois tâches : HumanEval (génération de code, 164 échantillons), HellaSwag (raisonnement de sens commun, 100 échantillons) et BFCL (appel de fonctions, 400 échantillons).
Résultats du benchmark
- BF16 (taille du modèle 53,8 Go, RAM maximale 54 Go, débit 15,5 tok/s) : HumanEval 56,10% (92/164), HellaSwag 90,00% (90/100), BFCL 63,25% (253/400). Précision moyenne : 69,78%.
- Q4_K_M (16,8 Go, 28 Go RAM, 22,5 tok/s) : HumanEval 50,61% (83/164), HellaSwag 86,00% (86/100), BFCL 63,00% (252/400). Moyenne : 66,54%.
- Q8_0 (28,6 Go, 42 Go RAM, 18,0 tok/s) : HumanEval 52,44% (86/164), HellaSwag 83,00% (83/100), BFCL 63,00% (252/400). Moyenne : 66,15%.
Points clés à retenir
Q4_K_M est la variante pratique qui se démarque. Elle préserve la précision BFCL (63,00% vs 63,25%), ne perd qu'environ 5,5 points sur HumanEval, et est ~4 points derrière BF16 sur HellaSwag. Les compromis : 1,45x plus rapide que BF16, 48% de RAM maximale en moins, 68,8% de fichier plus petit, et des performances d'appel de fonctions presque identiques. Q8_0 a déçu : il n'a amélioré HumanEval que d'environ 1,8 point par rapport à Q4_K_M mais a utilisé 42 Go de RAM contre 28 Go, était plus lent et a obtenu un score inférieur sur HellaSwag.
Pour un déploiement local/CPU, Q4_K_M est recommandé sauf si la charge de travail est fortement axée sur la génération de code. Pour une qualité maximale, BF16 reste le meilleur.
Configuration de l'évaluation
Variantes GGUF via llama-cpp-python avec n_ctx: 32768, évaluation avec points de contrôle. Le framework Neo AI Engineer a construit le pipeline d'évaluation GGUF, géré les exécutions avec points de contrôle et consolidé les résultats. L'étude de cas complète avec extraits de code est liée dans les commentaires originaux de Reddit.
📖 Lire la source complète : r/LocalLLaMA
👀 See Also

altRAG : Remplacez la base de données vectorielle RAG par des fichiers pointeurs de 2 Ko pour les agents d'IA de codage
altRAG est un outil Python qui remplace la RAG de base de données vectorielle par des fichiers de pointeurs légers. Il scanne les fichiers de compétences Markdown/YAML pour créer un fichier squelette de 2KB qui mappe les sections aux numéros de ligne exacts et aux décalages d'octets, permettant aux agents IA de lire uniquement les sections nécessaires au lieu des fichiers entiers.

Le flux de travail de codage autonome livre 163 000 lignes de code en une nuit grâce à Claude Code.
Un développeur a créé un flux de travail autonome qui a accompli 72 tâches en une nuit, générant 163 643 lignes de code et plus de 6 400 tests réussis avec un taux de réussite de 85 % dès la première tentative.

Plugin OpenClaw A2A : messagerie directe d'agent à agent sur Internet
Un plugin OpenClaw A2A permet le transfert direct de fichiers et de messages entre OpenClaws et d'autres agents via Internet sans services tiers comme WhatsApp ou email.

Tatu : Couche de sécurité open-source pour Claude qui masque les secrets et commandes destructrices dans les blocs de code
Tatu est un système de crochets open-source qui intercepte les actions de Claude Code en temps réel pour bloquer les secrets divulgués, signaler les informations personnelles identifiables (PII) et refuser les commandes destructrices avant leur exécution. L'installation se fait via pip/pipx avec 'tatu-hook init' pour activer le mode audit.