Benchmark de Quantification Qwen 3.6 27B : Q4_K_M Surpasse Q8_0 en Compromis Pratiques

Un utilisateur de Reddit a benchmarké Qwen 3.6 27B dans trois variantes de quantification GGUF (BF16, Q4_K_M, Q8_0) en utilisant llama-cpp-python via le framework Neo AI Engineer. L'évaluation a porté sur 664 échantillons au total répartis sur trois tâches : HumanEval (génération de code, 164 échantillons), HellaSwag (raisonnement de sens commun, 100 échantillons) et BFCL (appel de fonctions, 400 échantillons).
Résultats du benchmark
- BF16 (taille du modèle 53,8 Go, RAM maximale 54 Go, débit 15,5 tok/s) : HumanEval 56,10% (92/164), HellaSwag 90,00% (90/100), BFCL 63,25% (253/400). Précision moyenne : 69,78%.
- Q4_K_M (16,8 Go, 28 Go RAM, 22,5 tok/s) : HumanEval 50,61% (83/164), HellaSwag 86,00% (86/100), BFCL 63,00% (252/400). Moyenne : 66,54%.
- Q8_0 (28,6 Go, 42 Go RAM, 18,0 tok/s) : HumanEval 52,44% (86/164), HellaSwag 83,00% (83/100), BFCL 63,00% (252/400). Moyenne : 66,15%.
Points clés à retenir
Q4_K_M est la variante pratique qui se démarque. Elle préserve la précision BFCL (63,00% vs 63,25%), ne perd qu'environ 5,5 points sur HumanEval, et est ~4 points derrière BF16 sur HellaSwag. Les compromis : 1,45x plus rapide que BF16, 48% de RAM maximale en moins, 68,8% de fichier plus petit, et des performances d'appel de fonctions presque identiques. Q8_0 a déçu : il n'a amélioré HumanEval que d'environ 1,8 point par rapport à Q4_K_M mais a utilisé 42 Go de RAM contre 28 Go, était plus lent et a obtenu un score inférieur sur HellaSwag.
Pour un déploiement local/CPU, Q4_K_M est recommandé sauf si la charge de travail est fortement axée sur la génération de code. Pour une qualité maximale, BF16 reste le meilleur.
Configuration de l'évaluation
Variantes GGUF via llama-cpp-python avec n_ctx: 32768, évaluation avec points de contrôle. Le framework Neo AI Engineer a construit le pipeline d'évaluation GGUF, géré les exécutions avec points de contrôle et consolidé les résultats. L'étude de cas complète avec extraits de code est liée dans les commentaires originaux de Reddit.
📖 Lire la source complète : r/LocalLLaMA
👀 See Also

Modo : IDE IA open-source avec développement piloté par les spécifications et crochets d'agents
Modo est un IDE de bureau open-source construit sur l'éditeur Void qui ajoute des flux de travail de développement pilotés par les spécifications, des crochets d'agent et des fichiers de pilotage. Il structure les invites en exigences, conception et tâches avant de générer du code.

Cowork Context Management Kit Résout le Problème de Surcharge de Fichiers de Claude
Un développeur a créé un kit de gestion de contexte pour Cowork après que Claude AI lisait les 462 fichiers de leur dossier de projet, causant des problèmes de performance et des contradictions. La solution comprend des instructions globales, un système de fichiers manifeste et une compétence Cowork pour prioriser les documents pertinents.

Serveur MCP pour les projets TypeScript remplace les motifs Grep de Claude Code par des recherches de symboles indexés
Un développeur a créé un serveur MCP qui remplace le modèle de recherche approximative de Claude Code par des recherches indexées de symboles pour les projets TypeScript. L'outil maintient un index SQLite en direct des symboles, des sites d'appel, des importations et de la hiérarchie des classes, réduisant l'utilisation de tokens de 63 à 79 % dans les tests.

Codebook Lossless LLM Compression : Réduction de 10 à 25 % de la RAM grâce au Bitwise Packing
Le code de preuve de concept d'un développeur démontre une compression LLM sans perte en regroupant les poids fp16 en blocs, obtenant une réduction de 10 à 25 % de la RAM au prix d'une vitesse d'inférence approximativement divisée par deux. L'approche identifie que la plupart des modèles n'utilisent que 12 à 13 bits de valeurs uniques malgré la représentation sur 16 bits du fp16.