Le test de codage Pacman passé par Qwen 3.6 27B F16, mais échec des quantifications 8 bits — Leçons clés sur les modèles et le décodage spéculatif MTP

✍️ OpenClawRadar📅 Publié: May 19, 2026🔗 Source
Le test de codage Pacman passé par Qwen 3.6 27B F16, mais échec des quantifications 8 bits — Leçons clés sur les modèles et le décodage spéculatif MTP
Ad

Un développeur sur r/LocalLLaMA a partagé un benchmark pratique de codage : générer en une seule tentative un clone de Pacman sur une page à partir d'une bonne invite, trois essais, garder le meilleur. Qwen 3.6 27B F16 a produit deux jeux quasi parfaits — le premier modèle local à réussir. Cependant, passer à une quantification 8 bits a rendu les bons résultats impossibles à reproduire même après cinq tentatives, renforçant l'affirmation selon laquelle la quantification 8 bits n'est pas sans perte pour les tâches génératives complexes.

Principales conclusions techniques du post :

  • Le template de chat est crucial : Le template officiel de Qwen est optimisé pour vLLM et contient des erreurs dans llama.cpp et autres exécuteurs. L'auteur a corrigé les bugs de manière itérative, et après le réglage, le modèle a semblé « d'un nouveau niveau d'intelligence ».
  • Le décodage spéculatif MTP varie selon la tâche : Pour les tâches déterministes comme le codage, la génération tok/s variait de 8 à 18 tok/s (base sans MTP : 6,6 tok/s). Les tâches créatives bénéficient de moins d'accélération.
  • Le choix du framework affecte davantage la vitesse que la qualité du code : Qwen CLI a fonctionné étonnamment bien — comparable à Claude Code en qualité de sortie, mais beaucoup plus rapide car les invites supplémentaires de Claude Code ralentissent les modèles locaux. Avec un modèle lent comme Qwen 3.6 27B à environ 6 tok/s, chaque invite supplémentaire ajoute une latence pénible.
  • Ne pas interférer avec la gestion du contexte : La mise en cache et la compaction natives du contexte du modèle fonctionnent bien. Les plugins ou outils qui manipulent le cache ou le contexte perturbent le modèle et dégradent les performances.
  • Les appels d'outils et les sous-agents fonctionnent parfaitement après les corrections appropriées du template de chat. La compaction du contexte, l'utilisation du shell et les sous-agents parallèles fonctionnent tous comme prévu.

L'auteur prévient que les résultats dépendent fortement de la configuration de l'exécuteur : utilisez des poids F16, un template de chat corrigé, et évitez les frameworks lourds sauf si vous avez une inférence rapide. Le résultat complet du Pacman jouable est disponible sur guigand.com/pacman.

Ad

📖 Lisez la source complète : r/LocalLLaMA

Ad

👀 See Also

SpecLock : Serveur MCP pour l'application de contraintes de codage IA
Tools

SpecLock : Serveur MCP pour l'application de contraintes de codage IA

SpecLock est un serveur MCP open source qui mémorise les contraintes du projet entre les sessions et empêche les agents d'IA de codage de les violer. Claude l'a testé indépendamment avec 100 tests adversariaux, obtenant un score de 100/100 avec zéro faux positif et 15,7 ms par vérification.

OpenClawRadar
RepoLens : Empaqueteur interactif de code source local et optimiseur de jetons (TUI/CLI) en Go
Tools

RepoLens : Empaqueteur interactif de code source local et optimiseur de jetons (TUI/CLI) en Go

RepoLens est un outil Go sans dépendances qui empaquette les dépôts pour le contexte LLM avec un explorateur de fichiers TUI, un compteur de jetons en direct, la suppression des commentaires, un scanner de secrets, et un découpage des fichiers basé sur les jetons.

OpenClawRadar
Les tests de référence MemAware évaluent la mémoire de l'IA au-delà de la simple recherche par mots-clés.
Tools

Les tests de référence MemAware évaluent la mémoire de l'IA au-delà de la simple recherche par mots-clés.

MemAware est un benchmark avec 900 questions réparties sur 3 niveaux de difficulté qui teste si les assistants IA dotés de mémoire peuvent faire remonter un contexte pertinent lorsque les requêtes ne le suggèrent pas. Les résultats montrent que la recherche BM25 a obtenu 2,8 % contre 0,8 % sans mémoire, tandis que la recherche vectorielle chute à 0,7 % sur les connexions inter-domaines.

OpenClawRadar
Chat Saver CG : Extension de navigateur conçue avec Claude Exporte les conversations sur 12 plateformes d'IA
Tools

Chat Saver CG : Extension de navigateur conçue avec Claude Exporte les conversations sur 12 plateformes d'IA

Un développeur a créé Chat Saver CG, une extension de navigateur qui exporte et transfère les conversations entre Claude, ChatGPT, Gemini et 9 autres plateformes d'IA, en utilisant Claude de manière intensive pour le développement, y compris pour les décisions d'architecture, le débogage des problèmes d'analyse DOM et l'écriture de la logique d'adaptation.

OpenClawRadar