Test du Qwen 3.6 27B local en tant que co-agent validateur Codex

Un développeur sur r/LocalLLaMA utilise un modèle Qwen local aux côtés de Codex d'OpenAI comme validateur et challenger, et a construit une petite suite d'évaluation reproductible pour quantifier les profils de quantification GGUF les plus adaptés à ce rôle. Le flux de travail : Codex s'occupe du travail principal sur le dépôt ; le Qwen local conteste le plan, vérifie les surconstructions, les directives dures manquées, les problèmes d'interface/design, les mauvaises hypothèses et les oublis de long-contexte. L'auteur examine chaque interaction avant de continuer.
Configuration de la suite d'évaluation
La suite teste les profils GGUF de Qwen 3.6 27B via llama.cpp, incluant les variantes Bartowski et Unsloth à différentes tailles de contexte et formats de cache KV (q8, f16). L'accent est mis sur les échecs réels : directives manquées, mauvais comportement de challenge, surconstruction, jugement UI, et oublis de long-contexte.
Résultats clés
- Les profils les plus performants sur cette suite étaient :
bartowski-128k-f16,bartowski-128k-q8etunsloth-128k-q8. Tous trois étaient à égalité en termes de précision. - Le cache KV q8 n'a montré aucune perte de précision mesurée dans cette suite spécifique.
- La taille du contexte était plus importante que le format du cache KV (f16 vs q8) pour ce flux de travail. Les profils 65k ont échoué lorsque la suite nécessitait plus de 65k tokens.
unsloth-128k-f16s'est chargé mais a rencontré des problèmes de mémoire/bande passante sur les cas long-contexte avec une RTX 5090.
Observations pratiques
L'auteur rapporte que Qwen est extrêmement efficace pour détecter les passages à vide silencieux, les surconstructions et les raccourcis de programmation jusqu'à la fin chez Codex. Pour les tâches liées à l'interface utilisateur, Qwen prend la tête en matière de design pendant que Codex implémente. Les rôles s'inversent : Qwen conteste le plan, et l'humain examine avant chaque étape.
Ressources
- Page du projet : https://robert896r1.github.io/qwen-realworld-accuracy-evals/
- Dépôt : https://github.com/robert896r1/qwen-realworld-accuracy-evals
📖 Lire la source complète : r/LocalLLaMA
👀 See Also

bareguard : Une barrière de sécurité légère pour les agents IA — désormais sur npm
bareguard v1.0 est une couche de sécurité d'environ 1 000 lignes, avec une seule dépendance, pour les agents IA qui bloque les actions destructrices (rm -rf, DROP TABLE) et impose des limites de budget avec escalade humaine. Faisant partie de la suite bare, disponible sur npm.

La chute silencieuse de Claude : l'échec de la couche d'action lorsque les agents IA investissent les sites d'affaires
Claude peut lire les sites web professionnels (tarifs, processus de réservation, formulaires) mais échoue au niveau de l'action — réservation, soumission ou routage — en raison de l'absence de points de terminaison appelables. Cela provoque une perte d'utilisateurs invisible, sans aucun signal d'analyse.

Skales : Un agent IA de bureau qui se connecte à Ollama sans Docker
Skales est un agent d'IA de bureau qui se connecte à Ollama localement, sans nécessiter de configuration Docker. Il propose des fonctionnalités comme la gestion des e-mails via Gmail IMAP, l'automatisation du navigateur et le chat vocal utilisant Whisper via Groq.

SideX : Un Portage de Visual Studio Code Basé sur Tauri
SideX est un portage de Visual Studio Code qui remplace Electron par Tauri, utilisant un backend Rust et la webview native du système d'exploitation. Le projet revendique la même architecture avec une taille 96 % plus petite, les fonctionnalités de base d'édition et de terminal étant actuellement opérationnelles.