Test du Qwen 3.6 27B local en tant que co-agent validateur Codex

Un développeur sur r/LocalLLaMA utilise un modèle Qwen local aux côtés de Codex d'OpenAI comme validateur et challenger, et a construit une petite suite d'évaluation reproductible pour quantifier les profils de quantification GGUF les plus adaptés à ce rôle. Le flux de travail : Codex s'occupe du travail principal sur le dépôt ; le Qwen local conteste le plan, vérifie les surconstructions, les directives dures manquées, les problèmes d'interface/design, les mauvaises hypothèses et les oublis de long-contexte. L'auteur examine chaque interaction avant de continuer.
Configuration de la suite d'évaluation
La suite teste les profils GGUF de Qwen 3.6 27B via llama.cpp, incluant les variantes Bartowski et Unsloth à différentes tailles de contexte et formats de cache KV (q8, f16). L'accent est mis sur les échecs réels : directives manquées, mauvais comportement de challenge, surconstruction, jugement UI, et oublis de long-contexte.
Résultats clés
- Les profils les plus performants sur cette suite étaient :
bartowski-128k-f16,bartowski-128k-q8etunsloth-128k-q8. Tous trois étaient à égalité en termes de précision. - Le cache KV q8 n'a montré aucune perte de précision mesurée dans cette suite spécifique.
- La taille du contexte était plus importante que le format du cache KV (f16 vs q8) pour ce flux de travail. Les profils 65k ont échoué lorsque la suite nécessitait plus de 65k tokens.
unsloth-128k-f16s'est chargé mais a rencontré des problèmes de mémoire/bande passante sur les cas long-contexte avec une RTX 5090.
Observations pratiques
L'auteur rapporte que Qwen est extrêmement efficace pour détecter les passages à vide silencieux, les surconstructions et les raccourcis de programmation jusqu'à la fin chez Codex. Pour les tâches liées à l'interface utilisateur, Qwen prend la tête en matière de design pendant que Codex implémente. Les rôles s'inversent : Qwen conteste le plan, et l'humain examine avant chaque étape.
Ressources
- Page du projet : https://robert896r1.github.io/qwen-realworld-accuracy-evals/
- Dépôt : https://github.com/robert896r1/qwen-realworld-accuracy-evals
📖 Lire la source complète : r/LocalLLaMA
👀 See Also
Utiliser un chat Claude adversarial pour détecter les ambiguïtés de lancement avant qu'elles ne vous coûtent
Un développeur a ajouté un deuxième chat Claude dont la seule fonction est d'examiner de manière antagoniste les kickoffs pour détecter les spécifications ambiguës et les défaillances silencieuses, économisant ainsi entre 150 et 400 dollars de rework sur Claude Code au cours d'une phase de projet.

Outil Local d'Analyse d'Images par IA Utilise des Modèles de Vision Ollama pour les Retours
Un développeur a créé une application de bureau gratuite qui analyse localement les images générées par IA à l'aide des modèles de vision Ollama. L'outil fournit des rapports de retour structurés incluant des suggestions d'amélioration et des optimisations de prompts.

Le Chef de Produit Partage Plus de 70 Compétences Claude pour Automatiser les Flux de Travail de Gestion de Produit
Un chef de produit avec 20 ans d'expérience a créé plus de 70 compétences Claude qui automatisent des tâches courantes de gestion de produit, incluant la génération de PRD, l'analyse d'entretiens utilisateurs, le profilage concurrentiel et la construction de feuilles de route. Les compétences sont disponibles sous forme de fichiers .md téléchargeables pour Claude Code.

Codex-GPT5.4 de OpenClaw - Problème de boucle de validation des tâches
Un développeur signale que Codex-GPT5.4 via OpenClaw reste bloqué dans une boucle de validation de tâches lors de travaux de projet autonomes, identifiant et confirmant des tâches de manière répétée sans les exécuter. Ils ont mis en place des contrôles d'espace de travail incluant TASKS.md, des règles de heartbeat et des fichiers de persona pour résoudre le problème.