Qwen3.5-35B-A3B-UD-Q6_K_XL Testé dans les flux de travail de développement en production

Un développeur sur r/LocalLLaMA a partagé des résultats de test détaillés du modèle Qwen3.5-35B-A3B-UD-Q6_K_XL dans des scénarios de développement en production. L'utilisateur a réalisé à la fois des tests de benchmark et des applications pratiques sur des projets clients réels.
Benchmarks de Performance
Le modèle a obtenu des scores de benchmark de 1504pp2048 et 47.71 tg256. La vitesse de génération de tokens était solide lorsqu'elle était répartie sur deux GPU, et augmentait à 80 tokens par seconde (tps) lors de l'exécution sur un seul GPU.
Méthodologie de Test en Production
Le développeur a testé le modèle sur cinq projets différents en utilisant Git Worktrees pour revenir à des spécifications et fonctionnalités connues. Les spécifications pour ces tests ont été générées par Claude, le développeur utilisant un plan Max Pro depuis un an.
- Testé sur des projets JavaScript, Go et Rust
- Utilisé Git Worktrees pour le contrôle de version pendant les tests
- La plupart des "bugs" nécessitaient seulement des ajustements de 5 minutes ou pouvaient être corrigés avec une seconde requête
- Comparé l'expérience à l'utilisation de Sonnet 4
Résultats Pratiques et Implications Commerciales
Le développeur a rapporté que Qwen3.5 "a tout déchiré" pour le travail qu'il effectue, notant particulièrement de solides performances sur les projets Go et Rust. Cela a conduit à sérieusement envisager de passer de modèles basés sur API à une approche hybride : utiliser des modèles SOTA via API pour la génération de spécifications et les revues, tout en utilisant des modèles locaux pour le travail de développement.
Les tests ont soulevé des questions sur l'investissement matériel par rapport aux coûts d'abonnement. Le développeur a déjà dépensé 2 000 $ pour Claude Pro Max depuis juin 2025, avec des coûts potentiels atteignant 6 800 $ d'ici 2027 si les abonnements continuent. Cela a conduit à envisager l'achat d'un RTX 6000 Pro comme investissement commercial.
Le développeur utilisait auparavant Qwen Coder pour la complétion par tabulation, mais a constaté que Qwen3.5 amène les capacités des modèles locaux à un nouveau niveau pour un usage en production.
📖 Lire la source complète : r/LocalLLaMA
👀 See Also

Claude Code v2.1.90 ajoute la prise en charge de la souris avec le drapeau CLAUDE_CODE_NO_FLICKER
Anthropic a publié Claude Code v2.1.90 avec une nouvelle fonctionnalité qui permet la prise en charge de la souris dans l'interface de chat. Les utilisateurs peuvent l'activer en définissant la variable d'environnement CLAUDE_CODE_NO_FLICKER=1 avant d'exécuter claude.

claude-powerline v1.20 ajoute le mode tableau de bord TUI, les styles de barre de contexte et l'affichage des variables d'environnement.
claude-powerline v1.20 introduit un mode tableau de bord TUI qui remplace la simple ligne d'état par un panneau complet affichant les informations du modèle, l'utilisation du contexte avec barre de progression, les coûts, l'état git, et plus encore. La mise à jour ajoute 9 styles visuels de barre de progression pour l'utilisation du contexte et la capacité d'affichage des variables d'environnement.

git-courer : Un serveur MCP qui oblige les agents IA à rédiger des messages de commit Git appropriés
git-courer est un serveur MCP local en Go qui intercepte les diffs des agents de codage IA et les traduit en messages de commit structurés et lisibles avec les sections POURQUOI et QUOI.

ATLAS : Un Cadre d'Apprentissage Adaptatif en Temps de Test Surpasse Claude Sonnet sur les Benchmarks de Codage avec un GPU à 500 $
ATLAS atteint 74,6 % de réussite pass@1-v(k=3) sur LiveCodeBench avec un modèle figé de 14B sur un seul GPU grand public, surpassant les 71,4 % de Claude 4.5 Sonnet à une fraction du coût grâce à une génération pilotée par contraintes et un raffinement itératif auto-vérifié.