Qwen 3.6 27B testé sur DeepSWE : score de 2 %, 70 heures, 44k jetons de sortie en moyenne

Un utilisateur de Reddit a testé Qwen 3.6 27B sur le benchmark DeepSWE, obtenant un score de 2% (1,79% arrondi) — se classant 18e sur 20, devant Haiku 4.5 et Minimax M2.7. L'exécution complète a duré 70 heures, avec un temps moyen par tâche de 32 minutes et une moyenne de 44k tokens de sortie par tâche — étonnamment comparable au plus grand Qwen 3.6 Plus, malgré la réputation de verbosité du modèle 27B.
Méthodologie
- Modèle : Qwen 3.6 27B FP8 avec cache KV BF16, raisonnement activé, fenêtre de contexte de 262k, servi via VLLM
- Matériel : 1x RTX6000 Pro Blackwell sur RunPod
- Agent : mini-swe sur sandbox Modal
- 1 exécution par tâche (au lieu des 4 officielles) pour gagner du temps ; pas de plage de score
- Coûts calculés à partir du tarif horaire RunPod pour les tâches terminées
- Orchestration : Codex 5.5xhigh a supervisé et géré l'ensemble de l'exécution
Observations clés
L'auteur note que le score est étrangement proche de celui de Qwen 3.6 Plus, soulevant des questions sur les différences architecturales. Il soutient que les modèles locaux sont de plus en plus distancés par les offres propriétaires de pointe : K2.6 est le meilleur modèle open-source, mais la plupart des utilisateurs ne peuvent même pas l'exécuter localement. Qwen 3.6 27B est présenté comme une option locale « SOTA du pauvre ». La tendance suggère que les performances de pointe nécessitent une grande échelle, ce qui mène souvent à la fermeture du code, rendant l'inférence locale peu compétitive.
📖 Lire la source complète : r/LocalLLaMA
👀 See Also

Traduction en français : Œuf de Pâques /buddy de Claude Code et Demandes de Fonctionnalités des Utilisateurs
Claude Code inclut une commande cachée /buddy qui crée un compagnon de style Tamagotchi avec une espèce, des statistiques et des commentaires décoratifs. Un abonné Max avec plus de 840 sessions a détaillé les limitations actuelles et proposé des améliorations fonctionnelles.

Anthropic acquiert Stainless pour plus de 300 millions de dollars — possède désormais le générateur de serveur MCP dominant
Anthropic a racheté Stainless, un générateur de SDK, pour plus de 300 millions de dollars. Stainless génère la plupart des serveurs MCP de production à partir de spécifications OpenAPI. Le produit hébergé est en cours d'arrêt ; les nouvelles inscriptions ont cessé lundi.

Claude-Code v2.1.30 Publié avec des Améliorations PDF et OAuth
Claude-Code v2.1.30 introduit des améliorations de lecture PDF, une configuration OAuth préétablie pour les serveurs MCP, ainsi que plusieurs corrections et améliorations.

Claude Code v2.1.193 : Nouvelle classification des shells, télémétrie et correctifs
Claude Code v2.1.193 ajoute la classification automatique de toutes les commandes shell, de nouveaux événements OpenTelemetry, l'autocomplétion des chemins de fichiers en mode bash, ainsi que des corrections pour les agents d'arrière-plan et l'authentification MCP.