Qwen 3.6 27B testé sur DeepSWE : score de 2 %, 70 heures, 44k jetons de sortie en moyenne

Un utilisateur de Reddit a testé Qwen 3.6 27B sur le benchmark DeepSWE, obtenant un score de 2% (1,79% arrondi) — se classant 18e sur 20, devant Haiku 4.5 et Minimax M2.7. L'exécution complète a duré 70 heures, avec un temps moyen par tâche de 32 minutes et une moyenne de 44k tokens de sortie par tâche — étonnamment comparable au plus grand Qwen 3.6 Plus, malgré la réputation de verbosité du modèle 27B.
Méthodologie
- Modèle : Qwen 3.6 27B FP8 avec cache KV BF16, raisonnement activé, fenêtre de contexte de 262k, servi via VLLM
- Matériel : 1x RTX6000 Pro Blackwell sur RunPod
- Agent : mini-swe sur sandbox Modal
- 1 exécution par tâche (au lieu des 4 officielles) pour gagner du temps ; pas de plage de score
- Coûts calculés à partir du tarif horaire RunPod pour les tâches terminées
- Orchestration : Codex 5.5xhigh a supervisé et géré l'ensemble de l'exécution
Observations clés
L'auteur note que le score est étrangement proche de celui de Qwen 3.6 Plus, soulevant des questions sur les différences architecturales. Il soutient que les modèles locaux sont de plus en plus distancés par les offres propriétaires de pointe : K2.6 est le meilleur modèle open-source, mais la plupart des utilisateurs ne peuvent même pas l'exécuter localement. Qwen 3.6 27B est présenté comme une option locale « SOTA du pauvre ». La tendance suggère que les performances de pointe nécessitent une grande échelle, ce qui mène souvent à la fermeture du code, rendant l'inférence locale peu compétitive.
📖 Lire la source complète : r/LocalLLaMA
👀 See Also

Anthropic désactive les jetons OAuth de Claude Code pour OpenClaw, nécessitant une facturation séparée.
Anthropic supprime la possibilité d'utiliser les jetons CLI Claude Code ou les jetons OAuth de longue durée avec des outils tiers comme OpenClaw à partir du 4 avril. Les utilisateurs devront activer une utilisation supplémentaire facturée séparément de leur abonnement.

Modèles de dépenses de l'agent OpenClaw et absence de plafonds de dépenses
Un développeur a suivi les dépenses de l'agent OpenClaw pendant plus de deux mois et a constaté que la plupart des agents dépensent en moyenne 40 à 80 $/mois en frais d'API et de services lorsqu'ils ne sont pas contrôlés, avec des pics survenant les week-ends et la nuit. Le comportement par défaut est illimité, sans plafond de dépenses intégré.

Bloomberg fait état des agents de codage IA et des préoccupations en matière de productivité en 2026
Un article de Bloomberg de février 2026 traite des agents d'IA de codage comme Claude Code et rapporte une 'panique de productivité' dans l'industrie technologique. L'article a reçu 44 points et 14 commentaires sur Hacker News.

N'utilisez pas l'IA pour écrire des choses que vous présentez comme votre propre travail
James Bach explique pourquoi il ne faut jamais utiliser l'IA pour rédiger un contenu que vous présentez comme vôtre. Il prévient que l'aveu d'une aide de l'IA dévalorise votre réputation et fait de tout travail ainsi produit de la pacotille.