Qwen 3.6 27B testé sur DeepSWE : score de 2 %, 70 heures, 44k jetons de sortie en moyenne

✍️ OpenClawRadar📅 Publié: June 22, 2026🔗 Source
Qwen 3.6 27B testé sur DeepSWE : score de 2 %, 70 heures, 44k jetons de sortie en moyenne
Ad

Un utilisateur de Reddit a testé Qwen 3.6 27B sur le benchmark DeepSWE, obtenant un score de 2% (1,79% arrondi) — se classant 18e sur 20, devant Haiku 4.5 et Minimax M2.7. L'exécution complète a duré 70 heures, avec un temps moyen par tâche de 32 minutes et une moyenne de 44k tokens de sortie par tâche — étonnamment comparable au plus grand Qwen 3.6 Plus, malgré la réputation de verbosité du modèle 27B.

Méthodologie

  • Modèle : Qwen 3.6 27B FP8 avec cache KV BF16, raisonnement activé, fenêtre de contexte de 262k, servi via VLLM
  • Matériel : 1x RTX6000 Pro Blackwell sur RunPod
  • Agent : mini-swe sur sandbox Modal
  • 1 exécution par tâche (au lieu des 4 officielles) pour gagner du temps ; pas de plage de score
  • Coûts calculés à partir du tarif horaire RunPod pour les tâches terminées
  • Orchestration : Codex 5.5xhigh a supervisé et géré l'ensemble de l'exécution
Ad

Observations clés

L'auteur note que le score est étrangement proche de celui de Qwen 3.6 Plus, soulevant des questions sur les différences architecturales. Il soutient que les modèles locaux sont de plus en plus distancés par les offres propriétaires de pointe : K2.6 est le meilleur modèle open-source, mais la plupart des utilisateurs ne peuvent même pas l'exécuter localement. Qwen 3.6 27B est présenté comme une option locale « SOTA du pauvre ». La tendance suggère que les performances de pointe nécessitent une grande échelle, ce qui mène souvent à la fermeture du code, rendant l'inférence locale peu compétitive.

📖 Lire la source complète : r/LocalLLaMA

Ad

👀 See Also

Développeurs IA se promènent avec des ordinateurs ouverts pour maintenir les agents en marche
News

Développeurs IA se promènent avec des ordinateurs ouverts pour maintenir les agents en marche

Les passionnés de technologie transportent des ordinateurs portables en mode clamshell pour que les agents de codage IA comme Claude Code et OpenAI Codex ne s'arrêtent pas. Parmi les astuces, utiliser 'caffeinate' sur Mac.

OpenClawRadar
Claude Code v2.1.170 : Accès au modèle Claude Fable 5 et correction des sessions VS Code
News

Claude Code v2.1.170 : Accès au modèle Claude Fable 5 et correction des sessions VS Code

Claude Code v2.1.170 ajoute Claude Fable 5, un modèle de classe Mythos aux capacités inédites, et corrige la sauvegarde des sessions dans le terminal intégré de VS Code.

OpenClawRadar
Le développement de LibreOffice Online reprend après un vote de la communauté
News

Le développement de LibreOffice Online reprend après un vote de la communauté

La Fondation Document a repris le travail sur LibreOffice Online après qu'un vote communautaire a annulé le gel de 2022. TDF rouvrira le dépôt pour les contributions mais n'hébergera pas de serveurs, fournissant plutôt des outils auto-hébergeables.

OpenClawRadar
Claude a réglé une vraie alarme sur Android via le système d'intents — sans piratage, mais des problèmes de transparence persistent
News

Claude a réglé une vraie alarme sur Android via le système d'intents — sans piratage, mais des problèmes de transparence persistent

Claude AI a utilisé le système d'intentions standard d'Android pour créer une alarme native dans l'application Samsung Clock. L'utilisateur a d'abord craint une brèche, mais il s'agit d'une communication standard entre applications. L'absence de divulgation préalable des actions au niveau de l'appareil soulève des préoccupations de transparence.

OpenClawRadar