GLM-5.1 sorti avec des performances de codage équivalentes à Claude Opus 4.5

Zhipu AI a lancé GLM-5.1, son dernier modèle phare, le rendant accessible à tous les utilisateurs du Coding Plan. Ce modèle démontre des capacités de codage qui approchent les niveaux de performance de Claude Opus 4.5.
Principaux benchmarks et spécifications
Selon les benchmarks de mars 2026 :
- SWE-bench-Verified : 77,8 points — score le plus élevé parmi les modèles open source
- Terminal Bench 2.0 : 56,2 points — également à la pointe de l'open source
- Surpasse GPT-4o et approche Claude Opus 4.5 sur les tâches de codage
Les spécifications techniques incluent :
- Fenêtre de contexte de 200K
- Sortie maximale de 128K
- 744B paramètres (40B activés)
- 28,5T de données de pré-entraînement
- Support natif MCP
Applications pratiques
Le matériel source indique que ces capacités se traduisent par :
- Tâches de codage autonomes multi-étapes avec un minimum d'assistance
- Refactorisation et débogage de bases de code à long contexte
- Flux de travail agentiques : planifier → exécuter → déboguer → livrer
GLM-5.1 est disponible dès maintenant via les niveaux du Coding Plan de Zhipu AI : Lite, Pro et Max. La discussion sur Reddit demande des comparaisons de tests réels contre Claude 4.6 pour les tâches de codage en production.
📖 Read the full source: r/openclaw
👀 See Also

Delve est accusé d'avoir forké SimStudio, le logiciel open-source de Sim.ai, et de le vendre sous le nom de Pathways.
La startup de conformité Delve aurait bifurqué l'outil open-source de création d'agents SimStudio de Sim.ai, l'aurait rebaptisé Pathways et l'aurait vendu sans attribution de licence appropriée ni accord monétaire avec Sim.ai, violant potentiellement les termes de la licence Apache.

Un développeur abandonne Cursor Composer 2 et Kimi 2.6 pour Qwen3.6:35b-a3b dans les charges de travail d'entreprise
Un développeur indique utiliser Qwen3.6:35b-a3b pour son travail quotidien sur une suite d'entreprise de 500 à 700 kLOC, citant de meilleures performances que Kimi 2.6 et DeepSeek 4 Pro/Flash, avec des coûts d'environ 0,08 $/1M de tokens sur OpenRouter.

Une étude révèle les biais culturels des LLM dans leur réponse à une simple requête de santé
Une étude comportementale a testé Claude 3.5 Sonnet, GPT-4o et Grok-2 avec l'invite 'J'ai mal à la tête. Que dois-je faire ?' Grok-2 a systématiquement recommandé des marques indiennes en vente libre comme Dolo-650 et Crocin, tandis que GPT-4o mentionnait Tylenol/Advil, révélant des biais dans les données d'entraînement.

Analyse de 413 000 Exécutions d'Agents IA Révèle les Clés de Leur Succès
Une analyse de 413 278 exécutions d'agents d'ingénierie logicielle IA issues du jeu de données CoderForge-Preview montre que les meilleures pratiques humaines en ingénierie logicielle nuisent souvent aux performances des agents. Les données révèlent des schémas spécifiques qui distinguent les exécutions réussies des échecs sur les mêmes problèmes.