GLM-5.1 sorti avec des performances de codage équivalentes à Claude Opus 4.5

✍️ OpenClawRadar📅 Publié: March 27, 2026🔗 Source
GLM-5.1 sorti avec des performances de codage équivalentes à Claude Opus 4.5
Ad

Zhipu AI a lancé GLM-5.1, son dernier modèle phare, le rendant accessible à tous les utilisateurs du Coding Plan. Ce modèle démontre des capacités de codage qui approchent les niveaux de performance de Claude Opus 4.5.

Principaux benchmarks et spécifications

Selon les benchmarks de mars 2026 :

  • SWE-bench-Verified : 77,8 points — score le plus élevé parmi les modèles open source
  • Terminal Bench 2.0 : 56,2 points — également à la pointe de l'open source
  • Surpasse GPT-4o et approche Claude Opus 4.5 sur les tâches de codage

Les spécifications techniques incluent :

  • Fenêtre de contexte de 200K
  • Sortie maximale de 128K
  • 744B paramètres (40B activés)
  • 28,5T de données de pré-entraînement
  • Support natif MCP
Ad

Applications pratiques

Le matériel source indique que ces capacités se traduisent par :

  • Tâches de codage autonomes multi-étapes avec un minimum d'assistance
  • Refactorisation et débogage de bases de code à long contexte
  • Flux de travail agentiques : planifier → exécuter → déboguer → livrer

GLM-5.1 est disponible dès maintenant via les niveaux du Coding Plan de Zhipu AI : Lite, Pro et Max. La discussion sur Reddit demande des comparaisons de tests réels contre Claude 4.6 pour les tâches de codage en production.

📖 Read the full source: r/openclaw

Ad

👀 See Also

Delve est accusé d'avoir forké SimStudio, le logiciel open-source de Sim.ai, et de le vendre sous le nom de Pathways.
News

Delve est accusé d'avoir forké SimStudio, le logiciel open-source de Sim.ai, et de le vendre sous le nom de Pathways.

La startup de conformité Delve aurait bifurqué l'outil open-source de création d'agents SimStudio de Sim.ai, l'aurait rebaptisé Pathways et l'aurait vendu sans attribution de licence appropriée ni accord monétaire avec Sim.ai, violant potentiellement les termes de la licence Apache.

OpenClawRadar
Un développeur abandonne Cursor Composer 2 et Kimi 2.6 pour Qwen3.6:35b-a3b dans les charges de travail d'entreprise
News

Un développeur abandonne Cursor Composer 2 et Kimi 2.6 pour Qwen3.6:35b-a3b dans les charges de travail d'entreprise

Un développeur indique utiliser Qwen3.6:35b-a3b pour son travail quotidien sur une suite d'entreprise de 500 à 700 kLOC, citant de meilleures performances que Kimi 2.6 et DeepSeek 4 Pro/Flash, avec des coûts d'environ 0,08 $/1M de tokens sur OpenRouter.

OpenClawRadar
Une étude révèle les biais culturels des LLM dans leur réponse à une simple requête de santé
News

Une étude révèle les biais culturels des LLM dans leur réponse à une simple requête de santé

Une étude comportementale a testé Claude 3.5 Sonnet, GPT-4o et Grok-2 avec l'invite 'J'ai mal à la tête. Que dois-je faire ?' Grok-2 a systématiquement recommandé des marques indiennes en vente libre comme Dolo-650 et Crocin, tandis que GPT-4o mentionnait Tylenol/Advil, révélant des biais dans les données d'entraînement.

OpenClawRadar
Analyse de 413 000 Exécutions d'Agents IA Révèle les Clés de Leur Succès
News

Analyse de 413 000 Exécutions d'Agents IA Révèle les Clés de Leur Succès

Une analyse de 413 278 exécutions d'agents d'ingénierie logicielle IA issues du jeu de données CoderForge-Preview montre que les meilleures pratiques humaines en ingénierie logicielle nuisent souvent aux performances des agents. Les données révèlent des schémas spécifiques qui distinguent les exécutions réussies des échecs sur les mêmes problèmes.

OpenClawRadar