Claude Opus 5.5 : 40 % moins cher qu'Opus 5, 66,4 % sur Terminal-Bench 4.0
Anthropic a lancé Claude Opus 5.5, le premier modèle de la nouvelle famille Claude 5.5. Il offre des performances équivalentes à Claude Fable 5.1 sur la plupart des tâches et coûte 40 % moins cher à exécuter qu'Opus 5. Les tokens d'entrée et de sortie sont facturés respectivement 4 $ et 20 $ par million — soit 20 % de moins qu'Opus 5 — tandis que les lectures de cache, qui représentent selon Anthropic l'essentiel des coûts des tâches agentiques et de codage, tombent à 0,20 $ par million, une réduction de 60 %. La génération de sortie est plus de 30 % plus rapide qu'Opus 5.
Benchmarks
Opus 5.5 arrive en tête sur le codage agentique, l'utilisation d'ordinateur et le travail de connaissance :
- Terminal-Bench 4.0 : 66,4 % (contre 55,8 % pour Fable 5.1, 52,3 % pour Opus 5, 57,9 % pour GPT-6 Astra, 37,3 % pour GPT-5.6 Sol)
- FrontierCode v1.1 (Main) : 54,4 % (Fable 5.1 : 50,3 %, Opus 5 : 48,0 %)
- CursorBench 4.0 : 57,8 % (Fable 5.1 : 51,8 %, Opus 5 : 46,6 %)
- GDPval-AA v2.1 : 1846 (Fable 5.1 : 1735, Opus 5 : 1708)
- AutomationBench : 40,0 % (Fable 5.1 : 31,4 %, Opus 5 : 26,9 %)
- Humanity's Last Exam : 67,7 % avec outils (Fable 5.1 : 65,6 %, Opus 5 : 63,6 %)
- Terminal-Bench-Science 0.1 : 58,7 % (Fable 5.1 : 52,6 %, Opus 5 : 29,0 %, GPT-6 Astra : 64,6 %)
Anthropic note que les écarts dans les benchmarks sont devenus un guide moins fiable des différences réelles à ce niveau, et que l'écart entre Opus 5.5 et Fable 5.1 est plus étroit en pratique que ne le suggèrent les scores.
Charges de travail rapportées
Un testeur a réalisé une migration de code de 680 000 lignes en moins d'une journée. Dans un test interne visant à réduire les temps de chargement de toutes les pages d'une application web, Opus 5.5 a réussi 39 fois sur 40 — Opus 5 apportait des améliorations plus modestes qui modifiaient aussi le comportement de l'application. Un autre testeur a fait construire un jeu à plusieurs modèles Claude à partir d'un seul prompt ; Opus 5.5 a obtenu les meilleurs scores en graphismes et en finition.
Sécurité et vérification
Opus 5.5 obtient les meilleurs scores à ce jour sur l'audit comportemental automatisé d'Anthropic, une suite qui teste Claude sur des milliers de scénarios simulés. Il est moins susceptible que les modèles récents de prendre des mesures difficiles à inverser ou d'agir en dehors des limites fixées, et il résiste mieux à l'injection de prompt qu'Opus 5. Les tests couvrent désormais des tâches plus longues, des tâches impossibles et des scénarios inspirés d'incidents réels. Comme il est comparable à Claude Mythos 5.1 en biologie et en cybersécurité, Anthropic le déploie avec des garde-fous similaires à ceux de Claude Fable 5.1.
Les organisations vérifiées peuvent candidater au Life Sciences Verification Program pour un usage en recherche biologique ; le Cyber Verification Program s'étendra dans les semaines à venir pour les praticiens vérifiés.
Limites et disponibilité
Les limites d'usage de cinq heures sur les forfaits Pro, Max, Team et Enterprise basés sur des sièges augmentent. Les utilisateurs d'abonnement bénéficient d'une réinitialisation de limite de débit qu'ils peuvent conserver et utiliser à volonté. Claude Sonnet 5.5 et Claude Haiku 5.5 suivront dans les semaines à venir avec des améliorations similaires en performance, efficacité et sécurité.
📖 Lire la source complète : HN AI Agents
👀 See Also

Claude Code v2.1.132 : Arrêt gracieux SIGINT, correctifs MCP et refonte de la gestion du terminal
Claude Code v2.1.132 corrige l'arrêt gracieux sur SIGINT externe, ajoute les variables d'environnement CLAUDE_CODE_SESSION_ID et CLAUDE_CODE_DISABLE_ALTERNATE_SCREEN, corrige les fuites mémoire MCP et les tentatives de liste d'outils, et résout des dizaines de cas limites de terminaux dans les terminaux IDE.

Claude Desktop vs Claude Code : Les différences de prompts système influencent le comportement de l'IA
Un utilisateur signale des différences comportementales significatives entre Claude Desktop et Claude Code, malgré l'utilisation du même modèle Claude Opus, du même compte et des mêmes paramètres. Les différences incluent un accord réflexif, des conseils de bien-être non sollicités et un cadrage axé sur les affaires dans Desktop qui n'apparaissent pas dans Code.

Comparaison de référence de Qwen3.6 Plus avec les modèles SOTA occidentaux
Qwen3.6 Plus obtient un score de 78,8 sur SWE-bench Verified, 90,4 sur GPQA/GPQA Diamond, 28,8 sur HLE (sans outils) et 78,8 sur MMMU-Pro, ce qui le place en position compétitive face à des modèles comme GPT-5.4, Claude Opus 4.6 et Gemini 3.1 Pro Preview.

Claude Code v2.1.74 Mises à jour du Prompt Système : Règles de Sécurité, Sélection de Mémoire et Nouvelles Compétences
Claude Code v2.1.74 ajoute 1 750 jetons aux invites système, incluant de nouvelles règles de surveillance de sécurité bloquant les écritures externes non autorisées, une compétence /stuck pour diagnostiquer les sessions gelées, et des améliorations de sélection de mémoire qui ignorent les références API redondantes.