Une étude révèle que les échecs de l'agent Claude Opus étaient d'ordre architectural, et non des problèmes d'alignement.

✍️ OpenClawRadar📅 Publié: March 2, 2026🔗 Source
Une étude révèle que les échecs de l'agent Claude Opus étaient d'ordre architectural, et non des problèmes d'alignement.
Ad

Une étude sur les agents révèle des lacunes architecturales critiques

Une étude récente menée par 38 chercheurs a testé Claude Opus et Kimi K2.5 dans un environnement en direct avec un accès réel aux emails, au shell et à un stockage persistant. Les deux modèles sont décrits comme étant "à peu près aussi compétents et bien alignés que les modèles actuels".

Échecs spécifiques documentés

  • Un agent a supprimé son propre serveur de messagerie
  • Deux agents sont restés bloqués dans une boucle infinie pendant 9 jours
  • Des données personnelles ont été divulguées parce qu'un agent a utilisé le mot "transférer" au lieu de "partager"
Ad

Conclusion clé : des problèmes architecturaux, pas d'alignement

L'article précise que ces échecs n'étaient pas des problèmes d'alignement. Les valeurs de Claude étaient "largement correctes tout au long". Le problème central était architectural :

  • Aucun modèle de parties prenantes
  • Aucun modèle de soi
  • Aucune limite d'exécution

Les modèles savaient ce qu'ils devaient faire mais n'avaient "rien d'externe pour l'imposer".

Implications pour le développement

La source note que la plupart des configurations actuelles "se contentent de s'appuyer sur l'invite système et espèrent le meilleur", soulignant la nécessité de protections architecturales plus robustes lors de la création d'applications sérieuses avec Claude.

📖 Lire la source complète : r/ClaudeAI

Ad

👀 See Also

Apple offre son service Private Cloud Compute gratuit aux développeurs indépendants de moins de 2 millions de téléchargements
News

Apple offre son service Private Cloud Compute gratuit aux développeurs indépendants de moins de 2 millions de téléchargements

Apple a annoncé à la WWDC 2026 que les développeurs avec moins de 2 millions de premiers téléchargements sur l'App Store peuvent utiliser ses Foundation Models dans Private Cloud Compute sans coût d'API cloud. Le framework gagne également l'entrée d'image et le support des modèles serveur.

OpenClawRadar
Anthropic sépare l'utilisation programmatique des abonnements Claude : un nouveau pool de crédits arrive le 15 juin
News

Anthropic sépare l'utilisation programmatique des abonnements Claude : un nouveau pool de crédits arrive le 15 juin

À partir du 15 juin, les abonnements Claude incluent un crédit mensuel dédié à l'utilisation programmatique (Agent SDK, claude -p, Claude Code GitHub Actions). Les crédits interactifs ne subventionnent plus les appels programmatiques ; une fois le pool épuisé, les utilisateurs paient les tarifs API complets.

OpenClawRadar
L'analyse des prix d'inférence révèle un écart de 4,4x pour un même modèle selon les fournisseurs.
News

L'analyse des prix d'inférence révèle un écart de 4,4x pour un même modèle selon les fournisseurs.

L'analyse des prix d'inférence pour Llama 3.1 70B Instruct révèle un écart de coût de 4,4x entre les fournisseurs, avec DeepInfra à 0,20 $/0,27 $ par million de tokens et Together à 0,88 $/0,88 $. Pour les modèles de raisonnement, l'écart atteint environ 30x entre DeepSeek R1 et OpenAI o1.

OpenClawRadar
🦀
News

Corrections de Claude Code v2.1.227 : abonnements aux indicateurs de fonctionnalité et erreurs Bash dans l’intégration continue

Claude Code v2.1.227 corrige l'évaluation des feature flags avec des jetons expirés, les échecs Bash dans claude-code-action, et améliore l'accessibilité du menu des commandes slash.

OpenClawRadar