Le modèle d'IA Claude Mythos d'Anthropic révélé dans une fuite de données, décrit comme un "changement d'étape" dans les capacités

✍️ OpenClawRadar📅 Publié: March 27, 2026🔗 Source
Le modèle d'IA Claude Mythos d'Anthropic révélé dans une fuite de données, décrit comme un "changement d'étape" dans les capacités
Ad

Ce qui a été divulgué

Une fuite de données provenant d'un stock de données non sécurisé et accessible au public a révélé qu'Anthropic développe et teste un nouveau modèle d'IA appelé Claude Mythos. La fuite comprenait environ 3 000 ressources non publiées liées au blog d'Anthropic, y compris ce qui semblait être un brouillon d'article de blog annonçant le nouveau modèle.

Détails du modèle selon la source

D'après les documents divulgués :

  • Le modèle s'appelle "Claude Mythos" et est également désigné sous le nom de "Capybara", qu'Anthropic décrit comme "un nouveau nom pour un nouveau niveau de modèle : plus grand et plus intelligent que nos modèles Opus".
  • Capybara représente un nouveau niveau supérieur à Opus dans la hiérarchie des modèles d'Anthropic (qui comprend actuellement Opus comme le plus grand/le plus performant, Sonnet comme plus rapide/moins cher, et Haiku comme le plus petit/le plus rapide).
  • Comparé à Claude Opus 4.6, Capybara obtient "des scores nettement supérieurs sur les tests de codage logiciel, de raisonnement académique et de cybersécurité, entre autres".
  • Le brouillon d'article de blog décrit Claude Mythos comme "de loin le modèle d'IA le plus puissant que nous ayons jamais développé".
  • Anthropic considère ce modèle comme "un changement d'étape et le plus performant que nous ayons construit à ce jour".
Ad

Statut actuel et déploiement

Le modèle est actuellement testé par des "clients en accès anticipé" dans le cadre d'une stratégie de déploiement prudente. Selon le matériel source :

  • Le modèle est coûteux à exécuter et n'est pas encore prêt pour une sortie générale
  • Anthropic "agit avec prudence quant à la manière dont nous le déployons" en raison de la puissance de ses capacités
  • L'entreprise travaille avec "un petit groupe de clients en accès anticipé pour tester le modèle"
  • La fuite a également révélé des détails sur un sommet réservé aux PDG sur invitation prévu en Europe, dans le cadre de la démarche d'Anthropic pour vendre des modèles d'IA à de grandes entreprises clientes

Implications en matière de sécurité

Le brouillon d'article de blog indiquait que l'entreprise estime que Claude Mythos "présente des risques de cybersécurité sans précédent". La fuite elle-même résulte de ce qu'Anthropic a décrit comme une "erreur humaine" dans la configuration de son système de gestion de contenu, qui a rendu le contenu des brouillons accessible au public.

Contexte pour les développeurs utilisant des agents d'IA de codage

Pour les développeurs qui s'appuient sur des assistants d'IA de codage, cette fuite suggère que des améliorations significatives des capacités de codage pourraient bientôt venir d'Anthropic. La mention spécifique de "scores nettement supérieurs sur les tests de codage logiciel" indique des avancées potentielles qui pourraient affecter les outils et les flux de travail intégrés à l'API de Claude.

📖 Read the full source: HN AI Agents

Ad

👀 See Also

RTX 4090 vs H100 pour le Fine-Tuning de Llama-3-8B : Une Comparaison Coût-Performance
News

RTX 4090 vs H100 pour le Fine-Tuning de Llama-3-8B : Une Comparaison Coût-Performance

Un développeur a testé le fine-tuning de Llama-3-8B sur une RTX 4090 et sur des instances H100 louées. La configuration avec la 4090 a coûté 2 000 $ d'avance et a pris 24 heures, tandis que la location de H100 a coûté environ 80 $ et s'est terminée en 4 heures.

OpenClawRadar
Claude AI passe 81 minutes sur une « vraie réflexion » – Les rapports d'utilisateurs augmentent lors des mises à jour majeures
News

Claude AI passe 81 minutes sur une « vraie réflexion » – Les rapports d'utilisateurs augmentent lors des mises à jour majeures

Un utilisateur rapporte que Claude AI a passé 1 heure 21 minutes sur une tâche simple, spéculant que les pics de performance surviennent brièvement après les mises à jour majeures. Exemple : une demande de recherche a scanné 5 113 sources en une session, mais plus tard seulement 100-200 sources pour des requêtes similaires.

OpenClawRadar
Déploiement sans effort : Nouvelle configuration AWS en un clic pour Open Claw disponible
News

Déploiement sans effort : Nouvelle configuration AWS en un clic pour Open Claw disponible

Les passionnés d'Open Claw ont désormais une raison de se réjouir. Un nouvel outil de déploiement AWS en un clic simplifie le processus d'installation d'Open Claw, le rendant plus accessible aux développeurs comme aux amateurs.

OpenClawRadar
Claude Opus 4.1 obtient un score de 17,75 % sur l'ensemble de données privé de SWE-Bench Pro, mettant en lumière l'écart entre mémorisation et raisonnement.
News

Claude Opus 4.1 obtient un score de 17,75 % sur l'ensemble de données privé de SWE-Bench Pro, mettant en lumière l'écart entre mémorisation et raisonnement.

Claude Opus 4.1 a obtenu 80 % sur SWE-Bench Verified mais est tombé à 17,75 % sur l'ensemble de données privé de SWE-Bench Pro comprenant 276 tâches issues de 18 bases de code propriétaires de startups. L'analyse de Scale AI a révélé que les modèles naviguaient par mémoire plutôt que par raisonnement sur des dépôts familiers.

OpenClawRadar