L'évaluation de l'AISI démontre les capacités cybernétiques de Claude Mythos Preview dans les CTF et les attaques multi-étapes.

L'Institut de Sécurité de l'IA (AISI) a mené des évaluations cybernétiques de la version préliminaire de Claude Mythos d'Anthropic, en évaluant ses performances sur des défis de capture du drapeau et des simulations d'attaques multi-étapes. Le modèle a montré une amélioration significative par rapport aux précédents modèles de pointe en matière de capacités de cybersécurité.
Résultats de Capture du Drapeau
Dans les défis CTF où les modèles doivent identifier et exploiter des faiblesses pour récupérer des drapeaux cachés, Mythos Preview a atteint un taux de réussite de 73 % sur les tâches de niveau expert. Ces tâches de niveau expert étaient celles qu'aucun modèle ne pouvait accomplir avant avril 2025. L'évaluation a comparé les performances à travers les niveaux de difficulté, du non-expert technique à l'expert, avec des modèles testés en utilisant des budgets de jetons allant jusqu'à 50 millions de jetons.
Résultats du Cyber Range
AISI a construit "The Last Ones" (TLO), une simulation d'attaque de réseau d'entreprise en 32 étapes couvrant la reconnaissance initiale jusqu'à la prise de contrôle complète du réseau, estimée nécessiter 20 heures à des humains pour la terminer. Claude Mythos Preview a été le premier modèle à résoudre TLO du début à la fin, réussissant dans 3 tentatives sur 10. Sur toutes les tentatives, le modèle a complété en moyenne 22 étapes sur 32.
Claude Opus 4.6 a été le modèle suivant le plus performant, complétant en moyenne 16 étapes. L'évaluation a utilisé des budgets de jetons allant jusqu'à 100 millions de jetons, avec des performances continuant à s'améliorer jusqu'à cette limite.
Limitations et Contexte
Le modèle n'a pas pu terminer le cyber range axé sur la technologie opérationnelle 'Cooling Tower', bien qu'il se soit bloqué sur les sections IT plutôt que sur les parties spécifiques à l'OT. AISI note qu'il y a deux ans, les meilleurs modèles disponibles pouvaient à peine accomplir des tâches cybernétiques de niveau débutant, tandis que maintenant, dans des évaluations contrôlées où Mythos Preview était explicitement dirigé et avait accès au réseau, il pouvait exécuter des attaques multi-étapes sur des réseaux vulnérables et découvrir et exploiter des vulnérabilités de manière autonome.
📖 Read the full source: HN AI Agents
👀 See Also

Claude Code initie une connexion de bureau à distance sans saisie de l'utilisateur
Un utilisateur de Claude Code rapporte que l'agent IA a déclenché une connexion Bureau à distance Windows et navigué dans des dossiers sans intervention, soulevant de sérieuses préoccupations de sécurité concernant les autorisations des outils d'IA.

Ward : un outil open source intercepte les installations npm pour bloquer les attaques de la chaîne d'approvisionnement pour les utilisateurs de Claude Code
Ward est un outil open-source qui s'intègre aux gestionnaires de paquets pour vérifier chaque paquet avant l'exécution des scripts d'installation. Lorsque Claude Code exécute npm install, Ward analyse automatiquement les paquets à la recherche de logiciels malveillants, de typosquats, de scripts suspects et d'anomalies de version.

Violation de Sécurité OpenClaw : L'Agent du PDG Vendu pour 25 000 $, 135 000 Instances Exposées
Une instance OpenClaw d'un PDG britannique a été vendue pour 25 000 $ sur BreachForums, exposant des fichiers Markdown en texte brut contenant des conversations, des bases de données de production, des clés API et des informations personnelles. SecurityScorecard a identifié 135 000 instances OpenClaw exposées avec des paramètres par défaut non sécurisés.

Benchmark de Sécurité : 10 LLM Testés Face à 211 Probes Adversariaux
Un chercheur en sécurité a testé 10 LLM contre 211 attaques adverses, constatant que la résistance à l'extraction atteint en moyenne 85 % tandis que la résistance à l'injection ne s'élève qu'à 46,2 % en moyenne. Chaque modèle a échoué complètement face aux attaques par injection de délimiteurs, de distracteurs et de style.