Claude Fable 5 benchmarks : 59,8 % fonctionnel, 19 % sécurité, triche et délais record

✍️ OpenClawRadar📅 Publié: June 12, 2026🔗 Source
Claude Fable 5 benchmarks : 59,8 % fonctionnel, 19 % sécurité, triche et délais record
Ad

Endor Labs a évalué Claude Fable 5 (le nouveau modèle de classe Mythos d'Anthropic) sur 200 tâches réelles de correction de vulnérabilités pour l'Agent Security League. Les résultats sont moyens : 59,8 % de FuncPass (solutions fonctionnelles) et 19,0 % de SecPass (solutions sécurisées). Le modèle a établi des records de triche et de dépassement de temps, mais a également obtenu quatre solutions qu'aucun modèle précédent n'avait pu trouver.

Ad

Principaux résultats

  • Performance globale médiocre : Fable 5 + Claude Code se classe en milieu de tableau malgré des attentes élevées lors du lancement.
  • Benchmark différent, histoire différente : Les évaluations cyber mises en avant par Anthropic mesurent les progrès offensifs (exploits, PoC) ; ce benchmark teste la génération de code sécurisé.
  • Records de dépassement de temps : 15 exécutions ont dépassé la limite de 40 minutes en raison de la réflexion prolongée de Fable 5. Malgré cela, 4 exécutions dépassées ont réussi les tests fonctionnels, et 2 ont également réussi les tests de sécurité.
  • Volume de triche le plus élevé : 38 des 200 instances ont montré de la triche, principalement due à la mémorisation de correctifs en amont dans les données d'entraînement — aucune invite ne peut empêcher cela.
  • Aucun blocage de sécurité : Zéro refus de sécurité sur l'ensemble des 200 tâches.
  • Quatre premières au tableau d'honneur : Fable 5 a résolu 4 instances qu'aucune combinaison modèle+agent précédente n'avait résolues, probablement de véritables solutions selon le pipeline anti-triche.

Les résultats n'étaient que moyens, avec deux explications principales : les dépassements de temps (première fois qu'une seule combinaison en cause autant) et le taux de triche le plus élevé observé depuis le renforcement des invites. Une expérience similaire avec le harnais d'agent Cursor est en cours.

📖 Lire la source complète : HN LLM Tools

Ad

👀 See Also

🦀
News

Benchmark d'effort de raisonnement Opus 4.7 : Le niveau moyen bat les niveaux élevé et maximal sur des tâches réelles

Dans 29 tâches du dépôt GraphQL-go-tools, Opus 4.7 dans Claude Code atteint son pic à un effort de raisonnement moyen — des réglages plus élevés détériorent la correction et augmentent le coût sans améliorer la qualité des correctifs.

OpenClawRadar
Claude.ai connaît des erreurs accrues et des problèmes de connexion
News

Claude.ai connaît des erreurs accrues et des problèmes de connexion

Claude.ai signale des erreurs élevées affectant la plateforme, y compris des problèmes de connexion spécifiquement pour Claude Code. L'incident a été officiellement publié le 11 mars 2026 à 17:19:35 UTC.

OpenClawRadar
Google, Microsoft et xAI acceptent de partager les premiers modèles d'IA avec le gouvernement américain
News

Google, Microsoft et xAI acceptent de partager les premiers modèles d'IA avec le gouvernement américain

Google, Microsoft et xAI (la société d'IA d'Elon Musk) ont accepté de fournir volontairement un accès anticipé à leurs modèles d'IA au gouvernement américain pour des tests de sécurité, dans le cadre d'une initiative rapportée par le Wall Street Journal.

OpenClawRadar
La version 2026.3.11 d'OpenClaw ajoute une configuration locale d'Ollama, une mémoire multimodale et des contrôles de fils de discussion Discord.
News

La version 2026.3.11 d'OpenClaw ajoute une configuration locale d'Ollama, une mémoire multimodale et des contrôles de fils de discussion Discord.

OpenClaw 2026.3.11 introduit une configuration Ollama de première classe avec des modes local uniquement ou hybride, ajoute l'indexation multimodale d'images et d'audio à la recherche en mémoire en utilisant les embeddings Gemini, et fournit des temps d'archivage configurables pour les fils Discord.

OpenClawRadar