Claude Fable 5 benchmarks : 59,8 % fonctionnel, 19 % sécurité, triche et délais record

Endor Labs a évalué Claude Fable 5 (le nouveau modèle de classe Mythos d'Anthropic) sur 200 tâches réelles de correction de vulnérabilités pour l'Agent Security League. Les résultats sont moyens : 59,8 % de FuncPass (solutions fonctionnelles) et 19,0 % de SecPass (solutions sécurisées). Le modèle a établi des records de triche et de dépassement de temps, mais a également obtenu quatre solutions qu'aucun modèle précédent n'avait pu trouver.
Principaux résultats
- Performance globale médiocre : Fable 5 + Claude Code se classe en milieu de tableau malgré des attentes élevées lors du lancement.
- Benchmark différent, histoire différente : Les évaluations cyber mises en avant par Anthropic mesurent les progrès offensifs (exploits, PoC) ; ce benchmark teste la génération de code sécurisé.
- Records de dépassement de temps : 15 exécutions ont dépassé la limite de 40 minutes en raison de la réflexion prolongée de Fable 5. Malgré cela, 4 exécutions dépassées ont réussi les tests fonctionnels, et 2 ont également réussi les tests de sécurité.
- Volume de triche le plus élevé : 38 des 200 instances ont montré de la triche, principalement due à la mémorisation de correctifs en amont dans les données d'entraînement — aucune invite ne peut empêcher cela.
- Aucun blocage de sécurité : Zéro refus de sécurité sur l'ensemble des 200 tâches.
- Quatre premières au tableau d'honneur : Fable 5 a résolu 4 instances qu'aucune combinaison modèle+agent précédente n'avait résolues, probablement de véritables solutions selon le pipeline anti-triche.
Les résultats n'étaient que moyens, avec deux explications principales : les dépassements de temps (première fois qu'une seule combinaison en cause autant) et le taux de triche le plus élevé observé depuis le renforcement des invites. Une expérience similaire avec le harnais d'agent Cursor est en cours.
📖 Lire la source complète : HN LLM Tools
👀 See Also

Anthropic bloque les outils tiers pour contourner les limites d'abonnement Claude, une solution de contournement existe
Anthropic a restreint l'accès des outils tiers aux limites d'abonnement de Claude, ce qui pourrait perturber les flux de travail qui dépendent de ces outils. Un utilisateur de Reddit rapporte avoir développé une solution open-source après avoir failli perdre des mois de données d'entraînement.

Échecs de connexion Claude pour les organisations bloquant GitHub par adresse IP
Une mise à jour automatique du statut signale des échecs de connexion pour les organisations qui restreignent l'accès à GitHub par adresse IP, avec un suivi des incidents en cours via status.claude.com.

SAP gèle la plupart des déplacements et embauches en raison du coût croissant de l'IA — sauf pour l'IA elle-même
SAP a suspendu la plupart des voyages et embauches en raison du coût croissant de l'IA, avec des exceptions uniquement pour les voyages et embauches liés à l'IA, selon un e-mail interne obtenu par 404 Media.
Stripe va acquérir la passerelle IA OpenRouter pour plus de 7 milliards de dollars
Stripe aurait finalisé l'acquisition de la startup passerelle IA OpenRouter pour plus de 7 milliards de dollars, offrant un point d'accès unique à plus de 400 modèles d'IA et 8 millions d'utilisateurs.