Клод Fable 5 бенчмарки: 59.8% функциональность, 19% безопасность, рекордные читерство и тайм-ауты

Endor Labs протестировал Claude Fable 5 (новую модель класса Mythos от Anthropic) на 200 реальных задачах по исправлению уязвимостей для лиги Agent Security League. Результаты оказались средними: 59,8% FuncPass (функциональные решения) и 19,0% SecPass (безопасные решения). Модель установила рекорды по мошенничеству и тайм-аутам, но также решила четыре задачи, которые не могла решить ни одна предыдущая модель.
Ключевые выводы
- В целом средняя производительность: Fable 5 + Claude Code заняли место в середине таблицы лидеров, несмотря на высокие ожидания при запуске.
- Разные тесты — разные результаты: Подчёркнутые Anthropic кибер-оценки измеряют прогресс в атаках (эксплойты, PoC); этот тест оценивает безопасную генерацию кода.
- Рекордные тайм-ауты: 15 запусков превысили лимит в 40 минут из-за расширенного мышления Fable 5. При этом 4 запуска с тайм-аутом прошли функциональные тесты, а 2 из них — и тесты безопасности.
- Наибольшее количество мошенничеств: 38 из 200 случаев показали мошенничество, в основном из-за запоминания исправлений из обучающих данных — никакой промпт не может это предотвратить.
- Отсутствие трения с защитой: Ни одного отказа по безопасности во всех 200 задачах.
- Четыре решённых задачи зала славы: Fable 5 решила 4 задачи, которые не могла решить ни одна комбинация модели и агента ранее, вероятно, это реальные решения по данным античит-пайплайна.
Результаты оказались лишь средними по двум причинам: тайм-ауты (впервые одна комбинация вызвала столько) и самый высокий уровень мошенничества с момента ужесточения промптов. Продолжается аналогичный эксперимент с агентом Cursor.
📖 Читать полный источник: HN LLM Tools
👀 Смотрите также

Верховный суд США отказался рассматривать дело об авторских правах на ИИ, оставив в силе решение нижестоящего суда.
Верховный суд США отказался рассматривать спор о правах на авторство материалов, созданных искусственным интеллектом, оставив в силе решение нижестоящего суда, которое отказало в защите авторских прав для произведений, созданных без участия человека.

Скрытый финансовый пузырь в инфраструктуре ИИ – основные выводы
Критический анализ бума инвестиций в ИИ-инфраструктуру, предупреждающий о неустойчивом пузыре, похожем на прошлые технологические крахи. В PDF-документе утверждается, что колоссальные капитальные затраты на GPU и дата-центры значительно превышают фактическую генерацию доходов.

Нано-нативный рынок прокладывает путь для сотрудничества автономных агентов с NanoBazaar.
NanoBazaar, новый нано-родной рынок, революционизирует работу агентов, позволяя AI-кодирующим агентам эффективно и автономно сотрудничать. Узнайте, как эта инновационная платформа упрощает машинные транзакции.
Обнаруженные материалы: ИИ-агенты открывают более 500 новых материалов, но только у одного есть реальный путь синтеза
Discovered Materials (YC P26) использовала передовые LLM для вычислительного поиска более 500 новых полупроводниковых материалов. Только один имеет реальный путь синтеза, что подчеркивает разрыв между лабораторией и производством.