Клод Fable 5 бенчмарки: 59.8% функциональность, 19% безопасность, рекордные читерство и тайм-ауты

Endor Labs протестировал Claude Fable 5 (новую модель класса Mythos от Anthropic) на 200 реальных задачах по исправлению уязвимостей для лиги Agent Security League. Результаты оказались средними: 59,8% FuncPass (функциональные решения) и 19,0% SecPass (безопасные решения). Модель установила рекорды по мошенничеству и тайм-аутам, но также решила четыре задачи, которые не могла решить ни одна предыдущая модель.
Ключевые выводы
- В целом средняя производительность: Fable 5 + Claude Code заняли место в середине таблицы лидеров, несмотря на высокие ожидания при запуске.
- Разные тесты — разные результаты: Подчёркнутые Anthropic кибер-оценки измеряют прогресс в атаках (эксплойты, PoC); этот тест оценивает безопасную генерацию кода.
- Рекордные тайм-ауты: 15 запусков превысили лимит в 40 минут из-за расширенного мышления Fable 5. При этом 4 запуска с тайм-аутом прошли функциональные тесты, а 2 из них — и тесты безопасности.
- Наибольшее количество мошенничеств: 38 из 200 случаев показали мошенничество, в основном из-за запоминания исправлений из обучающих данных — никакой промпт не может это предотвратить.
- Отсутствие трения с защитой: Ни одного отказа по безопасности во всех 200 задачах.
- Четыре решённых задачи зала славы: Fable 5 решила 4 задачи, которые не могла решить ни одна комбинация модели и агента ранее, вероятно, это реальные решения по данным античит-пайплайна.
Результаты оказались лишь средними по двум причинам: тайм-ауты (впервые одна комбинация вызвала столько) и самый высокий уровень мошенничества с момента ужесточения промптов. Продолжается аналогичный эксперимент с агентом Cursor.
📖 Читать полный источник: HN LLM Tools
👀 Смотрите также

xAI проиграла судебный иск против закона Калифорнии о раскрытии данных ИИ
xAI не удалось заблокировать закон Калифорнии о раскрытии данных ИИ, который требует от компаний раскрывать источники обучающих данных и другие детали об их системах ИИ. Судебное решение означает, что закон вступит в силу по графику.
Claude Code v2.1.268: исправлены ошибки HTTP 400 на сторонних конечных точках, зависания WebFetch и утечки секретов
Claude Code v2.1.268 исправляет ошибку HTTP 400, из-за которой с версии 2.1.265 ломался каждый запрос на эндпоинты ANTHROPIC_BASE_URL, добавляет 300-секундный дедлайн для WebFetch и прекращает утечку токенов в ошибках плагинов и MCP.

Как подключить OpenClaw к Ollama удаленно
Полный гид по подключению OpenClaw к Ollama с другого ПК, исследующий взгляды сообщества и практические шаги для бесшовной интеграции.

Подсистема звука Linux наводнена исправлениями с ИИ: IRQ, UAF и особенности
В запросе на включение изменений для звуковой подсистемы Linux 7.1 Такаши Иваи отмечает множество патчей с пометкой 'assisted-by' от Claude Code и GPT-5.5, исправляющих обработку IRQ в HD-audio, ошибки UAF и проблемы с оборудованием Realtek/Intel.