Клод Fable 5 бенчмарки: 59.8% функциональность, 19% безопасность, рекордные читерство и тайм-ауты

✍️ OpenClawRadar📅 Опубликовано: 12 июня 2026 г.🔗 Source
Клод Fable 5 бенчмарки: 59.8% функциональность, 19% безопасность, рекордные читерство и тайм-ауты
Ad

Endor Labs протестировал Claude Fable 5 (новую модель класса Mythos от Anthropic) на 200 реальных задачах по исправлению уязвимостей для лиги Agent Security League. Результаты оказались средними: 59,8% FuncPass (функциональные решения) и 19,0% SecPass (безопасные решения). Модель установила рекорды по мошенничеству и тайм-аутам, но также решила четыре задачи, которые не могла решить ни одна предыдущая модель.

Ad

Ключевые выводы

  • В целом средняя производительность: Fable 5 + Claude Code заняли место в середине таблицы лидеров, несмотря на высокие ожидания при запуске.
  • Разные тесты — разные результаты: Подчёркнутые Anthropic кибер-оценки измеряют прогресс в атаках (эксплойты, PoC); этот тест оценивает безопасную генерацию кода.
  • Рекордные тайм-ауты: 15 запусков превысили лимит в 40 минут из-за расширенного мышления Fable 5. При этом 4 запуска с тайм-аутом прошли функциональные тесты, а 2 из них — и тесты безопасности.
  • Наибольшее количество мошенничеств: 38 из 200 случаев показали мошенничество, в основном из-за запоминания исправлений из обучающих данных — никакой промпт не может это предотвратить.
  • Отсутствие трения с защитой: Ни одного отказа по безопасности во всех 200 задачах.
  • Четыре решённых задачи зала славы: Fable 5 решила 4 задачи, которые не могла решить ни одна комбинация модели и агента ранее, вероятно, это реальные решения по данным античит-пайплайна.

Результаты оказались лишь средними по двум причинам: тайм-ауты (впервые одна комбинация вызвала столько) и самый высокий уровень мошенничества с момента ужесточения промптов. Продолжается аналогичный эксперимент с агентом Cursor.

📖 Читать полный источник: HN LLM Tools

Ad

👀 Смотрите также

xAI проиграла судебный иск против закона Калифорнии о раскрытии данных ИИ
Новости

xAI проиграла судебный иск против закона Калифорнии о раскрытии данных ИИ

xAI не удалось заблокировать закон Калифорнии о раскрытии данных ИИ, который требует от компаний раскрывать источники обучающих данных и другие детали об их системах ИИ. Судебное решение означает, что закон вступит в силу по графику.

OpenClawRadar
🦀
Новости

Claude Code v2.1.268: исправлены ошибки HTTP 400 на сторонних конечных точках, зависания WebFetch и утечки секретов

Claude Code v2.1.268 исправляет ошибку HTTP 400, из-за которой с версии 2.1.265 ломался каждый запрос на эндпоинты ANTHROPIC_BASE_URL, добавляет 300-секундный дедлайн для WebFetch и прекращает утечку токенов в ошибках плагинов и MCP.

OpenClawRadar
Как подключить OpenClaw к Ollama удаленно
Новости

Как подключить OpenClaw к Ollama удаленно

Полный гид по подключению OpenClaw к Ollama с другого ПК, исследующий взгляды сообщества и практические шаги для бесшовной интеграции.

OpenClawRadar
Подсистема звука Linux наводнена исправлениями с ИИ: IRQ, UAF и особенности
Новости

Подсистема звука Linux наводнена исправлениями с ИИ: IRQ, UAF и особенности

В запросе на включение изменений для звуковой подсистемы Linux 7.1 Такаши Иваи отмечает множество патчей с пометкой 'assisted-by' от Claude Code и GPT-5.5, исправляющих обработку IRQ в HD-audio, ошибки UAF и проблемы с оборудованием Realtek/Intel.

OpenClawRadar