Утечка данных раскрыла модель искусственного интеллекта Claude Mythos от Anthropic, которую описывают как «скачок» в возможностях.

Что было раскрыто
Утечка данных из незащищенного, общедоступного хранилища показала, что Anthropic разрабатывает и тестирует новую модель ИИ под названием Claude Mythos. В утечку вошло около 3000 неопубликованных материалов, связанных с блогом Anthropic, включая, по-видимому, черновик поста в блоге, анонсирующего новую модель.
Детали модели из источника
Согласно раскрытым документам:
- Модель называется «Claude Mythos» и также упоминается как «Capybara». Anthropic описывает её как «новое название для нового уровня модели: более крупной и интеллектуальной, чем наши модели Opus».
- Capybara представляет собой новый уровень выше Opus в иерархии моделей Anthropic (в которой в настоящее время Opus является самой крупной/способной, Sonnet — более быстрой/дешёвой, а Haiku — самой маленькой/быстрой).
- По сравнению с Claude Opus 4.6, Capybara показывает «значительно более высокие результаты в тестах на написание программного кода, академическое мышление и кибербезопасность, среди прочих».
- В черновике поста в блоге Claude Mythos описывается как «безусловно, самая мощная модель ИИ, которую мы когда-либо разрабатывали».
- Anthropic считает эту модель «качественным скачком и самой способной из созданных нами на сегодняшний день».
Текущий статус и внедрение
В настоящее время модель проходит испытания у «клиентов раннего доступа» в рамках осторожной стратегии внедрения. Согласно исходным материалам:
- Модель дорога в эксплуатации и ещё не готова к общему выпуску
- Anthropic «действует осмотрительно в отношении того, как мы её выпускаем» из-за силы её возможностей
- Компания работает с «небольшой группой клиентов раннего доступа для тестирования модели»
- Утечка также раскрыла детали запланированного, только по приглашению, саммита для CEO в Европе в рамках стремления Anthropic продавать модели ИИ крупным корпоративным клиентам
Последствия для безопасности
В черновике поста в блоге указывалось, что компания считает, что Claude Mythos «представляет беспрецедентные риски для кибербезопасности». Сама утечка произошла из-за того, что Anthropic описала как «человеческую ошибку» в настройке своей системы управления контентом, которая сделала черновики общедоступными.
Контекст для разработчиков, использующих ИИ-агентов для кодирования
Для разработчиков, которые полагаются на ИИ-ассистентов для кодирования, эта утечка предполагает, что от Anthropic могут появиться значительные улучшения в возможностях программирования. Конкретное упоминание «значительно более высоких результатов в тестах на написание программного кода» указывает на потенциальные достижения, которые могут повлиять на инструменты и рабочие процессы, интегрированные с API Claude.
📖 Read the full source: HN AI Agents
👀 Смотрите также

Исследования показывают, что пользователи ИИ часто принимают ответы языковых моделей без проверки.
Исследование Пенсильванского университета показало, что пользователи ИИ проявляют «когнитивную капитуляцию», принимая ответы языковых моделей с минимальной проверкой. В экспериментах пользователи принимали правильные ответы ИИ в 93% случаев, а неправильные — в 80%, даже когда ИИ ошибался в половине случаев.
Нью-Йорк и Лос-Анджелес вводят строгие запреты на ИИ в школах: как это повлияет на разработчиков и EdTech
Нью-Йорк запретил ИИ в классах K-8, LAUSD ввел годичный мораторий на использование ИИ для всех учащихся. Вот что нужно знать разработчикам образовательных инструментов.

Исследование согласованности ИИ-агентов: ключевые выводы и практические рекомендации
Исследование 3000 экспериментов с Claude, GPT-4o и Llama показывает, что согласованные агенты достигают точности 80–92%, тогда как несогласованные падают до 25–60%, причём 69% расхождений происходит при первом вызове инструмента.

Обзор OpenClaw: Проблемы надёжности в текущем состоянии, ценность как учебного инструмента
Разработчик с обширным опытом работы с AI-платформами сообщает, что OpenClaw испытывает трудности с надежностью при выполнении базовых многошаговых задач, что ставит под сомнение возможность создания автономных бизнес-приложений, однако отмечает ценность платформы для изучения структуры и оркестрации агентов.