Claude Opus 5.5: на 40% дешевле Opus 5, 66,4% на Terminal-Bench 4.0

✍️ OpenClawRadar📅 Опубликовано: 23 сентября 2026 г.🔗 Source
Ad

Anthropic выпустила Claude Opus 5.5 — первую модель в новом семействе Claude 5.5. По большинству задач она работает на уровне Claude Fable 5.1, а стоимость её запуска на 40% ниже, чем у Opus 5. Входные и выходные токены стоят $4 и $20 за миллион соответственно — на 20% меньше, чем у Opus 5, — а чтение кэша, которое, по словам Anthropic, составляет большую часть затрат в агентных и кодинг-задачах, подешевело до $0,20 за миллион, то есть на 60%. Вывод генерируется более чем на 30% быстрее, чем у Opus 5.

Бенчмарки

Opus 5.5 лидирует в агентном кодинге, работе с компьютером и интеллектуальных задачах:

  • Terminal-Bench 4.0: 66,4% (против 55,8% у Fable 5.1, 52,3% у Opus 5, 57,9% у GPT-6 Astra, 37,3% у GPT-5.6 Sol)
  • FrontierCode v1.1 (Main): 54,4% (Fable 5.1: 50,3%, Opus 5: 48,0%)
  • CursorBench 4.0: 57,8% (Fable 5.1: 51,8%, Opus 5: 46,6%)
  • GDPval-AA v2.1: 1846 (Fable 5.1: 1735, Opus 5: 1708)
  • AutomationBench: 40,0% (Fable 5.1: 31,4%, Opus 5: 26,9%)
  • Humanity's Last Exam: 67,7% с инструментами (Fable 5.1: 65,6%, Opus 5: 63,6%)
  • Terminal-Bench-Science 0.1: 58,7% (Fable 5.1: 52,6%, Opus 5: 29,0%, GPT-6 Astra: 64,6%)

Anthropic отмечает, что на таком уровне разрывы в бенчмарках стали менее надёжным ориентиром для реальных различий и что на практике разница между Opus 5.5 и Fable 5.1 меньше, чем предполагают результаты тестов.

Ad

Заявленные рабочие нагрузки

Один тестировщик выполнил миграцию 680 000 строк кода менее чем за день. Во внутреннем тесте на сокращение времени загрузки каждой страницы веб-приложения Opus 5.5 справился 39 раз из 40 — Opus 5 вносил меньшие улучшения, но при этом менял поведение приложения. Другой тестировщик поручил нескольким моделям Claude создать игру по одному запросу; Opus 5.5 получил наивысшую оценку за графику и качество исполнения.

Безопасность и верификация

Opus 5.5 показывает лучшие на сегодня результаты в автоматизированном аудите поведения Anthropic — наборе тестов, который проверяет Claude в тысячах смоделированных сценариев. Она реже, чем недавние модели, совершает труднообратимые действия или выходит за заданные границы, а также более устойчива к промпт-инъекциям, чем Opus 5. Тестирование теперь охватывает более длительные задачи, невыполнимые задачи и сценарии, смоделированные по реальным инцидентам. Поскольку по биологии и кибербезопасности она сопоставима с Claude Mythos 5.1, Anthropic развёртывает её с такими же мерами защиты, как у Claude Fable 5.1.

Проверенные организации могут подать заявку на участие в программе Life Sciences Verification Program для использования в биологических исследованиях; программа Cyber Verification Program расширится в ближайшие недели для подтверждённых специалистов.

Ограничения и доступность

Пятичасовые лимиты использования на планах Pro, Max, Team и Enterprise с оплатой за место увеличиваются. Подписчики получают сброс лимита, который можно сохранить и использовать по своему усмотрению. Claude Sonnet 5.5 и Claude Haiku 5.5 появятся в ближайшие недели с аналогичными улучшениями производительности, эффективности и безопасности.

📖 Read the full source: HN AI Agents

Ad

👀 Смотрите также

Онтарио, аудит: 60% систем ИИ для записи путают лекарства, 85% упускают детали психического здоровья
Новости

Онтарио, аудит: 60% систем ИИ для записи путают лекарства, 85% упускают детали психического здоровья

Аудиторы Онтарио обнаружили, что 12 из 20 систем AI Scribe вставляли неверную информацию о лекарствах, 9 генерировали вымышленные рекомендации, а 17 пропустили ключевые детали о психическом здоровье из записей приемов врачей. При оценке точность составляла лишь 4% от общего балла.

OpenClawRadar
Почему активирующее управление Anthropic испытывает трудности с генерацией корректного JSON
Новости

Почему активирующее управление Anthropic испытывает трудности с генерацией корректного JSON

Метод активации управления, используемый для безопасности ИИ, не способен генерировать действительный JSON, достигая лишь 24,4% валидности по сравнению с 86,8% у необученной базовой модели.

OpenClawRadar
Тестирование рынков AI-агентов: практические результаты от ClawGig, RentAHuman и систем на базе OpenClaw
Новости

Тестирование рынков AI-агентов: практические результаты от ClawGig, RentAHuman и систем на базе OpenClaw

Разработчик протестировал несколько маркетплейсов ИИ-агентов и обнаружил, что у ClawGig агенты не отвечали, а репутационные баллы были накручены; агенты RentAHuman не могли поддерживать связный диалог, в то время как независимые решения на базе OpenClaw показали потенциал, но страдали от низкой обнаруживаемости.

OpenClawRadar
Клод теряет возможность получать цены на товары у разных розничных продавцов
Новости

Клод теряет возможность получать цены на товары у разных розничных продавцов

По состоянию на 27 апреля Claude больше не возвращает цены на Amazon, Best Buy, Newegg или B&H Photo. Walmart остается единственным продавцом, который все еще показывает цены.

OpenClawRadar