Бенчмарк IDP Leaderboard показывает, что Claude Sonnet 4.6 соответствует уровню Opus 4.6 в задачах по обработке документов с использованием искусственного интеллекта.

✍️ OpenClawRadar📅 Опубликовано: 11 марта 2026 г.🔗 Source
Бенчмарк IDP Leaderboard показывает, что Claude Sonnet 4.6 соответствует уровню Opus 4.6 в задачах по обработке документов с использованием искусственного интеллекта.
Ad

Лидерборд IDP, открытый эталонный тест для ИИ-обработки документов, опубликовал результаты сравнения моделей Claude по задачам обработки документов. Тестирование проверило 16 моделей по нескольким категориям, используя более 9000 реальных документов.

Результаты тестирования

Баллы моделей Claude по результатам Лидерборда IDP:

  • Claude Sonnet 4.6: 80.8 в целом
  • Claude Opus 4.6: 80.3 в целом
  • Claude Haiku 4.5: 69.6 в целом

Sonnet и Opus показали практически одинаковые результаты по задачам извлечения, включая текст, таблицы, формулы и анализ структуры. Согласно результатам тестирования, радар-диаграммы обеих моделей выглядят идентично.

Сравнение стоимости

В источнике отмечаются значительные различия в стоимости:

  • Sonnet стоит $24 за 1000 страниц
  • Opus стоит $40 за 1000 страниц

Для рабочих нагрузок по обработке документов тестирование предполагает, что нет причин использовать Opus, учитывая эквивалентную производительность при более низкой стоимости.

Ad

Важное замечание

Одно примечательное наблюдение: у моделей Claude была более строгая модерация контента, которая повлияла на производительность с определёнными типами документов. Сканы старых газет, страницы учебников и исторические документы иногда активировали фильтры контента. Эта проблема проявлялась только в тестах OlmOCR и OmniDoc.

Все прогнозы из тестирования видны в Results Explorer на сайте idp-leaderboard.org, где можно увидеть, что именно выводила каждая модель Claude на каждом документе.

📖 Прочитать полный источник: r/ClaudeAI

Ad

👀 Смотрите также

Скрытый финансовый пузырь в инфраструктуре ИИ – основные выводы
Новости

Скрытый финансовый пузырь в инфраструктуре ИИ – основные выводы

Критический анализ бума инвестиций в ИИ-инфраструктуру, предупреждающий о неустойчивом пузыре, похожем на прошлые технологические крахи. В PDF-документе утверждается, что колоссальные капитальные затраты на GPU и дата-центры значительно превышают фактическую генерацию доходов.

OpenClawRadar
Новый ИИ-репетитор достигает размера эффекта 0.71–1.30 SD на курсе Дартмута
Новости

Новый ИИ-репетитор достигает размера эффекта 0.71–1.30 SD на курсе Дартмута

Новый ИИ-тьютор для вводного курса информатики Дартмута показал улучшение успеваемости на 0,71–1,30 стандартного отклонения по сравнению с контрольной группой.

OpenClawRadar
Когда RLVR помогает небольшим доработанным моделям: анализ на 12 наборах данных
Новости

Когда RLVR помогает небольшим доработанным моделям: анализ на 12 наборах данных

Контролируемый эксперимент проверил добавление обучения с подкреплением RLVR поверх моделей с 1,7 млрд параметров, дообученных с помощью SFT. Результаты показывают, что задачи генерации текста улучшились в среднем на +2,0 процентных пункта, в то время как структурированные задачи ухудшились на -0,7 п.п.

OpenClawRadar
Закон об ИИ для K-12 Шиффа-Раундса: что разработчикам нужно знать о законопроекте об ИИ-грамотности
Новости

Закон об ИИ для K-12 Шиффа-Раундса: что разработчикам нужно знать о законопроекте об ИИ-грамотности

OpenAI, Google и Microsoft поддерживают Закон LIFT AI, который финансирует гранты NSF для разработки учебных программ по ИИ-грамотности для K-12, подготовки учителей и инструментов оценки.

OpenClawRadar