Бенчмарк IDP Leaderboard показывает, что Claude Sonnet 4.6 соответствует уровню Opus 4.6 в задачах по обработке документов с использованием искусственного интеллекта.

Лидерборд IDP, открытый эталонный тест для ИИ-обработки документов, опубликовал результаты сравнения моделей Claude по задачам обработки документов. Тестирование проверило 16 моделей по нескольким категориям, используя более 9000 реальных документов.
Результаты тестирования
Баллы моделей Claude по результатам Лидерборда IDP:
- Claude Sonnet 4.6: 80.8 в целом
- Claude Opus 4.6: 80.3 в целом
- Claude Haiku 4.5: 69.6 в целом
Sonnet и Opus показали практически одинаковые результаты по задачам извлечения, включая текст, таблицы, формулы и анализ структуры. Согласно результатам тестирования, радар-диаграммы обеих моделей выглядят идентично.
Сравнение стоимости
В источнике отмечаются значительные различия в стоимости:
- Sonnet стоит $24 за 1000 страниц
- Opus стоит $40 за 1000 страниц
Для рабочих нагрузок по обработке документов тестирование предполагает, что нет причин использовать Opus, учитывая эквивалентную производительность при более низкой стоимости.
Важное замечание
Одно примечательное наблюдение: у моделей Claude была более строгая модерация контента, которая повлияла на производительность с определёнными типами документов. Сканы старых газет, страницы учебников и исторические документы иногда активировали фильтры контента. Эта проблема проявлялась только в тестах OlmOCR и OmniDoc.
Все прогнозы из тестирования видны в Results Explorer на сайте idp-leaderboard.org, где можно увидеть, что именно выводила каждая модель Claude на каждом документе.
📖 Прочитать полный источник: r/ClaudeAI
👀 Смотрите также

Pantheon-Reasoning-27B: Модель плотного рассуждения RP от Gryphe
Gryphe выпускает Pantheon-Reasoning-27B — цензурированную доработку Qwen 3.6 27B с полными цепочками рассуждений для ролевых игр. Модель обучена на данных Pantheon, Opus-4.6-Reasoning-24k, WorldSim, текстовых квестов и общих RP-данных. Доступны квантизации GGUF.

Легкое развертывание: выпущена новая настройка Open Claw для AWS одним щелчком.
Энтузиасты Open Claw теперь могут порадоваться. Новый инструмент развертывания AWS в один клик упрощает процесс настройки Open Claw, делая его более доступным для разработчиков и любителей.

Кими $19/м Обновление: Улучшение OpenClaw с помощью структурированных моделей
Kimi представляет свое последнее обновление, стоимостью $19 в месяц, ориентированное на улучшение структуры моделей в OpenClaw. Это обновление обещает упрощенные операции и улучшенные функции автоматизации.

Claude Desktop v1.1.5749 добавляет управление компьютером и исправления для корпоративных прокси
Claude Desktop v1.1.5749 добавляет возможность использования компьютера через MCP-сервер для управления рабочим столом, включает шесть методов управления разрешениями macOS TCC и устраняет проблемы с SSL-сертификатами корпоративных прокси, перенаправляя переменные окружения NODE_EXTRA_CA_CERTS, SSL_CERT_FILE и SSL_CERT_DIR.