Opus 4.6 превосходит в исследованиях, Gemini 3.1 Pro лучше в прогнозировании

Пользователь Reddit опубликовал результаты бенчмарка, сравнивающего четыре передовые модели — Claude Opus 4.6, GPT-5.4, Gemini 3.1 Pro и Grok 4.20 — на 1417 бинарных вопросах для прогнозирования за октябрь–декабрь 2025 года. Ключевая инновация заключается в разложении производительности на два оценочных условия: агентное (каждая модель самостоятельно проводит веб-исследования с помощью инструментов) и фиксированные данные (все модели получают одинаковое досье объемом ~12 000 символов, составленное по методологии стандартизации Боссе и др., 2026).
Ключевые выводы
- Opus 4.6 показывает значительно лучшие результаты в агентном условии: он лучше определяет, что искать, какие страницы читать и как извлекать релевантные детали. Однако, когда исследование исключается, его преимущество исчезает.
- Gemini 3.1 Pro демонстрирует более точные суждения на фиксированных данных — он взвешивает информацию точнее в задачах прогнозирования. Его калибровка фактически улучшается при получении стандартизированного досье, в то время как калибровка Opus резко падает.
- GPT-5.4 и Grok 4.20 почти не изменились между условиями, что предполагает меньшую зависимость их производительности от стратегии поиска.
- Порядок ранжирования между Opus и Gemini поменялся в разных условиях, что, по мнению автора, указывает на то, что оценка не является сломанной или предвзятой (предвзятая оценка, вероятно, сдвинула бы все модели в одном направлении).
Интерпретация
Асимметрия в калибровке — калибровка Opus падает, когда поиск исключается, а калибровка Gemini улучшается — предполагает, что Opus может использовать свой поисковый след как опору для назначения вероятностей. Другими словами, сам процесс выполнения поискового цикла выполняет часть эпистемической работы, отдельно от той информации, которую он извлекает. Это новый вывод, который может иметь последствия для того, как мы оцениваем и проектируем ИИ-исследовательских агентов.
Ограничения и ресурсы
Досье с фиксированными данными сами созданы языковой моделью, поэтому тест может измерять, насколько хорошо каждая модель интерпретирует конкретную стандартизированную версию данных, а не абстрактное суждение. Автор отмечает это как ограничение, но утверждает, что различное поведение моделей снижает эту обеспокоенность.
Полные показатели калибровки, уточнения и анализ по условиям доступны по адресу: futuresearch.ai/opus-research-gemini-judgment. Бенчмарк и таблица лидеров находятся по адресу: evals.futuresearch.ai.
Насколько известно автору, это первая прямая оценка передовых моделей, разделяющая производительность на этапы исследования и суждения. Они приглашают к репликации в других областях.
📖 Читать полный источник: r/ClaudeAI
👀 Смотрите также

Исходный код против моделей нового поколения: бенчмарк сцены с автомобилем на холсте в одном файле
Разработчик протестировал 12 моделей, включая GPT-5.5, Claude Opus 4.7 и Qwen 3.6 Plus, на задаче создания анимации движения автомобиля в одном HTML-файле с Canvas. Результаты опубликованы для сравнения.

Anthropic платит SpaceX $15 млрд в год за вычислительные мощности до 2029 года
Документы SpaceX для IPO раскрывают, что Anthropic платит $1.25 млрд в месяц до мая 2029 года за вычислительные мощности. Сделка обеспечивает обучение ИИ на объектах Colossus 1 и 2.

Рейтинги магазина приложений Claude в 7 странах
Claude занял 1-е место в США и Канаде, 3-е место во Франции и Германии, 4-е место в Великобритании, 8-е место в Италии и 22-е место в Японии в рейтингах бесплатных приложений App Store, зафиксированных одновременно 1 марта 2026 года в 09:00 UTC.

Пользователи OpenClaw сообщают о заменах моделей после запрета Anthropic.
Общественный опрос на Reddit, X, YouTube и GitHub показывает, что GPT-5.x стал самой популярной заменой Claude в рабочих процессах OpenClaw, при этом Kimi K2.5 лидирует по голосам сообщества, а гибридные настройки набирают популярность.