Opus 4.6 превосходит в исследованиях, Gemini 3.1 Pro лучше в прогнозировании

✍️ OpenClawRadar📅 Опубликовано: 7 мая 2026 г.🔗 Source
Opus 4.6 превосходит в исследованиях, Gemini 3.1 Pro лучше в прогнозировании
Ad

Пользователь Reddit опубликовал результаты бенчмарка, сравнивающего четыре передовые модели — Claude Opus 4.6, GPT-5.4, Gemini 3.1 Pro и Grok 4.20 — на 1417 бинарных вопросах для прогнозирования за октябрь–декабрь 2025 года. Ключевая инновация заключается в разложении производительности на два оценочных условия: агентное (каждая модель самостоятельно проводит веб-исследования с помощью инструментов) и фиксированные данные (все модели получают одинаковое досье объемом ~12 000 символов, составленное по методологии стандартизации Боссе и др., 2026).

Ключевые выводы

  • Opus 4.6 показывает значительно лучшие результаты в агентном условии: он лучше определяет, что искать, какие страницы читать и как извлекать релевантные детали. Однако, когда исследование исключается, его преимущество исчезает.
  • Gemini 3.1 Pro демонстрирует более точные суждения на фиксированных данных — он взвешивает информацию точнее в задачах прогнозирования. Его калибровка фактически улучшается при получении стандартизированного досье, в то время как калибровка Opus резко падает.
  • GPT-5.4 и Grok 4.20 почти не изменились между условиями, что предполагает меньшую зависимость их производительности от стратегии поиска.
  • Порядок ранжирования между Opus и Gemini поменялся в разных условиях, что, по мнению автора, указывает на то, что оценка не является сломанной или предвзятой (предвзятая оценка, вероятно, сдвинула бы все модели в одном направлении).
Ad

Интерпретация

Асимметрия в калибровке — калибровка Opus падает, когда поиск исключается, а калибровка Gemini улучшается — предполагает, что Opus может использовать свой поисковый след как опору для назначения вероятностей. Другими словами, сам процесс выполнения поискового цикла выполняет часть эпистемической работы, отдельно от той информации, которую он извлекает. Это новый вывод, который может иметь последствия для того, как мы оцениваем и проектируем ИИ-исследовательских агентов.

Ограничения и ресурсы

Досье с фиксированными данными сами созданы языковой моделью, поэтому тест может измерять, насколько хорошо каждая модель интерпретирует конкретную стандартизированную версию данных, а не абстрактное суждение. Автор отмечает это как ограничение, но утверждает, что различное поведение моделей снижает эту обеспокоенность.

Полные показатели калибровки, уточнения и анализ по условиям доступны по адресу: futuresearch.ai/opus-research-gemini-judgment. Бенчмарк и таблица лидеров находятся по адресу: evals.futuresearch.ai.

Насколько известно автору, это первая прямая оценка передовых моделей, разделяющая производительность на этапы исследования и суждения. Они приглашают к репликации в других областях.

📖 Читать полный источник: r/ClaudeAI

Ad

👀 Смотрите также

Bloomberg сообщает: потери рабочих мест в США, связанные с внедрением ИИ, начинают расти
Новости

Bloomberg сообщает: потери рабочих мест в США, связанные с внедрением ИИ, начинают расти

Bloomberg сообщает, что в США наблюдается значительная потеря рабочих мест в профессиях, затронутых ИИ, а обсуждение на Hacker News указывает на реальное влияние на разработчиков и других работников умственного труда.

OpenClawRadar
YC-Bench тестирует LLM в роли CEO стартапов, GLM-5 демонстрирует высокую рентабельность
Новости

YC-Bench тестирует LLM в роли CEO стартапов, GLM-5 демонстрирует высокую рентабельность

Исследователи создали YC-Bench — бенчмарк, в котором ИИ-модели выступают в роли генеральных директоров симулированных стартапов в течение года, управляя сотрудниками, контрактами и заработной платой. GLM-5 достиг средних финальных средств в размере 1,21 млн долларов при стоимости 7,62 доллара за запуск, показав результат в пределах 5% от Claude Opus 4.6, который стоил 86 долларов за запуск.

OpenClawRadar
Военные США оказывают давление на Anthropic с целью снятия защитных ограничений Claude для военного применения.
Новости

Военные США оказывают давление на Anthropic с целью снятия защитных ограничений Claude для военного применения.

Американские военные руководители, включая министра обороны Пита Хегсета, встретились с руководителями компании Anthropic, чтобы потребовать снятия защитных ограничений с ИИ Claude против военного применения, такого как массовая слежка и автономное оружие. Пентагон дал Anthropic срок до пятницы, чтобы выполнить требования, в противном случае компании грозят штрафные санкции, включая расторжение контракта.

OpenClawRadar
Клод-Код v2.1.32: Усовершенствование автоматизации и точности кодирования
Новости

Клод-Код v2.1.32: Усовершенствование автоматизации и точности кодирования

Последний релиз Claude-Code, версия 2.1.32, приносит важные улучшения в области AI программирования и автоматизации. Узнайте ключевые функции и влияние на сообщество этого обновления, теперь доступного на GitHub.

OpenClawRadar