VibeThinker-3B: Модель с 3B параметрами, соответствующая 671B DeepSeek на тестах AIME по математике

✍️ OpenClawRadar📅 Опубликовано: 28 июня 2026 г.🔗 Source
VibeThinker-3B: Модель с 3B параметрами, соответствующая 671B DeepSeek на тестах AIME по математике
Ad

Команда из девяти исследователей из Sina Weibo опубликовала на выходных 14-страничный отчет на arXiv, утверждая, что модель с 3 млрд параметров — VibeThinker-3B — сравнивается или превосходит по рассуждениям модели в сотни раз больше. Модель набрала 94,3 балла на AIME 2026 (American Invitational Mathematics Examination), поставив её в один ряд с DeepSeek V3.2 (671B параметров) и опередив Gemini 3 Pro (91,7). С техникой масштабирования времени тестирования, называемой Claim-Level Reliability Assessment, результат достигает 97,1.

Ключевые бенчмарки

  • AIME 2025: 91,4
  • AIME 2026: 94,3 (97,1 с CLRA)
  • HMMT 2025: 89,3
  • BruMO 2025: 93,8
  • IMO-AnswerBench: 76,4
  • LiveCodeBench v6 (Pass@1): 80,2
  • Невидимые соревнования LeetCode (апрель–май 2026): 96,1% принятия
  • IFEval: 93,4

Примечательно, что VibeThinker-3B показывает низкие результаты на бенчмарках знаний: 70,2 на GPQA-Diamond против 91,9 (Gemini 3 Pro) и 87,0 (Claude Opus 4,5). Авторы явно признают это как соответствующее их утверждению — верифицируемые рассуждения «плотны по параметрам», а знания открытой области «экспансивны по параметрам».

Ad

Конвейер обучения

VibeThinker-3B дообучена на базе Qwen2.5-Coder-3B (команда Alibaba's Qwen) с использованием «Принципа от спектра к сигналу», многоэтапного конвейера, представленного в ранней работе команды VibeThinker. В статье описывается Гипотеза параметрического сжатия-покрытия: верифицируемые рассуждения могут быть сжаты в компактное ядро, в то время как широкие знания требуют больше параметров.

В течение нескольких часов после публикации статья получила 62 голоса на Hugging Face Daily Papers, репозиторий модели набрал 130 лайков, а GitHub-репозиторий — 685 звезд. Скептицизм в социальных сетях был высок: пост пользователя @orcus108 собрал более 161 000 просмотров с вопросом: «Я искренне не знаю, прорыв ли это или сломаны бенчмарки».

Для контекста: DeepSeek V3.2 имеет 671B параметров (~в 224 раза больше), GLM-5 — 744B, а Kimi K2.5 превышает 1 триллион. VibeThinker-3B может работать на потребительском ноутбуке.

📖 Читать полный источник: HN AI Agents

Ad

👀 Смотрите также

🦀
Новости

Обыденный риск: почему самые большие угрозы ИИ-безопасности скучны, а не драматичны

В эссе утверждается, что банальные сбои ИИ уже наносят масштабный ущерб, современные подходы к выравниванию слишком сильно зависят от изолированных сред, а конвергенция возможностей делает случайное попадание в открытый мир все более вероятным.

OpenClawRadar
Claude Code v2.1.216: Переключатель файловой системы в песочнице, исправление квадратичного замедления и более 30 исправлений ошибок
Новости

Claude Code v2.1.216: Переключатель файловой системы в песочнице, исправление квадратичного замедления и более 30 исправлений ошибок

Claude Code v2.1.216 добавляет sandbox.filesystem.disabled для выборочной изоляции, исправляет квадратичное замедление нормализации сообщений в длительных сессиях и устраняет более 30 ошибок, включая проблемы с OAuth и изоляцией worktree.

OpenClawRadar
Диагностика операционного дрейфа и амнезии задач в OpenClaw с использованием Gemini 2.5 Flash на Proxmox
Новости

Диагностика операционного дрейфа и амнезии задач в OpenClaw с использованием Gemini 2.5 Flash на Proxmox

Пользователи OpenClaw сообщают о проблемах с поддержанием непрерывных рабочих процессов на виртуальной машине Proxmox, указывая на операционное отклонение и амнезию задач. Несмотря на стабильную работу в разовых задачах, модель Gemini 2.5 Flash испытывает трудности с автоматизацией и памятью в этой конфигурации.

OpenClawRadar
Выпускники освистывают напутствия об ИИ на выпускных: признак настроений разработчиков
Новости

Выпускники освистывают напутствия об ИИ на выпускных: признак настроений разработчиков

Выпускники колледжей освистали ораторов, продвигавших энтузиазм по поводу ИИ на церемониях вручения дипломов, что отражает более широкое беспокойство о влиянии ИИ на работу и общество.

OpenClawRadar