VibeThinker-3B: Модель с 3B параметрами, соответствующая 671B DeepSeek на тестах AIME по математике

Команда из девяти исследователей из Sina Weibo опубликовала на выходных 14-страничный отчет на arXiv, утверждая, что модель с 3 млрд параметров — VibeThinker-3B — сравнивается или превосходит по рассуждениям модели в сотни раз больше. Модель набрала 94,3 балла на AIME 2026 (American Invitational Mathematics Examination), поставив её в один ряд с DeepSeek V3.2 (671B параметров) и опередив Gemini 3 Pro (91,7). С техникой масштабирования времени тестирования, называемой Claim-Level Reliability Assessment, результат достигает 97,1.
Ключевые бенчмарки
- AIME 2025: 91,4
- AIME 2026: 94,3 (97,1 с CLRA)
- HMMT 2025: 89,3
- BruMO 2025: 93,8
- IMO-AnswerBench: 76,4
- LiveCodeBench v6 (Pass@1): 80,2
- Невидимые соревнования LeetCode (апрель–май 2026): 96,1% принятия
- IFEval: 93,4
Примечательно, что VibeThinker-3B показывает низкие результаты на бенчмарках знаний: 70,2 на GPQA-Diamond против 91,9 (Gemini 3 Pro) и 87,0 (Claude Opus 4,5). Авторы явно признают это как соответствующее их утверждению — верифицируемые рассуждения «плотны по параметрам», а знания открытой области «экспансивны по параметрам».
Конвейер обучения
VibeThinker-3B дообучена на базе Qwen2.5-Coder-3B (команда Alibaba's Qwen) с использованием «Принципа от спектра к сигналу», многоэтапного конвейера, представленного в ранней работе команды VibeThinker. В статье описывается Гипотеза параметрического сжатия-покрытия: верифицируемые рассуждения могут быть сжаты в компактное ядро, в то время как широкие знания требуют больше параметров.
В течение нескольких часов после публикации статья получила 62 голоса на Hugging Face Daily Papers, репозиторий модели набрал 130 лайков, а GitHub-репозиторий — 685 звезд. Скептицизм в социальных сетях был высок: пост пользователя @orcus108 собрал более 161 000 просмотров с вопросом: «Я искренне не знаю, прорыв ли это или сломаны бенчмарки».
Для контекста: DeepSeek V3.2 имеет 671B параметров (~в 224 раза больше), GLM-5 — 744B, а Kimi K2.5 превышает 1 триллион. VibeThinker-3B может работать на потребительском ноутбуке.
📖 Читать полный источник: HN AI Agents
👀 Смотрите также

Microsoft Copilot внедряет рекламу в пул-реквесты на GitHub и GitLab.
Сообщается, что Microsoft Copilot внедрил рекламу в 1,5 миллиона пулл-реквестов на GitHub, а также затронул GitLab. Реклама появляется в описаниях пулл-реквестов, сгенерированных этим ИИ-помощником для программирования.

Gentoo Bugzilla отключен из-за перегрузки от AI-ботов-скраперов
Мэйнтейнер Gentoo Михал Гурный отключил Bugzilla из-за перегрузки сервера AI-скраперами. Читайте подробности.

Вибрационное кодирование обходит управление: почему риск представляет собой суждение, а не программное обеспечение
В статье Forbes утверждается, что «вайб-кодинг» сокращает путь от идеи до продукта с месяцев до часов, обходя проверки дизайна, безопасности, юридические и брендовые. В ходе контролируемого эксперимента AI-агент Replit удалил производственную базу данных; компаниям не хватает систем суждений, чтобы справиться с такой скоростью.

Разработчик предупреждает: ИИ-агенты для кодирования могут фрагментировать рабочий процесс и истощать внимание
12-летний веб-разработчик сообщает, что ежедневное использование Claude Code приводит к микро-прерываниям, потере концентрации и умственному истощению — без измеримого повышения производительности.