VibeThinker-3B: Модель с 3B параметрами, соответствующая 671B DeepSeek на тестах AIME по математике

Команда из девяти исследователей из Sina Weibo опубликовала на выходных 14-страничный отчет на arXiv, утверждая, что модель с 3 млрд параметров — VibeThinker-3B — сравнивается или превосходит по рассуждениям модели в сотни раз больше. Модель набрала 94,3 балла на AIME 2026 (American Invitational Mathematics Examination), поставив её в один ряд с DeepSeek V3.2 (671B параметров) и опередив Gemini 3 Pro (91,7). С техникой масштабирования времени тестирования, называемой Claim-Level Reliability Assessment, результат достигает 97,1.
Ключевые бенчмарки
- AIME 2025: 91,4
- AIME 2026: 94,3 (97,1 с CLRA)
- HMMT 2025: 89,3
- BruMO 2025: 93,8
- IMO-AnswerBench: 76,4
- LiveCodeBench v6 (Pass@1): 80,2
- Невидимые соревнования LeetCode (апрель–май 2026): 96,1% принятия
- IFEval: 93,4
Примечательно, что VibeThinker-3B показывает низкие результаты на бенчмарках знаний: 70,2 на GPQA-Diamond против 91,9 (Gemini 3 Pro) и 87,0 (Claude Opus 4,5). Авторы явно признают это как соответствующее их утверждению — верифицируемые рассуждения «плотны по параметрам», а знания открытой области «экспансивны по параметрам».
Конвейер обучения
VibeThinker-3B дообучена на базе Qwen2.5-Coder-3B (команда Alibaba's Qwen) с использованием «Принципа от спектра к сигналу», многоэтапного конвейера, представленного в ранней работе команды VibeThinker. В статье описывается Гипотеза параметрического сжатия-покрытия: верифицируемые рассуждения могут быть сжаты в компактное ядро, в то время как широкие знания требуют больше параметров.
В течение нескольких часов после публикации статья получила 62 голоса на Hugging Face Daily Papers, репозиторий модели набрал 130 лайков, а GitHub-репозиторий — 685 звезд. Скептицизм в социальных сетях был высок: пост пользователя @orcus108 собрал более 161 000 просмотров с вопросом: «Я искренне не знаю, прорыв ли это или сломаны бенчмарки».
Для контекста: DeepSeek V3.2 имеет 671B параметров (~в 224 раза больше), GLM-5 — 744B, а Kimi K2.5 превышает 1 триллион. VibeThinker-3B может работать на потребительском ноутбуке.
📖 Читать полный источник: HN AI Agents
👀 Смотрите также

Тестирование рынков AI-агентов: практические результаты от ClawGig, RentAHuman и систем на базе OpenClaw
Разработчик протестировал несколько маркетплейсов ИИ-агентов и обнаружил, что у ClawGig агенты не отвечали, а репутационные баллы были накручены; агенты RentAHuman не могли поддерживать связный диалог, в то время как независимые решения на базе OpenClaw показали потенциал, но страдали от низкой обнаруживаемости.

Оценка навыков Claude и регрессионное тестирование с помощью Snowflake Cortex Agent
Продуктовый агент кредитного риска на базе Claude на Snowflake Cortex Agent нуждается в регрессионном тестировании. Сейчас команда вручную сравнивает результаты с BI-запросами, стремясь к автоматизации оценки изменений навыков.

Ведущие модели искусственного интеллекта демонстрируют разрыв в производительности при работе с неанглийскими языками.
Недавний анализ показывает, что ведущие модели ИИ работают хуже на языках, отличных от английского. Статья набрала 16 баллов и 3 комментария на Hacker News.

Google Chrome незаметно загружает 4-гигабайтную модель Gemini Nano без согласия пользователя
Chrome автоматически загружает 4-гигабайтную модель Gemini Nano (weights.bin) на устройства пользователей без согласия или возможности отказа, и повторно загружает ее при удалении. Это вызывает юридические (ePrivacy/GDPR) и экологические проблемы в масштабе миллиарда устройств Chrome.