Когда RLVR помогает небольшим доработанным моделям: анализ на 12 наборах данных

Недавний эксперимент проверил, даёт ли добавление этапа обучения с подкреплением (RLVR) поверх контролируемого дообучения (SFT) для небольших языковых моделей (1,7 млрд параметров) измеримые преимущества. Команда провела контролируемый эксперимент на 12 наборах данных, чтобы точно определить, когда этот подход помогает, а когда нет.
Ключевые выводы
Результаты чётко разделились по типам задач:
- Задачи генерации текста (вопросно-ответные, документация, обезличивание PII): среднее улучшение на +2,0 процентных пункта. Каждый отдельный набор данных в этой категории показал улучшение.
- Структурированные задачи (классификация, вызов функций): среднее ухудшение на -0,7 процентных пункта. Два набора данных в этой категории фактически регрессировали.
Почему возникает эта закономерность
Исследователи объясняют, что как только дообученная модель уже правильно выдаёт большинство структурированных результатов, GRPO (Group Relative Policy Optimization) даёт почти нулевые градиенты. По сути, для этапа обучения с подкреплением не остаётся обучающего сигнала.
Для генеративных задач пространство возможных выходов достаточно велико, чтобы обучение с подкреплением продолжало находить улучшения, которые пропускает SFT — особенно когда поощряется семантическая правильность, а не точное совпадение строк.
Практическое правило для принятия решений
Исследование даёт простую рекомендацию для разработчиков:
- Классификация или строгий вызов функций → Используйте только SFT
- Вопросно-ответные задачи, документация, задачи извлечения → Добавляйте RLVR поверх SFT
Методология, все 12 протестированных наборов данных и исходные числа доступны в полном анализе.
📖 Прочитать полный источник: r/LocalLLaMA
👀 Смотрите также

GLM-5.1 выпущен с производительностью в кодировании на уровне Claude Opus 4.5
Модель GLM-5.1 от Zhipu AI теперь доступна всем пользователям Coding Plan, набрав 77,8 балла на SWE-bench-Verified и 56,2 балла на Terminal Bench 2.0. Модель имеет окно контекста в 200K токенов, максимальный вывод в 128K токенов и 744B параметров, из которых активировано 40B.

MiMo-V2.5-Pro бенчмарк: сильное социально-дедуктивное рассуждение, хорошее соотношение цена/качество по сравнению с K2.6
MiMo-V2.5-Pro конкурирует с Kimi K2.6 в автономных играх Blood on the Clocktower, с однобоким процентом побед 88% за Добро и 48% за Зло, стоимостью $0.99 за игру при 183 000 выходных токенов и практичностью при матчах длительностью 2-3 часа.

Claude Code v2.1.136: Жёсткий запрет для автоматического режима, исправления MCP OAuth и 40+ исправлений ошибок
Anthropic выпустила Claude Code v2.1.136 с настройкой hard_deny для правил классификатора в автоматическом режиме, исправлениями исчезновения MCP-сервера после /clear, проблем с параллельным обновлением OAuth-токенов и более чем 40 другими исправлениями.
Ассистент Canvas LMS на базе OpenClaw и Composio
Учитель настроил бота, который получает доступ к трем своим курсам Canvas через Composio CLI, позволяя ему создавать списки студентов в Excel, проверять битые ссылки и отслеживать просмотры страниц.