Когда RLVR помогает небольшим доработанным моделям: анализ на 12 наборах данных

✍️ OpenClawRadar📅 Опубликовано: 27 февраля 2026 г.🔗 Source
Когда RLVR помогает небольшим доработанным моделям: анализ на 12 наборах данных
Ad

Недавний эксперимент проверил, даёт ли добавление этапа обучения с подкреплением (RLVR) поверх контролируемого дообучения (SFT) для небольших языковых моделей (1,7 млрд параметров) измеримые преимущества. Команда провела контролируемый эксперимент на 12 наборах данных, чтобы точно определить, когда этот подход помогает, а когда нет.

Ключевые выводы

Результаты чётко разделились по типам задач:

  • Задачи генерации текста (вопросно-ответные, документация, обезличивание PII): среднее улучшение на +2,0 процентных пункта. Каждый отдельный набор данных в этой категории показал улучшение.
  • Структурированные задачи (классификация, вызов функций): среднее ухудшение на -0,7 процентных пункта. Два набора данных в этой категории фактически регрессировали.
Ad

Почему возникает эта закономерность

Исследователи объясняют, что как только дообученная модель уже правильно выдаёт большинство структурированных результатов, GRPO (Group Relative Policy Optimization) даёт почти нулевые градиенты. По сути, для этапа обучения с подкреплением не остаётся обучающего сигнала.

Для генеративных задач пространство возможных выходов достаточно велико, чтобы обучение с подкреплением продолжало находить улучшения, которые пропускает SFT — особенно когда поощряется семантическая правильность, а не точное совпадение строк.

Практическое правило для принятия решений

Исследование даёт простую рекомендацию для разработчиков:

  • Классификация или строгий вызов функций → Используйте только SFT
  • Вопросно-ответные задачи, документация, задачи извлечения → Добавляйте RLVR поверх SFT

Методология, все 12 протестированных наборов данных и исходные числа доступны в полном анализе.

📖 Прочитать полный источник: r/LocalLLaMA

Ad

👀 Смотрите также

Оценка навыков Claude и регрессионное тестирование с помощью Snowflake Cortex Agent
Новости

Оценка навыков Claude и регрессионное тестирование с помощью Snowflake Cortex Agent

Продуктовый агент кредитного риска на базе Claude на Snowflake Cortex Agent нуждается в регрессионном тестировании. Сейчас команда вручную сравнивает результаты с BI-запросами, стремясь к автоматизации оценки изменений навыков.

OpenClawRadar
Пятиместный минимум Claude создает пробел в конфиденциальности для индивидуальных практиков
Новости

Пятиместный минимум Claude создает пробел в конфиденциальности для индивидуальных практиков

Защита конфиденциальности на бизнес-уровне от Anthropic требует минимум пять рабочих мест, что вынуждает индивидуальных специалистов либо платить за пустые места, либо использовать потребительские тарифы с недостаточными условиями конфиденциальности. Этот пробел контрастирует с Google Workspace и бизнес-планами OpenAI, которые предлагают корпоративный уровень конфиденциальности по цене одного рабочего места.

OpenClawRadar
Anthropic запускает удалённое управление для кода Claude
Новости

Anthropic запускает удалённое управление для кода Claude

Anthropic запустила функцию удаленного управления для Claude Code, позволяя пользователям продолжать сессии программирования с мобильных устройств. Функция описана на code.claude.com/docs/en/remote-control.

OpenClawRadar
Команда MeshCore разделяется: товарный знак зарегистрирован втайне, спор о коде, сгенерированном ИИ
Новости

Команда MeshCore разделяется: товарный знак зарегистрирован втайне, спор о коде, сгенерированном ИИ

Команда разработчиков MeshCore публично разделилась после того, как участник Энди Кирби тайно подал заявку на товарный знак MeshCore и использовал Claude Code для генерации большей части своих кодовых вкладов без раскрытия этого факта.

OpenClawRadar