Самообучаемая точная настройка на собственных ошибках повышает качество малых моделей до 80% на HumanEval

Разработчик на r/LocalLLaMA реализовал цикл самообучения, в котором небольшая языковая модель генерирует собственные задачи по программированию, пытается их решить и дообучается на парах, где интерпретатор подтверждает корректность. Ключевая идея из статьи DeepSeek-R1 — что модели могут улучшаться через проверяемые вознаграждения — была применена без размеченных человеком данных.
Метод
Базовую модель (начиная с Qwen 2.5 7B) попросили придумать задачу по программированию и несколько небольших тестов. Затем она решала эту задачу несколько раз. Интерпретатор Python выступал единственным судьей: сохранялись пары (неудачная попытка, рабочая попытка). Дообучение проводилось на этих самостоятельно добытых исправлениях. В обучении не использовался код, написанный человеком.
Результаты
- Qwen 2.5 7B base: 25 → 112 на HumanEval (+87 задач) после исправления ошибки в оценщике, которая урезала вывод функций.
- Qwen 2.5 14B: Добыто 100 пар, обучение заняло 95 минут на H100 ($3,50 за кредиты). Результат в пределах 4 баллов от RLHF-версии той же компании.
- Llama 3.2 3B: 32 пары → 39 → 43 на HumanEval. Подтверждает переносимость между архитектурами.
- Qwen 2.5 Coder 7B: Уже специализирован на коде, но всё равно улучшился: HumanEval 83 → 87, MBPP 122 → 124.
- Qwen 3 4B: HumanEval 79 → 106 (+27), MBPP 135 → 148.
Контрольный эксперимент
Чтобы проверить, не связан ли эффект с обычным обучением, автор создал фальшивые пары со случайным мусорным кодом, который не проходил ни один тест. Обучение на них дало нулевой прирост (25/164, как у базы). Улучшение происходит именно за счёт обучения на самостоятельно созданных ошибках и исправлениях.
Практические детали
Первая попытка провалилась, потому что оценщик останавливался рано, урезая вывод модели вдвое. Исправление оценщика было критичным. Вся настройка работала на 24-гигабайтном MacBook и аккаунте RunPod. Код и скрипты обучения предположительно опубликованы в посте на Reddit.
Для кого это
Разработчиков и исследователей, работающих с небольшими языковыми моделями, которые хотят развить логику программирования без человеческих аннотаций.
📖 Читать полный источник: r/LocalLLaMA
👀 Смотрите также

Claude Code 2.1.80 добавляет видимость лимитов запросов, push-уведомления через MCP и улучшения памяти.
Версия Claude Code 2.1.80 добавляет видимость лимитов запросов в строке состояния, push-сообщения MCP через флаг --channels, встроенную конфигурацию плагинов и сокращает использование памяти на 80 МБ при запуске.
ИИ решает задачи CTF за минуты — что это значит для обучения кибербезопасности
На BSidesSF 2026 автономный агент решил все 52 задачи CTF за считанные минуты, заняв первое место. Это заставляет пересмотреть, как измеряются и тренируются навыки кибербезопасности.

Anthropic выпускает инструмент ИИ для анализа кодовых баз на COBOL, акции IBM падают на 13%.
Anthropic выпустила инструмент ИИ для анализа кодовых баз COBOL, который выявляет риски и снижает затраты на модернизацию. Это объявление вызвало падение акций IBM на 13%, поскольку рынок воспринял его как угрозу бизнесу IBM по управлению устаревшими системами.

Создатель OpenClaw: Благодарности Клоду, инженеру кода, несмотря на запрет подписки Anthropic
Питер Штайнбергер, создатель клиента с открытым исходным кодом Claude Code под названием OpenClaw, публично поблагодарил Бориса Черного из Anthropic за усилия по смягчению последствий запрета Anthropic на использование сторонних клиентов на основе подписки. Черный ответил, отметив, что он отправил пул-реквесты для повышения эффективности кэширования промптов специально для OpenClaw.