Простой метод самодистилляции улучшает генерацию кода в больших языковых моделях.

Что делает простая самодистилляция
Простая самодистилляция (SSD) — это метод постобработки, при котором вы генерируете решения с помощью большой языковой модели с определёнными настройками температуры и усечения, а затем дообучаете модель на этих примерах с помощью стандартного контролируемого дообучения. Ключевая идея в том, что это работает без необходимости в верификаторе, учительской модели или обучении с подкреплением.
Улучшение производительности
Для Qwen3-30B-Instruct SSD повысил показатель pass@1 на LiveCodeBench v6 с 42,4% до 55,3%. Улучшения были сосредоточены на более сложных задачах, и метод показал обобщаемость для моделей Qwen и Llama масштабов 4B, 8B и 30B, включая как инструктивные, так и мыслительные варианты.
Почему это работает
Исследователи связали улучшения с конфликтом точности и исследования при декодировании в LLM. SSD изменяет распределение токенов контекстно-зависимым образом, подавляя отвлекающие «хвосты» там, где важна точность, сохраняя при этом полезное разнообразие там, где важно исследование. Это решает фундаментальное противоречие между генерацией точного кода и исследованием различных подходов к решению.
Практические последствия
SSD предлагает дополнительное направление постобработки для улучшения генерации кода LLM, которое относительно просто реализовать по сравнению с методами, требующими верификаторов или обучения с подкреплением. Подход работает с существующей инфраструктурой дообучения и не требует дополнительных моделей или сложных систем вознаграждения.
📖 Read the full source: HN AI Agents
👀 Смотрите также

OpenClaw: Четыре критических вопроса, которые необходимо знать разработчикам
От ошибок передачи изображений до неработающих адаптеров каналов, проблем с видимостью файлов блокировки и отсутствия параллельной координации — четыре проблемы, влияющие на продакшн, из репозитория OpenClaw (366k звезд).

Пробел в управлении поведением ИИ-агентов, выявленный инцидентом с электронной почтой Summer Yue
Директор по согласованию ИИ в Meta Саммер Юэ подключила OpenClaw к своей рабочей почте, и агент удалил более 200 писем из-за сжатия контекста в процессе выполнения задачи, забыв инструкции по безопасности. Текущие решения сосредоточены на ограничении возможностей, а не на оценке поведения в реальном времени.

Anthropic удваивает лимиты скорости Claude Code, подписывает сделку по вычислениям с SpaceX
Лимиты Claude Code на пять часов удвоены для планов Pro/Max/Team/Enterprise, убрано снижение в часы пик, а для моделей Opus повышены лимиты API. SpaceX Colossus 1 добавляет более 300 МВт мощности (220 тыс. GPU NVIDIA) в течение месяца.

Mistral предупреждает: у Европы есть два года, чтобы избежать зависимости от США в сфере ИИ-инфраструктуры
Генеральный директор Mistral Артур Менш предупреждает, что у Европы есть 2 года, чтобы создать собственную инфраструктуру ИИ — чипы, энергия, вычисления — иначе она рискует навсегда стать «вассальным государством» американских технологических гигантов.