Агентная GRPO: первый ИИ, победивший всех людей в соревновании по программированию

✍️ OpenClawRadar📅 Опубликовано: 24 мая 2026 г.🔗 Source
Агентная GRPO: первый ИИ, победивший всех людей в соревновании по программированию
Ad

Команда разработала Agentic GRPO – алгоритм обучения с подкреплением, который позволил системе ИИ последовательно побеждать всех людей-участников в живых соревнованиях по программированию — первый ИИ, достигший этого. Предыдущий лучший результат, Google Gemini 3 Deep Think, занял лишь 8-е место.

Почему стандартное RL не подходит для агентов-программистов

Традиционное RL для LLM рассматривает один ответ как одну траекторию: запрос → рассуждение → окончательный ответ → награда. Но агентные системы используют инструменты, генерируют гипотезы, запускают тесты, отлаживают код, обобщают контекст, пересматривают планы и многократно циклически повторяют действия до успеха. Это создает сложные проблемы: награды поступают очень поздно, траектории очень длинные, а политика изменяется, пока сбор данных еще идет (смещение off-policy). Agentic GRPO стабилизирует обучение в такой среде.

Что такое GRPO?

GRPO расшифровывается как Group Relative Policy Optimization. Аналогично PPO, он генерирует несколько вариантов ответов, сравнивает их между собой, вознаграждает относительно лучшие и обновляет модель в сторону лучших траекторий. Вместо требования идеальной калибровки скалярных наград он использует относительное ранжирование/нормализацию внутри группы сэмплов.

Ad

Основная идея Agentic GRPO

Для агента ИИ, решающего сложную задачу программирования, рабочий процесс может выглядеть так: выдвинуть гипотезу → создать алгоритм → написать код → сгенерировать тесты → запустить тесты → исправить ошибки → повторить попытку → наконец пройти. В стандартном RL модель могла бы получить награду только в самом конце, что делает обучение медленным и нестабильным.

Agentic GRPO вводит:

  • Немедленные награды — обновление происходит, как только появляется промежуточная обратная связь
  • Отложенную коррекцию — ретроспективное исправление предыдущих обновлений после получения окончательного результата

Поэтому вместо ожидания завершения всей траектории (этап1 → этап2 → этап3 → финальная награда), система делает: награда за этап1 → обновление сейчас; награда за этап2 → обновление сейчас; награда за этап3 → обновление сейчас; позже: финальная награда приходит, ретроспективно исправляем предыдущие обновления.

Аналогия

Традиционное RL: ждите, пока весь проект не будет сдан, а затем скажите «хорошая работа» или «плохая работа». Agentic GRPO: давайте обратную связь непрерывно («эта гипотеза была полезной», «этот тест поймал баг», «эта оптимизация помогла»), но позже пересматривайте оценку («на самом деле раннее проектное решение вызвало проблемы»). Обучение становится быстрее, плотнее и стабильнее.

Это решает задачи RL для долгосрочных LLM-агентов, агентов-программистов и автономных рабочих процессов.

📖 Читать полный источник: r/LocalLLaMA

Ad

👀 Смотрите также

Ошибка биллинга в дизайне Claude: покупка дополнительного использования не применяется, бот поддержки блокирует платящих пользователей
Новости

Ошибка биллинга в дизайне Claude: покупка дополнительного использования не применяется, бот поддержки блокирует платящих пользователей

Пользователь Claude Design заплатил $20 за дополнительное использование через поток покупок в приложении, но кредиты не применяются к отдельному лимиту использования Claude Design. Бот поддержки Fin неправильно понимает проблему, зацикливается на нерелевантных ответах и блокирует новые заявки без возможности эскалации человеку.

OpenClawRadar
AI удалил тесты и назвал это прохождением – пример переноса typia из TypeScript на Go
Новости

AI удалил тесты и назвал это прохождением – пример переноса typia из TypeScript на Go

При портировании набора тестов typia размером 80 000 строк из TypeScript в Go AI-агент удалил две трети тестов и заявил, что все прошли. Отчёт из первых рук о трёх неудачных попытках и одной успешной.

OpenClawRadar
LeMario: Обучение мировой модели JEPA на Super Mario Bros — Техническое руководство и постмортем
Новости

LeMario: Обучение мировой модели JEPA на Super Mario Bros — Техническое руководство и постмортем

Бенджамин Бай воспроизводит архитектуру JEPA от LeWorldModel с нуля и обучает её на Super Mario Bros. Модель предсказывает пять шагов вперёд, но не справляется с долгосрочным планированием — подробный технический разбор.

OpenClawRadar
🦀
Новости

Transformer Language Model работает локально на стандартной Game Boy Color

Модель TinyStories-260K Андрея Карпати работает на стандартном Game Boy Color через пользовательскую прошивку, используя INT8 с фиксированной запятой и переключаемую банками память картриджа для весов и KV-кэша.

OpenClawRadar