에이전트 GRPO: 프로그래밍 대회에서 모든 인간을 이긴 첫 AI

✍️ OpenClawRadar📅 게시일: May 24, 2026🔗 Source
에이전트 GRPO: 프로그래밍 대회에서 모든 인간을 이긴 첫 AI
Ad

한 팀이 Agentic GRPO라는 강화학습 알고리즘을 개발하여 AI 시스템이 라이브 경쟁 프로그래밍 대회에서 모든 인간 참가자를 일관되게 이길 수 있게 했습니다. 이는 최초로 달성한 기록입니다. 이전 최고였던 Google의 Gemini 3 Deep Think는 8위에 그쳤습니다.

표준 RL이 코딩 에이전트에 실패하는 이유

LLM을 위한 전통적인 RL은 하나의 답변을 하나의 궤적으로 취급합니다: 프롬프트 → 추론 → 최종 답변 → 보상. 그러나 에이전트 시스템은 도구를 호출하고, 가설을 생성하고, 테스트를 실행하고, 코드를 디버깅하고, 컨텍스트를 요약하고, 계획을 수정하며, 성공하기 전에 여러 번 반복합니다. 이로 인해 어려운 문제가 발생합니다: 보상이 매우 늦게 도착하고, 궤적이 매우 길며, 롤아웃이 실행되는 동안 정책이 변경됩니다(오프폴리시 드리프트). Agentic GRPO는 이 환경에서 학습을 안정화합니다.

GRPO란 무엇인가?

GRPO는 Group Relative Policy Optimization의 약자입니다. PPO와 유사하게 여러 출력을 샘플링하고 서로 비교하여 상대적으로 더 나은 것에 보상을 주고, 더 나은 궤적 쪽으로 모델을 업데이트합니다. 완벽한 스칼라 보상 보정 대신, 샘플 그룹 내에서 상대적 순위/정규화를 사용합니다.

Ad

Agentic GRPO의 핵심 직관

어려운 프로그래밍 문제를 해결하는 AI 코딩 에이전트의 워크플로는 다음과 같습니다: 가설 제안 → 알고리즘 생성 → 코드 작성 → 테스트 생성 → 테스트 실행 → 실패 디버깅 → 재시도 → 마지막으로 통과. 표준 RL에서는 모델이 맨 마지막에만 보상을 받을 수 있어 훈련이 느리고 불안정합니다.

Agentic GRPO는 다음을 도입합니다:

  • 즉시 보상 — 중간 피드백이 나타나는 즉시 업데이트
  • 지연 보정 — 최종 결과가 알려진 후에 이전 업데이트를 사후 수정

따라서 전체 롤아웃이 끝날 때까지 기다리는 대신(단계1 → 단계2 → 단계3 → 최종 보상), 시스템은 다음과 같이 작동합니다: 단계1 보상 → 지금 업데이트; 단계2 보상 → 지금 업데이트; 단계3 보상 → 지금 업데이트; 나중에: 최종 보상 도착, 이전 업데이트 사후 수정.

비유

전통적인 RL: 전체 프로젝트가 출시될 때까지 기다린 다음 "잘했어" 또는 "잘못했어"라고 말합니다. Agentic GRPO: 지속적으로 피드백을 제공합니다("그 가설은 유용했어", "그 테스트가 버그를 잡았어", "이 최적화가 도움이 됐어") 그러나 나중에 평가를 수정합니다("사실 초기 설계 결정이 문제를 일으켰어"). 학습이 더 빠르고, 밀도 높고, 안정적이 됩니다.

이것은 장기적 LLM 에이전트, 코딩 에이전트 및 자율 워크플로를 위해 RL을 해결합니다.

📖 전체 출처 읽기: r/LocalLLaMA

Ad

👀 See Also

WSJ: CEO, AI 선택의 기로 – 해고 아니면 업무 과중
News

WSJ: CEO, AI 선택의 기로 – 해고 아니면 업무 과중

WSJ는 AI 도구가 생산성 향상을 약속함에 따라 CEO들이 직원을 해고하거나 더 많은 일을 할당하는 선택을 하고 있다고 보도하며, HN 토론에서 11포인트를 기록했습니다.

OpenClawRadar
Anthropic, 클로드 파트너 네트워크 출시에 1억 달러 투자
News

Anthropic, 클로드 파트너 네트워크 출시에 1억 달러 투자

Anthropic은 2026년까지 초기 1억 달러를 투자하여 Claude Partner Network를 출시합니다. 이 프로그램은 기업이 Claude를 도입하도록 지원하는 조직에 교육, 기술 지원, 공동 시장 개발을 제공합니다. 파트너는 기술 인증, 교육 자료가 포함된 파트너 포털, 레거시 코드 마이그레이션을 위한 코드 현대화 스타터 키트에 접근할 수 있습니다.

OpenClawRadar
Claude-Code v2.1.110은 TUI 모드, 푸시 알림 및 여러 가지 수정 사항을 추가했습니다.
News

Claude-Code v2.1.110은 TUI 모드, 푸시 알림 및 여러 가지 수정 사항을 추가했습니다.

Claude-Code v2.1.110은 깜빡임 없는 렌더링을 위한 새로운 /tui 명령어, 모바일 알림을 위한 푸시 알림 기능, 플러그인 관리 및 원격 제어 기능 개선을 도입했습니다. 이번 릴리스에는 MCP 서버, 세션 처리, UI 문제에 대한 여러 버그 수정도 포함되어 있습니다.

OpenClawRadar
SubQ: 12M 토큰 컨텍스트와 95% RULER 정확도를 갖춘 최초의 완전 준2차 LLM
News

SubQ: 12M 토큰 컨텍스트와 95% RULER 정확도를 갖춘 최초의 완전 준2차 LLM

Subquadratic은 하위 2차 LLM인 SubQ 1M-Preview를 출시했습니다. 선형 컴퓨팅 스케일링, 1200만 토큰 컨텍스트, FlashAttention보다 52배 빠른 희소 어텐션, RULER 128K에서 95% 정확도를 제공합니다. API, CLI 코드 에이전트(SubQ Code), 검색 도구(SubQ Search)를 통해 사용 가능합니다.

OpenClawRadar