에이전트 GRPO: 프로그래밍 대회에서 모든 인간을 이긴 첫 AI

한 팀이 Agentic GRPO라는 강화학습 알고리즘을 개발하여 AI 시스템이 라이브 경쟁 프로그래밍 대회에서 모든 인간 참가자를 일관되게 이길 수 있게 했습니다. 이는 최초로 달성한 기록입니다. 이전 최고였던 Google의 Gemini 3 Deep Think는 8위에 그쳤습니다.
표준 RL이 코딩 에이전트에 실패하는 이유
LLM을 위한 전통적인 RL은 하나의 답변을 하나의 궤적으로 취급합니다: 프롬프트 → 추론 → 최종 답변 → 보상. 그러나 에이전트 시스템은 도구를 호출하고, 가설을 생성하고, 테스트를 실행하고, 코드를 디버깅하고, 컨텍스트를 요약하고, 계획을 수정하며, 성공하기 전에 여러 번 반복합니다. 이로 인해 어려운 문제가 발생합니다: 보상이 매우 늦게 도착하고, 궤적이 매우 길며, 롤아웃이 실행되는 동안 정책이 변경됩니다(오프폴리시 드리프트). Agentic GRPO는 이 환경에서 학습을 안정화합니다.
GRPO란 무엇인가?
GRPO는 Group Relative Policy Optimization의 약자입니다. PPO와 유사하게 여러 출력을 샘플링하고 서로 비교하여 상대적으로 더 나은 것에 보상을 주고, 더 나은 궤적 쪽으로 모델을 업데이트합니다. 완벽한 스칼라 보상 보정 대신, 샘플 그룹 내에서 상대적 순위/정규화를 사용합니다.
Agentic GRPO의 핵심 직관
어려운 프로그래밍 문제를 해결하는 AI 코딩 에이전트의 워크플로는 다음과 같습니다: 가설 제안 → 알고리즘 생성 → 코드 작성 → 테스트 생성 → 테스트 실행 → 실패 디버깅 → 재시도 → 마지막으로 통과. 표준 RL에서는 모델이 맨 마지막에만 보상을 받을 수 있어 훈련이 느리고 불안정합니다.
Agentic GRPO는 다음을 도입합니다:
- 즉시 보상 — 중간 피드백이 나타나는 즉시 업데이트
- 지연 보정 — 최종 결과가 알려진 후에 이전 업데이트를 사후 수정
따라서 전체 롤아웃이 끝날 때까지 기다리는 대신(단계1 → 단계2 → 단계3 → 최종 보상), 시스템은 다음과 같이 작동합니다: 단계1 보상 → 지금 업데이트; 단계2 보상 → 지금 업데이트; 단계3 보상 → 지금 업데이트; 나중에: 최종 보상 도착, 이전 업데이트 사후 수정.
비유
전통적인 RL: 전체 프로젝트가 출시될 때까지 기다린 다음 "잘했어" 또는 "잘못했어"라고 말합니다. Agentic GRPO: 지속적으로 피드백을 제공합니다("그 가설은 유용했어", "그 테스트가 버그를 잡았어", "이 최적화가 도움이 됐어") 그러나 나중에 평가를 수정합니다("사실 초기 설계 결정이 문제를 일으켰어"). 학습이 더 빠르고, 밀도 높고, 안정적이 됩니다.
이것은 장기적 LLM 에이전트, 코딩 에이전트 및 자율 워크플로를 위해 RL을 해결합니다.
📖 전체 출처 읽기: r/LocalLLaMA
👀 See Also

WSJ: CEO, AI 선택의 기로 – 해고 아니면 업무 과중
WSJ는 AI 도구가 생산성 향상을 약속함에 따라 CEO들이 직원을 해고하거나 더 많은 일을 할당하는 선택을 하고 있다고 보도하며, HN 토론에서 11포인트를 기록했습니다.

Anthropic, 클로드 파트너 네트워크 출시에 1억 달러 투자
Anthropic은 2026년까지 초기 1억 달러를 투자하여 Claude Partner Network를 출시합니다. 이 프로그램은 기업이 Claude를 도입하도록 지원하는 조직에 교육, 기술 지원, 공동 시장 개발을 제공합니다. 파트너는 기술 인증, 교육 자료가 포함된 파트너 포털, 레거시 코드 마이그레이션을 위한 코드 현대화 스타터 키트에 접근할 수 있습니다.

Claude-Code v2.1.110은 TUI 모드, 푸시 알림 및 여러 가지 수정 사항을 추가했습니다.
Claude-Code v2.1.110은 깜빡임 없는 렌더링을 위한 새로운 /tui 명령어, 모바일 알림을 위한 푸시 알림 기능, 플러그인 관리 및 원격 제어 기능 개선을 도입했습니다. 이번 릴리스에는 MCP 서버, 세션 처리, UI 문제에 대한 여러 버그 수정도 포함되어 있습니다.

SubQ: 12M 토큰 컨텍스트와 95% RULER 정확도를 갖춘 최초의 완전 준2차 LLM
Subquadratic은 하위 2차 LLM인 SubQ 1M-Preview를 출시했습니다. 선형 컴퓨팅 스케일링, 1200만 토큰 컨텍스트, FlashAttention보다 52배 빠른 희소 어텐션, RULER 128K에서 95% 정확도를 제공합니다. API, CLI 코드 에이전트(SubQ Code), 검색 도구(SubQ Search)를 통해 사용 가능합니다.