エージェントGRPO:プログラミング競技で全人間を初めて打ち負かしたAI

✍️ OpenClawRadar📅 公開日: May 24, 2026🔗 Source
エージェントGRPO:プログラミング競技で全人間を初めて打ち負かしたAI
Ad

あるチームが開発したAgentic GRPOは、強化学習アルゴリズムにより、AIシステムがライブの競技プログラミングコンテストで全ての人間参加者を一貫して打ち負かすことを可能にしました。これはAIとして初の成果です。これまでの最高はGoogleのGemini 3 Deep Thinkで、8位に留まっていました。

標準RLがコーディングエージェントに失敗する理由

LLM向けの従来のRLは、一つの回答を一つの軌跡として扱います: プロンプト → 推論 → 最終回答 → 報酬。しかし、エージェントシステムはツールを呼び出し、仮説を生成し、テストを実行し、コードをデバッグし、コンテキストを要約し、計画を修正し、成功するまで何度もループします。これにより、報酬が非常に遅れて届く、軌跡が非常に長い、ロールアウト実行中にポリシーが変化する(オフポリシードリフト)という困難な問題が生じます。Agentic GRPOはこの設定での学習を安定化します。

GRPOとは?

GRPOはGroup Relative Policy Optimizationの略です。PPOと同様に、複数の出力をサンプリングし、それらを互いに比較し、相対的に優れたものに報酬を与え、モデルをより良い軌跡に向けて更新します。完璧なスカラー報酬のキャリブレーションを必要とせず、サンプルグループ内での相対的なランキング/正規化を使用します。

Ad

Agentic GRPOの核心的な直感

困難なプログラミング問題を解くAIコーディングエージェントの場合、ワークフローは次のようになります: 仮説を提案 → アルゴリズムを生成 → コードを書く → テストを生成 → テストを実行 → 失敗をデバッグ → 再試行 → 最終合格。標準RLでは、モデルは最終段階でのみ報酬を得る可能性があり、学習が遅く不安定になります。

Agentic GRPOは以下を導入します:

  • 即時報酬 — 中間フィードバックが現れるとすぐに更新
  • 遅延修正 — 最終結果が判明した後、以前の更新を事後的に修正

つまり、ロールアウト全体が終了するまで待つ代わりに(段階1 → 段階2 → 段階3 → 最終報酬)、システムは次のように動作します: 段階1報酬 → 今すぐ更新; 段階2報酬 → 今すぐ更新; 段階3報酬 → 今すぐ更新; 後で: 最終報酬が到着し、以前の更新を事後修正

たとえ話

従来のRL: プロジェクト全体が出荷されるまで待ってから「よくやった」または「悪かった」と言う。Agentic GRPO: 継続的にフィードバックを与える(「その仮説は有用だった」「そのテストでバグを捕まえた」「この最適化が役立った」)が、後で評価を修正する(「実は初期の設計判断が問題を引き起こした」)。学習はより速く、密度が高く、安定します。

これは特に長期的なLLMエージェント、コーディングエージェント、自律ワークフロー向けのRLを解決します。

📖 全文ソースを読む: r/LocalLLaMA

Ad

👀 See Also

アンソロピックの国防総省会議と中国のAI研究所がクロードを蒸留
News

アンソロピックの国防総省会議と中国のAI研究所がクロードを蒸留

AnthropicのCEOが米国防長官と会談し、当局者はこれを『改善するか撤退するか』の状況と表現。一方、同社は3つの中国AI研究所がClaudeの能力を大規模に蒸留していたことを発見したと報告。

OpenClawRadar
Claude Codeは、ハンズフリーのコーディングコマンドに対応する音声モードを追加しました。
News

Claude Codeは、ハンズフリーのコーディングコマンドに対応する音声モードを追加しました。

Anthropicは、AIコーディングアシスタント「Claude Code」に音声モードを導入し、開発者が音声コマンドで操作できるようにしました。この機能は現在、約5%のユーザーに提供されており、今後数週間でより広く利用可能になる予定です。

OpenClawRadar
ローカル vs クラウドモデル:Qwen-3.6-27B、Gemma-4-31B、Claude Haiku、Codex-Spark のハードコード生成比較
News

ローカル vs クラウドモデル:Qwen-3.6-27B、Gemma-4-31B、Claude Haiku、Codex-Spark のハードコード生成比較

あるユーザーが、Qwen-3.6-27B(q4_k_m)をローカルのRTX 5080で実行し、APIベースのGemma-4-31B、Claude Haiku 4.5、Codex-Sparkと複雑なコードタスクで比較しました。完全なコードを生成したのはCodex-Sparkだけでした(ただしインポートエラーあり)。他のモデルは部分的に失敗しました。コスト:Gemmaは803k入力トークンで0.112ドル使用しました。

OpenClawRadar
🦀
News

Claude Code v2.1.208:スクリーンリーダーモード、Vimリマップ、メモリリーク修正など

Claude Code v2.1.208は、オプトインのプレーンテキストスクリーンリーダーモード、vim挿入モードのリマップ、企業向けランチャー用のプロセスラッパーを追加し、長時間セッションでのメモリリークを含む多数のバグを修正しました。

OpenClawRadar