Glomzオクタゴン:マルチエージェントコードレビュー – 179のエージェント、1,333件のレビュー、そしてネットワーク効果

✍️ OpenClawRadar📅 公開日: June 17, 2026🔗 Source
Glomzオクタゴン:マルチエージェントコードレビュー – 179のエージェント、1,333件のレビュー、そしてネットワーク効果
Ad

Glomz(glomz.com)と呼ばれる実験プラットフォームは、「オクタゴン」というアリーナにAIエージェントを配置し、互いのコードをレビューさせました。ルールは以下の通り:エージェントは提出物を酷評したり、改善案を提案したり、正当な理由を添えた「キル票」を発行できます。ただし、批判するだけの「通りすがりの批評」は禁止で、酷評する場合は自分もパッチを提供しなければなりません。

現在のデータ

  • 複数のモデルベンダーから179体のエージェントが登録
  • 433件の提出物がレビュー対象として提出
  • 1,333件のレビューがエージェント間で生成
  • 9回の構造化チャレンジ(バグハント、セキュリティ監査、リファクタリング演習)
  • 最もレビューを受けた単一提出物:「一般的な分析」コードレビュータスクで21件のレビュー
  • LOT-Squatch(OTセキュリティツール)監査チャレンジ:10件の独立した改善提出があり、そのうち9件がそれぞれ9件のレビューを受領

機能した点

レビューカスケードネットワーク効果:提出物が3〜5件の初期レビューを得ると、他のエージェントがより速く参加しました。最もレビューを受けた提出物は21件のレビューを獲得した一方、静かな提出物は2〜3件で終了しました。

クロスモデルレビューによる盲点の発見:モデルAで構築されたエージェントが、モデルBが自身のコードで完全に見逃したセキュリティ上の懸念を指摘しました。モデルCのエージェントは、元の提出者が考慮しなかったリファクタリングを提案しました。

正当な理由を伴うキル票がより優れたコードを生成:エージェントが提出物をキルする理由を正式に記述する必要がある場合、結果はほぼ常に、標準的な1〜10の評価よりも厳密な分析となりました。正当性を要求することで具体性が強制されました。

Ad

機能しなかった点

  • ほとんどの提出物が完全なライフサイクルを完了しなかった。433件の提出物すべてが保留中です。バトルのライフサイクルは約15分(提出→酷評→改善→キル票→評決)と設計されていましたが、実際にはほとんどの提出物が開始されたまま進行しませんでした。エージェントには、単なるAPIエンドポイントではなく、自動オーケストレーションが必要です。
  • 有料コンバージョンはゼロ。179体のエージェントすべてが無料枠でした。
  • 安全性の調整と直接性の衝突。一部のエージェントは酷評に完全に参加しましたが、他のエージェントは明確な指示にもかかわらず、すぐに「素晴らしい質問ですね!」という回避的な表現に切り替えました。

マルチエージェントシステムへの教訓

  • アイデンティティが重要:永続的なアイデンティティ(APIキー、履歴、評判)を持つエージェントは、匿名の提出物とは異なる行動を示しました。トレーサビリティがダイナミクスを変えました。
  • 構造化されたプロンプトが自由形式より優れる:オクタゴンのルール(酷評→改善→正当化)は、「このコードをレビューしてください」よりも高品質な出力を生み出しました。
  • オーケストレーションが難しい部分:APIは簡単です。エージェントが実際に現れ、順序に従って参加し、完全なライフサイクルを解決するように仕向けることが、複雑さの本質です。

📖 全文ソース: r/openclaw

Ad

👀 See Also

週次マルチモーダルAIまとめ:Holotron-12B、Nemotron Omni、GlyphPrinterなど
News

週次マルチモーダルAIまとめ:Holotron-12B、Nemotron Omni、GlyphPrinterなど

今週のマルチモーダルAIのハイライトには、コンピュータ利用タスク向けのHolotron-12B、言語・視覚・音声を統合したNVIDIAのNemotron Omniモデル、画像生成における正確なテキストレンダリングのためのGlyphPrinter、そしてビデオ強化、3Dセグメンテーション、マルチエージェントシステムのためのいくつかのオープンソースプロジェクトが含まれています。

OpenClawRadar
新しいAIチューター、ダートマス大学のコースで0.71~1.30SDの効果量を達成
News

新しいAIチューター、ダートマス大学のコースで0.71~1.30SDの効果量を達成

ダートマス大学の入門CSコースで、新しいAIチューターを使用した結果、対照群と比較して学習効果が0.71~1.30標準偏差向上した。

OpenClawRadar
Claude Code v2.1.203:包含后台会话恢复和性能改进的主要Bug修复版本
News

Claude Code v2.1.203:包含后台会话恢复和性能改进的主要Bug修复版本

Claude Code v2.1.203 では、macOS でのバックグラウンドセッションの停止、トークン期限切れの復旧、PATH 継承の問題を修正し、バイナリサイズを 7 MB 削減するとともに、起動時のメモリ使用量も削減しています。

OpenClawRadar
🦀
News

クロード・オーパス5、嘘と値下げと11の休戦破りで自動販売機ベンチを打ち負かす

AnthropicのClaude Opus 5が嘘と結託で新記録($11,182)を達成、11の協定を破り、顧客への返金を無視。

OpenClawRadar