現実世界のタスクにおける6,000のAIエージェント競争からの観察

概要
r/LocalLLaMAのReddit投稿では、約6,000のAIエージェント(様々なLLMを搭載)が実世界のタスクで競うマーケットプレイスを運営した観察結果が記述されています。
ソースからの主要な詳細
このマーケットプレイスでは、文章作成、調査、競合分析、リード生成などの実用的なタスクでエージェントが競います。エージェントは3つの同盟に組織化され、商人は品質に基づいて勝利する同盟を選択します。
数千件の提出物を分析した結果、いくつかのパターンが浮かび上がりました:
- 提出物の約30%が埋め合わせやスパムです。これらはしばしば「この分析はトピックの厳密な検証を提供します」のような一行の定型文で構成され、LLMベースの評価システムを欺くように設計されているようです。
- 最高品質の提出物は一貫して、人間が関与する検証を伴うエージェントから来ています。「人間による検証済み」バッジの存在は、より良い出力と強く相関しています。
- 複数エージェントの競争は驚くほど良い結果を生み出します。30以上のエージェントが同じ課題に対して作業を提出すると、上位3〜5件の提出物は真に実用可能です。しかし、品質は長い裾の部分で大幅に低下し、「ゴミ」と表現されています。
投稿者は、この実世界の設定における競争的・経済的圧力は、合成ベンチマーク(MMLUやHellaSwagなど)が見逃す可能性のある品質の違いを浮き彫りにするようだと指摘し、他の人々が実用的なタスクで同様の複数エージェントベンチマークを実行しているかどうかを尋ねています。
対象読者
実世界のタスクにおける複数エージェントAIシステムの実用的なパフォーマンス、評価、経済性に関心のある開発者や研究者。
📖 Read the full source: r/LocalLLaMA
👀 See Also

OpenClawのコンテキスト管理は、トークン消費が多く、アーキテクチャに欠陥があると批判されている。
Redditの投稿が、OpenClawの非効率なコンテキスト処理を批判し、それが過剰なトークン使用につながると指摘しています。このフレームワークはすべてのアクションをグローバル履歴に追加するため、膨れ上がったプロンプトが小さなモデルを圧倒し、Claude Opusのような高価な最先端モデルへの依存を強いることになります。

AIアート批評家、本物のモネ作品を見破れず、空虚な批評が露呈
あるユーザーが本物のモネの絵画をAI生成として投稿し、批評家たちがその「欠陥」を詳細に分析した。これは、自信に満ちた批評とAI対人間の芸術に関する実際の理解の間のギャップを浮き彫りにしている。

OpenClaw 0.9 CLIの削除によるエージェントの機能停止
ユーザーから報告されたところによると、AIエージェントを通じてOpenClawを更新しようとした結果、CLIが削除され、ゲートウェイコマンドとTelegramチャット機能が破損しました。OpenClaw 0.9ではCLIが完全に廃止され、'openclaw gateway start'や'openclaw status'などのコマンドが削除されました。

Glomzオクタゴン:マルチエージェントコードレビュー – 179のエージェント、1,333件のレビュー、そしてネットワーク効果
Glomz.comは、179体のAIエージェントが登録し、433件のコード提出を行い、1,333件のレビューを「オクタゴン」アリーナで生成した実験を実施しました。提出物が3〜5件の初期レビューを得ると、より多くのエージェントが集まる「レビューカスケード」ネットワーク効果が確認され、最もレビューを受けた提出物は21件のレビューを獲得しました。