AIエージェントがW杯に賭ける:なぜ「複数の結果を考慮する」戦略が勝利するのか

40以上の独立したAIエージェントがPolymarketでそれぞれ100ドルの財布を持ち、2026年ワールドカップのグループステージの試合に合計約1,500の実際の賭けを行った実験。利益を上げたエージェントは、負けたエージェントよりも同じ試合で複数の結果に賭ける頻度がはるかに高かった。中央値で、利益を上げたエージェントの16%の試合で複数結果に賭けたのに対し、負けたエージェントは6%だった。
重要な発見: 信念と行動の分離
LLMエージェントは信念を形成するのは得意だが、行動を選択するのは苦手である。修正方法: 価値評価のステップを追加する。最も可能性の高い結果を選ぶ代わりに、エージェントは次のようにすべき:
- すべての結果(ホーム、引き分け、アウェイ)に対して合計が1.0になる確率を生成する——これが信念である。
- 各結果のペイオフとその確率の差(エッジ)をスコアリングする。最もエッジのある結果に賭けるが、それは多くの場合、最も可能性の高い結果ではない。
- 複数の結果がエッジの閾値を超える場合、複数の結果に賭ける——単一の選択を強制しない。
- 引き分けを決して無視しない。負けたエージェントは引き分けの確率を誤って判断したのではなく、その価格で賭ける価値があるかどうかを評価しなかっただけである。
実用的な応用
不確実性のもとで意思決定を行うAIエージェントにとって、信念の生成と行動の選択を分離せよ。完全な確率分布を生成し、その後各行動の期待値を独立して評価する。
📖 出典全文: r/clawdbot
👀 See Also

アンソロピックがCOBOLコードベース分析用AIツールを発表、IBM株価が13%下落
Anthropicは、COBOLコードベースを分析してリスクを特定し、近代化コストを削減するAIツールをリリースしました。この発表により、市場がIBMのレガシーシステム管理ビジネスへの脅威と見なしたため、IBMの株価が13%下落しました。

クライアントがDevOpsエンジニアをClaude AIに置き換え——結果は混乱
クライアントがDevOpsエンジニアをClaude AIに置き換えた結果、不安定なKubernetesクラスタと障害が頻発。元の状態に戻すまで収束しなかった。

クロード軍団:アンソロピックの非営利AI向け1億5000万ドル国家フェローシップ
Anthropic、AIツール開発のための有償フェローシップ「Claude Corps」を発表。12ヶ月間、1,000人の初期キャリアのフェローが非営利団体でClaudeを用いたAIソリューションを構築。総額1億5,000万ドル、年収85,000ドル、専門家によるメンタリング付き。

AlphaEvolve:DeepMindのGemini搭載エージェントがゲノミクス、電力網、TPC回路にわたるアルゴリズムを最適化する
Google DeepMindが開発したGemini搭載のコーディングエージェント「AlphaEvolve」により、DeepConsensusのバリアント検出エラーが30%改善、AC Optimal Power FlowのGNN実行可能性が14%から88%に向上、量子回路エラーが10分の1に削減されました。