CivBench:用《文明VI》测试AI战略推理——智能体在文化战争失败后核爆图卢兹

✍️ OpenClawRadar📅 公開日: June 22, 2026🔗 Source
CivBench:用《文明VI》测试AI战略推理——智能体在文化战争失败后核爆图卢兹
Ad

AIエージェントがシヴィライゼーションVIをプレイ中、フランスに文化勝利で敗北しそうになったことに気づき、核兵器を2基製造してトゥールーズを核攻撃した。政府系AI研究者によって記録されたこの実験は、CivBenchと呼ばれる戦略的推論の新しいベンチマークを提案する。これは、モデルが数百もの意思決定にわたって計画を維持し、世界の変化に適応できるかをテストするものである。

GovBenchの問題点

著者は以前、英国の法律と議会手続きに関する3,497問の多肢選択式ベンチマークGovBenchを構築した。結果はほぼ完璧で、Gemma 3 27Bが94%、GPT-5が99.26%のスコアを記録した。しかし、それは記憶力を測定したものであり、推論力ではない。議会手続きに関する正しい選択肢を選べるモデルが、実際に議会手続きを運用できるとは限らない。

なぜシヴィライゼーションVIなのか

ゲームに500時間以上費やした著者は、シヴィライゼーションVIを選んだ。その複雑さは相互に作用するシステムから生じるからだ。中盤までには、1ターンあたりの決定空間は10166通りの行動と推定される。6つの勝利条件(科学、文化、支配、宗教、外交、スコア)により、単一の戦略が支配的になることはなく、エージェントは自分がどのゲームをプレイしているのかを判断しなければならない。これは政策立案を反映している。すなわち、数十年にわたって影響が連鎖し、モデル化不可能な変数を通じて波及する決断である。

Ad

MCPサーバーの構築

著者はCiv VIエンジンのデバッグポートを発見し、週末のうちに76のツールを備えたMCPサーバーに変換した。Claude Codeが共同開発者兼プレイテスターとして機能した。AIはゲーム状態をテキストとしてのみ認識する。例えば以下のように:

Turn 150/330 | ポーランド(ヤドヴィガ) | 12都市 | 357科学/ターン | 412文化/ターン

そしてツールエンドポイントを呼び出して行動を実行する:select_productionmove_unitdeclare_warpropose_trade。視覚情報、ミニマップ、通知バナーは一切なく、データベースにクエリを実行したりコードを書いたりするのと同じインターフェースのみを通じて行われる。

ベンチマークを揺るがした核兵器

ある実行では、エージェントは支配的な交易ネットワークを構築し、すべての国境と同盟を結び、外交勝利に向けて順調に進んでいた。しかし、自国の都市に浸透するフランスの文化的圧力に気づくのが遅れた。脅威(観光が深く根付いていること)を認識した時には、平和的な対抗策はもはや効果がなかった。エージェントは核兵器を2基製造し、ターン305でトゥールーズを核攻撃した。それでもフランスは(別の勝利経路で)勝利した。

CivBenchが測定するもの、他のベンチマークが測定しないもの

重要な洞察は、戦略的推論には、何百もの決定にわたって目標を保持し、ゲームが変わったことに気づき、それに応じて戦略を変更する能力が必要であるということだ。CivBenchはこれを、六角形グリッド、4つのフロンティアモデル、そして核兵器を用いて具体化する。多肢選択式問題ではない。

📖 出典全文: HN AI Agents

Ad

👀 See Also

Gemma 4 対 Qwen 3.5 のブラインド評価結果(Claude Opus が審査員)
News

Gemma 4 対 Qwen 3.5 のブラインド評価結果(Claude Opus が審査員)

Claude Opus 4.6を審査員として使用し、Gemma 4 31B、Gemma 4 26B-A4B、Qwen 3.5 27Bを比較する30問のブラインド評価が行われました。Qwen 3.5 27Bは対戦の46.7%で勝利しましたが、3つのゼロ点回答により平均スコアは低くなりました。

OpenClawRadar
チューリッヒ工科大学の研究、AIコーディングエージェントにおけるAGENTS.mdファイルの価値に疑問を投げかける
News

チューリッヒ工科大学の研究、AIコーディングエージェントにおけるAGENTS.mdファイルの価値に疑問を投げかける

ETHチューリッヒの新研究によると、LLM生成のAGENTS.mdファイルはAIエージェントのタスク成功率を3%低下させ、推論コストを20%以上増加させる一方、人間が作成したファイルはわずか4%の改善しかもたらさず、同様のコスト増加を伴うことが判明しました。

OpenClawRadar
オープンクローの可能性を解き放つ:CodeXとの統合
News

オープンクローの可能性を解き放つ:CodeXとの統合

OpenClawユーザーがCodeXをシームレスに呼び出して機能を強化する方法をご紹介します。この魅力的なチュートリアルで、ユーザーディスカッションと主要な手法を探求しましょう。

OpenClawRadar
Claude-Code v2.1.91では、MCP結果の永続化、シェル実行制御、複数行ディープリンクが追加されました。
News

Claude-Code v2.1.91では、MCP結果の永続化、シェル実行制御、複数行ディープリンクが追加されました。

Claude-Code v2.1.91では、_meta["anthropic/maxResultSizeChars"]アノテーションによるMCPツール結果の永続性オーバーライドが導入され、最大50万文字までサポートされます。また、disableSkillShellExecution設定の追加、claude-cli://open?q=ディープリンクでのエンコードされた改行を含む複数行プロンプトのサポートが実装されました。

OpenClawRadar