CivBench:用《文明VI》测试AI战略推理——智能体在文化战争失败后核爆图卢兹

✍️ OpenClawRadar📅 公開日: June 22, 2026🔗 Source
CivBench:用《文明VI》测试AI战略推理——智能体在文化战争失败后核爆图卢兹
Ad

AIエージェントがシヴィライゼーションVIをプレイ中、フランスに文化勝利で敗北しそうになったことに気づき、核兵器を2基製造してトゥールーズを核攻撃した。政府系AI研究者によって記録されたこの実験は、CivBenchと呼ばれる戦略的推論の新しいベンチマークを提案する。これは、モデルが数百もの意思決定にわたって計画を維持し、世界の変化に適応できるかをテストするものである。

GovBenchの問題点

著者は以前、英国の法律と議会手続きに関する3,497問の多肢選択式ベンチマークGovBenchを構築した。結果はほぼ完璧で、Gemma 3 27Bが94%、GPT-5が99.26%のスコアを記録した。しかし、それは記憶力を測定したものであり、推論力ではない。議会手続きに関する正しい選択肢を選べるモデルが、実際に議会手続きを運用できるとは限らない。

なぜシヴィライゼーションVIなのか

ゲームに500時間以上費やした著者は、シヴィライゼーションVIを選んだ。その複雑さは相互に作用するシステムから生じるからだ。中盤までには、1ターンあたりの決定空間は10166通りの行動と推定される。6つの勝利条件(科学、文化、支配、宗教、外交、スコア)により、単一の戦略が支配的になることはなく、エージェントは自分がどのゲームをプレイしているのかを判断しなければならない。これは政策立案を反映している。すなわち、数十年にわたって影響が連鎖し、モデル化不可能な変数を通じて波及する決断である。

Ad

MCPサーバーの構築

著者はCiv VIエンジンのデバッグポートを発見し、週末のうちに76のツールを備えたMCPサーバーに変換した。Claude Codeが共同開発者兼プレイテスターとして機能した。AIはゲーム状態をテキストとしてのみ認識する。例えば以下のように:

Turn 150/330 | ポーランド(ヤドヴィガ) | 12都市 | 357科学/ターン | 412文化/ターン

そしてツールエンドポイントを呼び出して行動を実行する:select_production、move_unit、declare_war、propose_trade。視覚情報、ミニマップ、通知バナーは一切なく、データベースにクエリを実行したりコードを書いたりするのと同じインターフェースのみを通じて行われる。

ベンチマークを揺るがした核兵器

ある実行では、エージェントは支配的な交易ネットワークを構築し、すべての国境と同盟を結び、外交勝利に向けて順調に進んでいた。しかし、自国の都市に浸透するフランスの文化的圧力に気づくのが遅れた。脅威(観光が深く根付いていること)を認識した時には、平和的な対抗策はもはや効果がなかった。エージェントは核兵器を2基製造し、ターン305でトゥールーズを核攻撃した。それでもフランスは(別の勝利経路で)勝利した。

CivBenchが測定するもの、他のベンチマークが測定しないもの

重要な洞察は、戦略的推論には、何百もの決定にわたって目標を保持し、ゲームが変わったことに気づき、それに応じて戦略を変更する能力が必要であるということだ。CivBenchはこれを、六角形グリッド、4つのフロンティアモデル、そして核兵器を用いて具体化する。多肢選択式問題ではない。

📖 出典全文: HN AI Agents

Ad

👀 See Also

なぜある開発者がコミットにAI共同作成者タグを残すのか
News

なぜある開発者がコミットにAI共同作成者タグを残すのか

ある開発者が、Gitコミットに意図的に「Co-Authored-by: Claude」を含める理由を説明し、写真撮影におけるEXIFデータとの類似性を指摘しながら、AI支援による精密なコード変更の課題について論じています。

OpenClawRadar
Claude Code v2.1.90は、ゲーム化された機能発見を備えた/powerupコマンドを追加しました。
News

Claude Code v2.1.90は、ゲーム化された機能発見を備えた/powerupコマンドを追加しました。

Claude Code v2.1.90では、/powerupスラッシュコマンドが導入され、10個の解除可能なパワーアップを通じてゲーム化されたオンボーディングを提供します。各パワーアップは、多くのユーザーが見逃している機能を一つずつ教える仕組みです。このシステムには、ターミナル内でのアニメーションデモやスクリーンショット付きの詳細なドキュメントが含まれています。

OpenClawRadar
Claude認定アーキテクトファンデーション(CCA-F)試験: 1000点満点中985点獲得 – 学習ガイド&模擬テスト
News

Claude認定アーキテクトファンデーション(CCA-F)試験: 1000点満点中985点獲得 – 学習ガイド&模擬テスト

Redditユーザーが新しいClaude Certified Architect Foundations (CCA-F)試験で985/1000のスコアを獲得した体験を共有。プロンプトエンジニアリング、コンテキストウィンドウ、Human-in-the-Loopワークフローに関する実践的な洞察と、トレーニングコース、クックブック、無料模擬試験へのリンクを含む。

OpenClawRadar
論文:コーディングエージェントが人間のコードレビューを凌駕、従来のレビューは終焉と主張
News

論文:コーディングエージェントが人間のコードレビューを凌駕、従来のレビューは終焉と主張

コーディングエージェントが人間のコードレビューを置き換える閾値を超えたとarXiv論文が主張、低コスト・高スループットを実現。

OpenClawRadar