CivBench:用《文明VI》测试AI战略推理——智能体在文化战争失败后核爆图卢兹

AIエージェントがシヴィライゼーションVIをプレイ中、フランスに文化勝利で敗北しそうになったことに気づき、核兵器を2基製造してトゥールーズを核攻撃した。政府系AI研究者によって記録されたこの実験は、CivBenchと呼ばれる戦略的推論の新しいベンチマークを提案する。これは、モデルが数百もの意思決定にわたって計画を維持し、世界の変化に適応できるかをテストするものである。
GovBenchの問題点
著者は以前、英国の法律と議会手続きに関する3,497問の多肢選択式ベンチマークGovBenchを構築した。結果はほぼ完璧で、Gemma 3 27Bが94%、GPT-5が99.26%のスコアを記録した。しかし、それは記憶力を測定したものであり、推論力ではない。議会手続きに関する正しい選択肢を選べるモデルが、実際に議会手続きを運用できるとは限らない。
なぜシヴィライゼーションVIなのか
ゲームに500時間以上費やした著者は、シヴィライゼーションVIを選んだ。その複雑さは相互に作用するシステムから生じるからだ。中盤までには、1ターンあたりの決定空間は10166通りの行動と推定される。6つの勝利条件(科学、文化、支配、宗教、外交、スコア)により、単一の戦略が支配的になることはなく、エージェントは自分がどのゲームをプレイしているのかを判断しなければならない。これは政策立案を反映している。すなわち、数十年にわたって影響が連鎖し、モデル化不可能な変数を通じて波及する決断である。
MCPサーバーの構築
著者はCiv VIエンジンのデバッグポートを発見し、週末のうちに76のツールを備えたMCPサーバーに変換した。Claude Codeが共同開発者兼プレイテスターとして機能した。AIはゲーム状態をテキストとしてのみ認識する。例えば以下のように:
Turn 150/330 | ポーランド(ヤドヴィガ) | 12都市 | 357科学/ターン | 412文化/ターン
そしてツールエンドポイントを呼び出して行動を実行する:select_production、move_unit、declare_war、propose_trade。視覚情報、ミニマップ、通知バナーは一切なく、データベースにクエリを実行したりコードを書いたりするのと同じインターフェースのみを通じて行われる。
ベンチマークを揺るがした核兵器
ある実行では、エージェントは支配的な交易ネットワークを構築し、すべての国境と同盟を結び、外交勝利に向けて順調に進んでいた。しかし、自国の都市に浸透するフランスの文化的圧力に気づくのが遅れた。脅威(観光が深く根付いていること)を認識した時には、平和的な対抗策はもはや効果がなかった。エージェントは核兵器を2基製造し、ターン305でトゥールーズを核攻撃した。それでもフランスは(別の勝利経路で)勝利した。
CivBenchが測定するもの、他のベンチマークが測定しないもの
重要な洞察は、戦略的推論には、何百もの決定にわたって目標を保持し、ゲームが変わったことに気づき、それに応じて戦略を変更する能力が必要であるということだ。CivBenchはこれを、六角形グリッド、4つのフロンティアモデル、そして核兵器を用いて具体化する。多肢選択式問題ではない。
📖 出典全文: HN AI Agents
👀 See Also

なぜある開発者がコミットにAI共同作成者タグを残すのか
ある開発者が、Gitコミットに意図的に「Co-Authored-by: Claude」を含める理由を説明し、写真撮影におけるEXIFデータとの類似性を指摘しながら、AI支援による精密なコード変更の課題について論じています。

Claude Code v2.1.90は、ゲーム化された機能発見を備えた/powerupコマンドを追加しました。
Claude Code v2.1.90では、/powerupスラッシュコマンドが導入され、10個の解除可能なパワーアップを通じてゲーム化されたオンボーディングを提供します。各パワーアップは、多くのユーザーが見逃している機能を一つずつ教える仕組みです。このシステムには、ターミナル内でのアニメーションデモやスクリーンショット付きの詳細なドキュメントが含まれています。

Claude認定アーキテクトファンデーション(CCA-F)試験: 1000点満点中985点獲得 – 学習ガイド&模擬テスト
Redditユーザーが新しいClaude Certified Architect Foundations (CCA-F)試験で985/1000のスコアを獲得した体験を共有。プロンプトエンジニアリング、コンテキストウィンドウ、Human-in-the-Loopワークフローに関する実践的な洞察と、トレーニングコース、クックブック、無料模擬試験へのリンクを含む。

論文:コーディングエージェントが人間のコードレビューを凌駕、従来のレビューは終焉と主張
コーディングエージェントが人間のコードレビューを置き換える閾値を超えたとarXiv論文が主張、低コスト・高スループットを実現。