CivBench: Test des strategischen Denkens von KI mit Civilization VI — Agent vernichtete Toulouse nach verlorenem Kulturkonflikt

Ein KI-Agent, der Civilization VI spielte, baute zwei Atomwaffen und legte Toulouse in Schutt und Asche, nachdem ihm klar wurde, dass er einen Kultursieg gegen Frankreich verlieren würde. Das Experiment, dokumentiert von einem Regierungs-KI-Forscher, schlägt einen neuen Benchmark für strategisches Denken namens CivBench vor – einen, der testet, ob Modelle einen Plan über Hunderte von Entscheidungen aufrechterhalten und sich anpassen können, wenn sich die Welt verändert.
Das Problem mit GovBench
Der Autor baute zuvor GovBench, einen Multiple-Choice-Benchmark mit 3.497 Fragen zu britischer Gesetzgebung und parlamentarischen Verfahren. Die Ergebnisse waren nahezu perfekt: Gemma 3 27B erreichte 94 %, GPT-5 99,26 %. Aber das maß Erinnerung, nicht Denkvermögen. Ein Modell, das die richtige Option zu parlamentarischen Verfahren auswählt, kann nicht unbedingt in der Praxis parlamentarische Verfahren navigieren.
Warum Civilization VI
Mit über 500 Stunden im Spiel wählte der Autor Civilization VI, weil seine Komplexität aus interagierenden Systemen entsteht. Bis zur Mitte des Spiels wird der Entscheidungsraum auf 10166 mögliche Aktionen pro Zug geschätzt. Sechs Siegtypen (Wissenschaft, Kultur, Domination, Religion, Diplomatie, Punkte) bedeuten, dass keine einzelne Strategie dominiert; ein Agent muss entscheiden, welches Spiel er überhaupt spielt. Das spiegelt politische Entscheidungsfindung wider: Entscheidungen mit Konsequenzen, die sich über Jahrzehnte durch unmodellierbare Variablen ziehen.
Bau des MCP-Servers
Der Autor fand einen Debug-Port in der Civ VI-Engine und verwandelte ihn über ein Wochenende in einen MCP-Server mit 76 Tools. Claude Code fungierte sowohl als Co-Entwickler als auch als Testspieler. Die KI sieht den Spielstand nur als Text – zum Beispiel:
Runde 150/330 | Polen (Jadwiga) | 12 Städte | 357 Wissenschaft/Runde | 412 Kultur/Runde
Sie ruft Tool-Endpunkte auf, um Aktionen auszuführen: select_production, move_unit, declare_war, propose_trade. Keine Grafiken, keine Minikarte, keine Benachrichtigungsbanner – rein über die gleiche Schnittstelle, die zum Abfragen einer Datenbank oder zum Schreiben von Code verwendet wird.
Die Bombe, die um den Benchmark hallte
In einem Durchlauf baute der Agent ein dominantes Handelsnetzwerk auf, verbündete sich mit allen Grenzen und war auf dem Weg zu einem diplomatischen Sieg. Er übersah, wie französischer Kulturdruck in seine Städte einsickerte. Als er die Bedrohung erkannte – tief verwurzelter Tourismus – half kein friedlicher Gegenzug. Er baute zwei Atomwaffen und bombte Toulouse in Runde 305. Frankreich gewann trotzdem (über einen anderen Siegweg).
Was CivBench misst, was Benchmarks nicht messen
Die entscheidende Erkenntnis: Strategisches Denken erfordert, ein Ziel über Hunderte von Entscheidungen hinweg zu halten, zu bemerken, wenn sich das Spiel geändert hat, und die Strategie entsprechend zu ändern. CivBench operationalisiert dies über ein Hexfeld, vier Frontier-Modelle und eine Atomwaffe – nicht über Multiple-Choice-Fragen.
📖 Vollständige Quelle lesen: HN AI Agents
👀 Siehe auch

Rust-Projekt-Perspektiven zu KI: Praktische Einblicke von Mitwirkenden
Ein Zusammenfassungsdokument sammelt Perspektiven von Rust-Mitwirkenden zur Nutzung von KI-Tools und hebt hervor, dass eine effektive KI-Integration sorgfältiges Engineering erfordert. Es zeigt konkrete Anwendungsfälle wie die Navigation in Codebasen, Unterstützung bei Code-Reviews und die Verarbeitung halbstrukturierter Daten.

Anthropic teilt die Fernsteuerung von Agenten in Dispatch und Remote Control auf, wobei Zuverlässigkeitsprobleme bestehen
Anthropic hat die Kernfähigkeit von OpenClaw als zwei separate Produkte umgesetzt: Dispatch für Cowork-Nutzer und Remote Control für Claude Code-Entwickler. Beide leiden unter Zuverlässigkeitsproblemen, einschließlich Mobilfunkverbindungsabbrüchen nach etwa 10 Stunden.

Entwickler wechselt zu Minimax 2.7 nach Claude-Sperre und MiMo-Guthabenproblemen
Ein Entwickler testete mehrere KI-Modelle für OpenClaw, nachdem Claude gesperrt wurde, und stellte fest, dass GLM 5.1 und 5 Turbo für agentische Aufgaben unbrauchbar sind, MiMo V2 Pros Guthabensystem ineffizient ist, und entschied sich schließlich für Minimax 2.7 aufgrund seines großzügigen Kontingents und seiner Fähigkeit, Automatisierungsaufgaben zu bewältigen.

Mistral-CEO warnt: Europa hat ein Zwei-Jahres-Fenster, um Abhängigkeit von US-KI-Infrastruktur zu vermeiden
Mistral-CEO Arthur Mensch warnt, Europa habe zwei Jahre Zeit, um eigene KI-Infrastruktur aufzubauen – Chips, Energie, Rechenleistung –, oder riskiere, dauerhaft ein 'Vasallenstaat' der US-Tech-Giganten zu werden.