CivBench : Tester le raisonnement stratégique de l’IA avec Civilization VI — Un agent a atomisé Toulouse après avoir perdu la guerre culturelle

Un agent IA jouant à Civilization VI a construit deux engins nucléaires et rasé Toulouse après avoir réalisé qu'il allait perdre une victoire culturelle face à la France. L'expérience, documentée par un chercheur en IA gouvernemental, propose un nouveau benchmark pour le raisonnement stratégique appelé CivBench — qui teste si les modèles peuvent maintenir un plan sur des centaines de décisions et s'adapter lorsque le monde change.
Le problème de GovBench
L'auteur a précédemment développé GovBench, un benchmark à choix multiples de 3 497 questions sur la législation et la procédure parlementaire britanniques. Les résultats étaient quasi parfaits : Gemma 3 27B a obtenu 94 %, GPT-5 99,26 %. Mais cela mesurait la mémorisation, pas le raisonnement. Un modèle qui choisit la bonne option sur la procédure parlementaire ne peut pas nécessairement naviguer dans la procédure parlementaire en pratique.
Pourquoi Civilization VI
Avec plus de 500 heures de jeu, l'auteur a choisi Civilization VI car sa complexité émerge de systèmes interactifs. Au milieu du jeu, l'espace de décision est estimé à 10166 actions possibles par tour. Six types de victoire (scientifique, culturelle, domination, religieuse, diplomatique, score) signifient qu'aucune stratégie unique ne domine ; un agent doit décider à quel jeu il joue. Cela reflète l'élaboration de politiques : des décisions aux conséquences qui s'étendent sur des décennies à travers des variables non modélisables.
Construction du serveur MCP
L'auteur a trouvé un port de débogage dans le moteur de Civ VI et l'a transformé en un serveur MCP avec 76 outils en un week-end. Claude Code a servi à la fois de co-développeur et de testeur. L'IA voit l'état du jeu uniquement sous forme de texte — par exemple :
Tour 150/330 | Pologne (Jadwiga) | 12 villes | 357 science/tour | 412 culture/tour
Elle appelle des points d'extrémité pour agir : select_production, move_unit, declare_war, propose_trade. Pas de visuels, pas de mini-carte, pas de bannières de notification — uniquement via la même interface utilisée pour interroger une base de données ou écrire du code.
La bombe qui a secoué le benchmark
Dans une partie, l'agent a construit un réseau commercial dominant, s'est allié à toutes les frontières, et était en voie de victoire diplomatique. Il n'a pas remarqué la pression culturelle française s'infiltrer dans ses villes. Le temps de reconnaître la menace — le tourisme profondément ancré — aucune contre-mesure pacifique n'a fonctionné. Il a construit deux engins nucléaires et a bombardé Toulouse au tour 305. La France a quand même gagné (via une autre voie de victoire).
Ce que CivBench mesure et que les benchmarks ne mesurent pas
Le point clé : le raisonnement stratégique nécessite de maintenir un objectif sur des centaines de décisions, de remarquer quand le jeu a changé, et d'adapter sa stratégie en conséquence. CivBench opérationnalise cela via une grille hexagonale, quatre modèles de pointe, et une arme nucléaire — pas des questions à choix multiples.
📖 Lire la source complète : HN AI Agents
👀 See Also

ClawCast Ép.3 : Refonte de l’intégration, démo annulée et OpenClaw contre Codex pour les workflows à long terme
L'épisode 3 du ClawCast couvre la refonte de l'intégration d'OpenClaw, l'annulation de la démo, les leçons du système d'auto-amélioration d'Hermès, et la comparaison entre OpenClaw et Codex pour les tâches autonomes de longue durée.

Anthropic sépare les abonnements à Claude de l'utilisation des outils tiers
Anthropic met fin à la couverture des abonnements Claude Pro/Team pour l'utilisation via OpenClaw à partir du 4 avril, exigeant une facturation séparée à l'usage pour les interfaces tierces. Les utilisateurs doivent activer l'option 'usage supplémentaire' dans les paramètres de leur compte pour continuer à utiliser Claude via OpenClaw.

Le modèle d'IA Claude Mythos d'Anthropic révélé dans une fuite de données, décrit comme un "changement d'étape" dans les capacités
Anthropic teste un nouveau modèle d'IA appelé Claude Mythos (également désigné sous le nom de Capybara) qui représente un 'changement d'étape' en termes de performances, avec des scores nettement supérieurs sur les tests de codage logiciel, de raisonnement académique et de cybersécurité par rapport à Claude Opus 4.6. L'existence du modèle a été révélée par une fuite de données provenant d'un cache de données non sécurisé et accessible au public, contenant environ 3 000 ressources non publiées.

La communauté de ClawbBot discute des améliorations potentielles de l'interface
La communauté ClawbBot explore activement des idées pour améliorer son interface, en se concentrant sur l'amélioration de l'expérience utilisateur et de la fonctionnalité. La discussion suscite des innovations prometteuses dans le domaine des agents de codage IA.