CivBench: Тестирование стратегического мышления ИИ с помощью Civilization VI — Агент сбросил ядерную бомбу на Тулузу после поражения в культурной войне

ИИ-агент, игравший в Civilization VI, построил два ядерных устройства и сравнял с землей Тулузу, поняв, что вот-вот проиграет культурную победу Франции. Эксперимент, задокументированный исследователем правительственного ИИ, предлагает новый бенчмарк для стратегического мышления под названием CivBench — он проверяет, способны ли модели поддерживать план на протяжении сотен решений и адаптироваться, когда мир меняется.
Проблема с GovBench
Автор ранее создал GovBench — бенчмарк из 3497 вопросов с множественным выбором по законодательству Великобритании и парламентской процедуре. Результаты были почти идеальными: Gemma 3 27B набрала 94%, GPT-5 — 99.26%. Но это измеряло память, а не мышление. Модель, выбирающая правильный ответ о парламентской процедуре, не обязательно сможет ориентироваться в ней на практике.
Почему Civilization VI
Проведя в игре более 500 часов, автор выбрал Civilization VI, потому что ее сложность возникает из взаимодействия систем. К середине игры пространство решений оценивается в 10166 возможных действий за ход. Шесть типов побед (наука, культура, доминирование, религия, дипломатия, очки) означают, что ни одна стратегия не доминирует; агент должен решить, в какую игру он вообще играет. Это отражает политику: решения с последствиями, которые каскадно распространяются на десятилетия через немоделируемые переменные.
Создание MCP-сервера
Автор нашел отладочный порт в движке Civ VI и за выходные превратил его в MCP-сервер с 76 инструментами. Claude Code выступил и соразработчиком, и тестировщиком. ИИ видит состояние игры только как текст — например:
Ход 150/330 | Польша (Ядвига) | 12 городов | 357 науки/ход | 412 культуры/ход
Он вызывает конечные точки инструментов для действий: select_production, move_unit, declare_war, propose_trade. Никакой графики, мини-карты или баннеров уведомлений — только через тот же интерфейс, который используется для запросов к базе данных или написания кода.
Ядерный взрыв, услышанный на бенчмарке
В одном запуске агент построил доминирующую торговую сеть, заключил союзы со всеми соседями и был на пути к дипломатической победе. Он не заметил, как французское культурное давление проникло в его города. К тому времени, когда он осознал угрозу — туризм глубоко укоренился, — мирные контрмеры не сработали. Он построил два ядерных устройства и сбросил бомбу на Тулузу на 305-м ходу. Франция все равно победила (другим путем).
Что CivBench измеряет такого, чего не измеряют другие бенчмарки
Ключевой вывод: стратегическое мышление требует удержания цели на протяжении сотен решений, замечания изменений в игре и соответствующей корректировки стратегии. CivBench реализует это через гексагональную сетку, четыре граничные модели и ядерное оружие — а не вопросы с множественным выбором.
📖 Читать полный источник: HN AI Agents
👀 Смотрите также

Firefox 148 добавляет выключатель ИИ и расширенные настройки приватности.
Firefox 148 представляет функцию «выключателя ИИ», которая позволяет пользователям отключать все функции искусственного интеллекта, включая подсказки чат-бота и сводки ссылок, созданные ИИ. Обновление также предоставляет больше контроля над удалёнными обновлениями и сбором данных.

Claude Code v2.1.200: Ключевые исправления и изменения режима разрешений
Claude Code v2.1.200 меняет диалоги AskUserQuestion, чтобы они больше не продолжались автоматически, переключает режим разрешений по умолчанию на Manual, а также исправляет сбои фоновых агентов и повреждение списка задач.

Опус 4.6: Расширенное мышление демонстрирует худшие результаты в задачах с физическими диаграммами.
Тестирование показывает, что Claude Opus 4.6 с расширенным мышлением последовательно не справляется с физическими задачами, требующими интерпретации визуальных диаграмм, в то время как Gemini 3.1 Pro успешно их решает. Отключение расширенного мышления позволяет Opus 4.6 правильно и быстрее решать те же задачи.

NVIDIA анонсирует NemoClaw с функциями безопасности OpenShell.
NVIDIA анонсировала NemoClaw на GTC, развивая OpenClaw для добавления корпоративной безопасности через OpenShell, который обеспечивает политики конфиденциальности и защитные механизмы для ИИ-агентов.