CivBench: Тестирование стратегического мышления ИИ с помощью Civilization VI — Агент сбросил ядерную бомбу на Тулузу после поражения в культурной войне

✍️ OpenClawRadar📅 Опубликовано: 22 июня 2026 г.🔗 Source
CivBench: Тестирование стратегического мышления ИИ с помощью Civilization VI — Агент сбросил ядерную бомбу на Тулузу после поражения в культурной войне
Ad

ИИ-агент, игравший в Civilization VI, построил два ядерных устройства и сравнял с землей Тулузу, поняв, что вот-вот проиграет культурную победу Франции. Эксперимент, задокументированный исследователем правительственного ИИ, предлагает новый бенчмарк для стратегического мышления под названием CivBench — он проверяет, способны ли модели поддерживать план на протяжении сотен решений и адаптироваться, когда мир меняется.

Проблема с GovBench

Автор ранее создал GovBench — бенчмарк из 3497 вопросов с множественным выбором по законодательству Великобритании и парламентской процедуре. Результаты были почти идеальными: Gemma 3 27B набрала 94%, GPT-5 — 99.26%. Но это измеряло память, а не мышление. Модель, выбирающая правильный ответ о парламентской процедуре, не обязательно сможет ориентироваться в ней на практике.

Почему Civilization VI

Проведя в игре более 500 часов, автор выбрал Civilization VI, потому что ее сложность возникает из взаимодействия систем. К середине игры пространство решений оценивается в 10166 возможных действий за ход. Шесть типов побед (наука, культура, доминирование, религия, дипломатия, очки) означают, что ни одна стратегия не доминирует; агент должен решить, в какую игру он вообще играет. Это отражает политику: решения с последствиями, которые каскадно распространяются на десятилетия через немоделируемые переменные.

Ad

Создание MCP-сервера

Автор нашел отладочный порт в движке Civ VI и за выходные превратил его в MCP-сервер с 76 инструментами. Claude Code выступил и соразработчиком, и тестировщиком. ИИ видит состояние игры только как текст — например:

Ход 150/330 | Польша (Ядвига) | 12 городов | 357 науки/ход | 412 культуры/ход

Он вызывает конечные точки инструментов для действий: select_production, move_unit, declare_war, propose_trade. Никакой графики, мини-карты или баннеров уведомлений — только через тот же интерфейс, который используется для запросов к базе данных или написания кода.

Ядерный взрыв, услышанный на бенчмарке

В одном запуске агент построил доминирующую торговую сеть, заключил союзы со всеми соседями и был на пути к дипломатической победе. Он не заметил, как французское культурное давление проникло в его города. К тому времени, когда он осознал угрозу — туризм глубоко укоренился, — мирные контрмеры не сработали. Он построил два ядерных устройства и сбросил бомбу на Тулузу на 305-м ходу. Франция все равно победила (другим путем).

Что CivBench измеряет такого, чего не измеряют другие бенчмарки

Ключевой вывод: стратегическое мышление требует удержания цели на протяжении сотен решений, замечания изменений в игре и соответствующей корректировки стратегии. CivBench реализует это через гексагональную сетку, четыре граничные модели и ядерное оружие — а не вопросы с множественным выбором.

📖 Читать полный источник: HN AI Agents

Ad

👀 Смотрите также

ИИ не удалил вашу базу данных — это сделали вы: ответственность в эпоху AI-агентов кодинга
Новости

ИИ не удалил вашу базу данных — это сделали вы: ответственность в эпоху AI-агентов кодинга

Вирусная история обвинила ИИ-агента в удалении производственной базы данных, но реальная проблема — в открытых деструктивных API-эндпоинтах и отсутствии процессов, а не в инструменте.

OpenClawRadar
Windows 11, обновление 2026 года: Перемещение панели задач, сокращение Copilot, улучшения в проводнике.
Новости

Windows 11, обновление 2026 года: Перемещение панели задач, сокращение Copilot, улучшения в проводнике.

Microsoft выпускает обновления Windows 11 в 2026 году, которые восстанавливают возможность перемещения панели задач, уменьшают беспорядок от Copilot в основных приложениях и улучшают производительность Проводника на основе отзывов пользователей.

OpenClawRadar
Claude-Code версии 2.1.80 добавляет мониторинг ограничений по частоте запросов, улучшения плагинов и оптимизацию памяти.
Новости

Claude-Code версии 2.1.80 добавляет мониторинг ограничений по частоте запросов, улучшения плагинов и оптимизацию памяти.

Версия Claude-Code v2.1.80 добавляет поле rate_limits для скриптов строки состояния для отображения использования Claude.ai, добавляет поддержку source: 'settings' для маркетплейса плагинов и сокращает использование памяти примерно на 80 МБ в больших репозиториях. В выпуске также исправлены восстановление параллельных результатов инструментов, сбои WebSocket и различные проблемы с интерфейсом.

OpenClawRadar
Pantheon-Reasoning-27B: Модель плотного рассуждения RP от Gryphe
Новости

Pantheon-Reasoning-27B: Модель плотного рассуждения RP от Gryphe

Gryphe выпускает Pantheon-Reasoning-27B — цензурированную доработку Qwen 3.6 27B с полными цепочками рассуждений для ролевых игр. Модель обучена на данных Pantheon, Opus-4.6-Reasoning-24k, WorldSim, текстовых квестов и общих RP-данных. Доступны квантизации GGUF.

OpenClawRadar