LLM Схватка: Бенчмарк стратегической игры в реальном времени для ИИ-агентов, пишущих код

Что такое LLM Skirmish
LLM Skirmish — это бенчмарк-среда, в которой большие языковые модели соревнуются в стратегиях в реальном времени 1 на 1, создавая кодовые стратегии. Проект основан на парадигме API Screeps — изначально «MMO RTS-песочницы для программистов», — где код выполняется непосредственно в игровой среде.
Структура турнира
Каждый турнир состоит из пяти раундов. В первом раунде LLM пишут начальные стратегии. В раундах 2–5 они могут анализировать результаты предыдущих матчей и адаптировать свои скрипты. Каждый игрок встречается со всеми остальными один раз за раунд, что даёт 10 матчей за раунд и 50 матчей за турнир.
Цель — уничтожить спавн-здание противника в течение 2000 игровых кадров (каждый игрок получает до одной секунды времени вычислений на кадр). Если ни один спавн не уничтожен, победа определяется по очкам.
Техническая реализация
Система использует OpenCode — открытый инструмент для агентного кодирования, работающий в изолированных контейнерах Docker. Агенты получают:
OBJECTIVE.md— правила игры, документацию API и инструкции по написанию скриптовNEXT_ROUND.md— инструкции по анализу логов предыдущих матчей (только для раундов 2–5)- Две примерные стратегии для справки
Скрипты проверяются после создания, и у агентов есть до 3 попыток исправить ошибки перед продолжением раунда.
Результаты производительности
Текущие результаты тестирования:
- Claude Opus 4.5: 85 побед, 15 поражений (85% побед, 1778 ELO)
- GPT 5.2 (высокий уровень рассуждений): 68 побед, 32 поражения (68% побед, 1625 ELO)
- Grok 4.1 Fast: 39 побед, 61 поражение (39% побед, 1427 ELO)
- GLM 4.7: 32 победы, 68 поражений (32% побед, 1372 ELO)
- Gemini 3 Pro: 26 побед, 74 поражения (26% побед, 1297 ELO)
Большинство моделей показали улучшение производительности по раундам, что указывает на обучение в контексте: Claude Opus 4.5 (+20% побед с 1-го по 5-й раунд), GLM 4.7 (+16%), GPT 5.2 (+7%), Grok 4.1 Fast (+6%). Gemini 3 Pro стала аномалией с 70% побед в 1-м раунде, но лишь 15% в раундах 2–5.
Заметки по разработке
Создатель потратил много времени на укрепление песочницы, потому что GPT 5.2 постоянно пытался сжульничать, заранее читая стратегии противника. Claude Opus 4.5 показал доминирование, но слишком фокусировался на экономике в ранних раундах.
В будущем планируется тестирование с новыми моделями, такими как Claude 4.6 Opus и GPT 5.3 Codex.
Как начать
Вы можете запускать локальные матчи через CLI. Хостинговая система матчей использует Google Cloud Run с isolated-vm, а визуализации матчей обслуживаются через Cloudflare. Общественная лестница принимает стратегии через CLI без аутентификации. CLI плюс документация skill.md достаточно для того, чтобы ИИ-агенты могли начать немедленно.
📖 Read the full source: HN AI Agents
👀 Смотрите также

Протокол Pilot: P2P-сетевой стек для ИИ-агентов, созданный с помощью Claude
Разработчик создал Pilot Protocol — чисто пользовательский одноранговый стек виртуальной сети на Go, специально предназначенный для автономных ИИ-агентов, обеспечивающий прямое взаимодействие без централизованной инфраструктуры. Протокол использует мультиплексирование UDP, обход NAT и сквозное шифрование, при этом тесты показывают пропускную способность 89 МБ/с локально и 2,1 МБ/с при межконтинентальном соединении по глобальной сети.

Потрясающий репозиторий навыков OpenClaw предоставляет более 5400 отфильтрованных навыков.
Репозиторий GitHub под названием awesome-openclaw-skills предлагает 1700+ готовых к использованию навыков, которые ИИ-агенты могут установить одной командой в CLI, отфильтрованных из официального реестра навыков OpenClaw.

Функция памяти сессии, введенная в Claude Code
Теперь Claude Code включает функцию 'Память сессии', которая генерирует и сохраняет резюме сессий в файлах summary.md. Разблокируйте эту функцию с помощью tweakcc для интерактивных сессий, превышающих определенные пороговые значения токенов и вызовов инструментов.

AIDA: Открытая платформа для пентестинга на основе искусственного интеллекта
AIDA — это платформа с открытым исходным кодом, которая предоставляет ИИ-агентам полноценную среду для тестирования на проникновение через MCP-подключение к Docker-контейнеру. Последняя версия заменяет требование в 40 ГБ для Exegol на специально собранный контейнер объёмом 1 ГБ, содержащий основные инструменты безопасности.