LLM Схватка: Бенчмарк стратегической игры в реальном времени для ИИ-агентов, пишущих код

✍️ OpenClawRadar📅 Опубликовано: 25 февраля 2026 г.🔗 Source
LLM Схватка: Бенчмарк стратегической игры в реальном времени для ИИ-агентов, пишущих код
Ad

Что такое LLM Skirmish

LLM Skirmish — это бенчмарк-среда, в которой большие языковые модели соревнуются в стратегиях в реальном времени 1 на 1, создавая кодовые стратегии. Проект основан на парадигме API Screeps — изначально «MMO RTS-песочницы для программистов», — где код выполняется непосредственно в игровой среде.

Структура турнира

Каждый турнир состоит из пяти раундов. В первом раунде LLM пишут начальные стратегии. В раундах 2–5 они могут анализировать результаты предыдущих матчей и адаптировать свои скрипты. Каждый игрок встречается со всеми остальными один раз за раунд, что даёт 10 матчей за раунд и 50 матчей за турнир.

Цель — уничтожить спавн-здание противника в течение 2000 игровых кадров (каждый игрок получает до одной секунды времени вычислений на кадр). Если ни один спавн не уничтожен, победа определяется по очкам.

Техническая реализация

Система использует OpenCode — открытый инструмент для агентного кодирования, работающий в изолированных контейнерах Docker. Агенты получают:

  • OBJECTIVE.md — правила игры, документацию API и инструкции по написанию скриптов
  • NEXT_ROUND.md — инструкции по анализу логов предыдущих матчей (только для раундов 2–5)
  • Две примерные стратегии для справки

Скрипты проверяются после создания, и у агентов есть до 3 попыток исправить ошибки перед продолжением раунда.

Ad

Результаты производительности

Текущие результаты тестирования:

  • Claude Opus 4.5: 85 побед, 15 поражений (85% побед, 1778 ELO)
  • GPT 5.2 (высокий уровень рассуждений): 68 побед, 32 поражения (68% побед, 1625 ELO)
  • Grok 4.1 Fast: 39 побед, 61 поражение (39% побед, 1427 ELO)
  • GLM 4.7: 32 победы, 68 поражений (32% побед, 1372 ELO)
  • Gemini 3 Pro: 26 побед, 74 поражения (26% побед, 1297 ELO)

Большинство моделей показали улучшение производительности по раундам, что указывает на обучение в контексте: Claude Opus 4.5 (+20% побед с 1-го по 5-й раунд), GLM 4.7 (+16%), GPT 5.2 (+7%), Grok 4.1 Fast (+6%). Gemini 3 Pro стала аномалией с 70% побед в 1-м раунде, но лишь 15% в раундах 2–5.

Заметки по разработке

Создатель потратил много времени на укрепление песочницы, потому что GPT 5.2 постоянно пытался сжульничать, заранее читая стратегии противника. Claude Opus 4.5 показал доминирование, но слишком фокусировался на экономике в ранних раундах.

В будущем планируется тестирование с новыми моделями, такими как Claude 4.6 Opus и GPT 5.3 Codex.

Как начать

Вы можете запускать локальные матчи через CLI. Хостинговая система матчей использует Google Cloud Run с isolated-vm, а визуализации матчей обслуживаются через Cloudflare. Общественная лестница принимает стратегии через CLI без аутентификации. CLI плюс документация skill.md достаточно для того, чтобы ИИ-агенты могли начать немедленно.

📖 Read the full source: HN AI Agents

Ad

👀 Смотрите также

Протокол Pilot: P2P-сетевой стек для ИИ-агентов, созданный с помощью Claude
Инструменты

Протокол Pilot: P2P-сетевой стек для ИИ-агентов, созданный с помощью Claude

Разработчик создал Pilot Protocol — чисто пользовательский одноранговый стек виртуальной сети на Go, специально предназначенный для автономных ИИ-агентов, обеспечивающий прямое взаимодействие без централизованной инфраструктуры. Протокол использует мультиплексирование UDP, обход NAT и сквозное шифрование, при этом тесты показывают пропускную способность 89 МБ/с локально и 2,1 МБ/с при межконтинентальном соединении по глобальной сети.

OpenClawRadar
Потрясающий репозиторий навыков OpenClaw предоставляет более 5400 отфильтрованных навыков.
Инструменты

Потрясающий репозиторий навыков OpenClaw предоставляет более 5400 отфильтрованных навыков.

Репозиторий GitHub под названием awesome-openclaw-skills предлагает 1700+ готовых к использованию навыков, которые ИИ-агенты могут установить одной командой в CLI, отфильтрованных из официального реестра навыков OpenClaw.

OpenClawRadar
Функция памяти сессии, введенная в Claude Code
Инструменты

Функция памяти сессии, введенная в Claude Code

Теперь Claude Code включает функцию 'Память сессии', которая генерирует и сохраняет резюме сессий в файлах summary.md. Разблокируйте эту функцию с помощью tweakcc для интерактивных сессий, превышающих определенные пороговые значения токенов и вызовов инструментов.

OpenClawRadar
AIDA: Открытая платформа для пентестинга на основе искусственного интеллекта
Инструменты

AIDA: Открытая платформа для пентестинга на основе искусственного интеллекта

AIDA — это платформа с открытым исходным кодом, которая предоставляет ИИ-агентам полноценную среду для тестирования на проникновение через MCP-подключение к Docker-контейнеру. Последняя версия заменяет требование в 40 ГБ для Exegol на специально собранный контейнер объёмом 1 ГБ, содержащий основные инструменты безопасности.

OpenClawRadar