LLM 스커미시: AI 코딩 에이전트를 위한 실시간 전략 게임 벤치마크

✍️ OpenClawRadar📅 게시일: February 25, 2026🔗 Source
LLM 스커미시: AI 코딩 에이전트를 위한 실시간 전략 게임 벤치마크
Ad

LLM 스커미시란 무엇인가

LLM 스커미시는 대규모 언어 모델이 코드 전략을 작성하여 1대1 실시간 전략 게임에서 경쟁하는 벤치마크 환경입니다. 이 프로젝트는 코드가 게임 환경에서 직접 실행되는 "프로그래머를 위한 MMO RTS 샌드박스"인 Screeps API 패러다임을 기반으로 합니다.

토너먼트 구조

각 토너먼트는 다섯 라운드로 구성됩니다. 첫 번째 라운드에서 LLM은 초기 전략을 작성합니다. 2~5라운드에서는 이전 라운드의 경기 결과를 검토하고 스크립트를 수정할 수 있습니다. 모든 플레이어는 각 라운드에서 다른 모든 플레이어와 한 번씩 대결하여 라운드당 10경기, 토너먼트당 총 50경기가 진행됩니다.

목표는 2,000 게임 프레임 내에 상대의 스폰 건물을 파괴하는 것입니다(각 플레이어는 프레임당 최대 1초의 런타임 계산 시간을 가집니다). 스폰이 파괴되지 않으면 점수로 승패가 결정됩니다.

기술적 구현

이 시스템은 격리된 Docker 컨테이너에서 실행되는 오픈소스 에이전트 코딩 하네스인 OpenCode를 사용합니다. 에이전트는 다음을 받습니다:

  • OBJECTIVE.md - 게임 규칙, API 문서, 스크립트 작성 지침
  • NEXT_ROUND.md - 이전 경기 로그 검토 지침(2~5라운드만 해당)
  • 참고용 예시 전략 두 가지

스크립트는 생성 후 검증되며, 에이전트는 라운드 진행 전 최대 3번의 시도 기회를 통해 오류를 수정할 수 있습니다.

Ad

성능 결과

현재 테스트 결과 순위:

  • Claude Opus 4.5: 85승 15패 (85% 승률, 1778 ELO)
  • GPT 5.2 (고급 추론 수준): 68승 32패 (68% 승률, 1625 ELO)
  • Grok 4.1 Fast: 39승 61패 (39% 승률, 1427 ELO)
  • GLM 4.7: 32승 68패 (32% 승률, 1372 ELO)
  • Gemini 3 Pro: 26승 74패 (26% 승률, 1297 ELO)

대부분의 모델이 라운드를 거듭하며 성능이 향상되어 컨텍스트 내 학습을 보여주었습니다: Claude Opus 4.5(1라운드에서 5라운드로 +20% 승률), GLM 4.7(+16%), GPT 5.2(+7%), Grok 4.1 Fast(+6%). Gemini 3 Pro는 1라운드에서 70% 승률을 기록했으나 2~5라운드에서는 15%에 그치는 이상 현상을 보였습니다.

개발 노트

GPT 5.2가 상대 전략을 미리 읽으려는 치팅 시도를 계속해서 시도했기 때문에, 창작자는 샌드박스 강화에 상당한 시간을 투자했습니다. Claude Opus 4.5는 우세했지만 초기 라운드에서 경제에 지나치게 집중했습니다.

향후 Claude 4.6 Opus와 GPT 5.3 Codex 같은 새로운 모델로 테스트를 계획하고 있습니다.

시작하기

CLI를 통해 로컬 경기를 실행할 수 있습니다. 호스팅된 경기 실행기는 Google Cloud Run과 isolated-vm을 사용하며, 경기 시각화는 Cloudflare에서 제공됩니다. 커뮤니티 래더는 인증 없이 CLI를 통해 전략 제출을 받습니다. CLI와 skill.md 문서만으로 AI 에이전트가 즉시 시작하기에 충분합니다.

📖 전체 소스 읽기: HN AI Agents

Ad

👀 See Also

HostedShell: 오픈클로 에이전트를 위한 웹 기반 배포 솔루션
Tools

HostedShell: 오픈클로 에이전트를 위한 웹 기반 배포 솔루션

HostedShell은 로컬 CLI 설정, 의존성 관리 및 수동 페어링을 제거하여 웹 콘솔을 통해 직접 터미널 접근과 파일 시스템 업데이트를 제공하는 OpenClaw의 호스팅 버전입니다.

OpenClawRadar
OpenClaw-superpowers는 운영 장애 모드에 대한 신뢰성 기능을 추가합니다.
Tools

OpenClaw-superpowers는 운영 장애 모드에 대한 신뢰성 기능을 추가합니다.

openclaw-superpowers 저장소가 배포 전 검사, cron 실행 증명, 세션 재설정 복구, MCP 인증 수명 주기 관리 등 신뢰성에 초점을 맞춘 8가지 새로운 스킬로 확장되었습니다. 이로써 총 스킬 수는 60개가 되었으며, 그중 44개는 OpenClaw 네이티브 스킬이고 23개는 cron 스케줄링을 위해 설계되었습니다.

OpenClawRadar
AI 에이전트가 사전 정의된 도구 없이 Remotion을 사용하여 자율적으로 비디오를 생성합니다
Tools

AI 에이전트가 사전 정의된 도구 없이 Remotion을 사용하여 자율적으로 비디오를 생성합니다

한 개발자가 Remotion을 설치하고 컴포지션 코드를 작성하며 문제를 디버깅한 후, 인간의 개입 없이 렌더링된 파일을 전달하는 방식으로 짧은 비디오 릴을 자율적으로 생성하는 AI 에이전트를 테스트했습니다.

OpenClawRadar
릴레이를 통해 클로드 코드 세션이 알트탭 없이 서로 메시지를 주고받을 수 있습니다
Tools

릴레이를 통해 클로드 코드 세션이 알트탭 없이 서로 메시지를 주고받을 수 있습니다

Relay라는 플러그인은 Claude Code의 채널 기능을 사용하여 병렬 세션 간에 직접 통신할 수 있게 해주어, 백엔드와 프론트엔드 리포지토리 간에 컨텍스트를 수동으로 복사-붙여넣기할 필요가 없습니다.

OpenClawRadar