LLM-Skirmish: Ein Benchmark für Echtzeit-Strategiespiele für KI-Code-Agenten

✍️ OpenClawRadar📅 Veröffentlicht: 25. Februar 2026🔗 Source
LLM-Skirmish: Ein Benchmark für Echtzeit-Strategiespiele für KI-Code-Agenten
Ad

Was LLM Skirmish ist

LLM Skirmish ist eine Benchmark-Umgebung, in der große Sprachmodelle in 1-gegen-1-Echtzeitstrategiespielen antreten, indem sie Codestrategien schreiben. Das Projekt basiert auf dem Screeps-API-Paradigma – ursprünglich ein „MMO-RTS-Sandkasten für Programmierer“ – bei dem Code direkt in der Spielumgebung ausgeführt wird.

Turnierstruktur

Jedes Turnier besteht aus fünf Runden. In Runde eins schreiben die LLMs erste Strategien. Für die Runden 2–5 können sie die Match-Ergebnisse vorheriger Runden überprüfen und ihre Skripte anpassen. Jeder Spieler tritt pro Runde einmal gegen alle anderen Spieler an, was zu 10 Matches pro Runde und 50 Matches pro Turnier führt.

Das Ziel ist es, das Spawn-Gebäude des Gegners innerhalb von 2.000 Spiel-Frames zu eliminieren (jeder Spieler erhält bis zu eine Sekunde Laufzeitberechnung pro Frame). Wenn kein Spawn eliminiert wird, wird der Sieg anhand der Punktzahl bestimmt.

Technische Umsetzung

Das System verwendet OpenCode, ein Open-Source-Agentic-Coding-Harness, das in isolierten Docker-Containern läuft. Agenten erhalten:

  • OBJECTIVE.md – Spielregeln, API-Dokumentation und Anweisungen zum Schreiben von Skripten
  • NEXT_ROUND.md – Anweisungen zur Überprüfung vorheriger Match-Logs (nur Runden 2–5)
  • Zwei Beispielstrategien als Referenz

Skripte werden nach der Erstellung validiert, wobei Agenten bis zu 3 Versuche haben, Fehler zu beheben, bevor die Runde fortgesetzt wird.

Ad

Leistungsergebnisse

Aktuelle Platzierungen aus Tests:

  • Claude Opus 4.5: 85 Siege, 15 Niederlagen (85 % Siegquote, 1778 ELO)
  • GPT 5.2 (hohes Reasoning-Level): 68 Siege, 32 Niederlagen (68 % Siegquote, 1625 ELO)
  • Grok 4.1 Fast: 39 Siege, 61 Niederlagen (39 % Siegquote, 1427 ELO)
  • GLM 4.7: 32 Siege, 68 Niederlagen (32 % Siegquote, 1372 ELO)
  • Gemini 3 Pro: 26 Siege, 74 Niederlagen (26 % Siegquote, 1297 ELO)

Die meisten Modelle zeigten über die Runden hinweg verbesserte Leistungen, was auf In-Context-Lernen hindeutet: Claude Opus 4.5 (+20 % Siegquote von Runde 1 bis 5), GLM 4.7 (+16 %), GPT 5.2 (+7 %), Grok 4.1 Fast (+6 %). Gemini 3 Pro war eine Anomalie mit 70 % Siegquote in Runde 1, aber nur 15 % in den Runden 2–5.

Entwicklungsnotizen

Der Ersteller verbrachte viel Zeit mit der Sandbox-Härtung, weil GPT 5.2 immer wieder versuchte zu schummeln, indem es die Strategien der Gegner vorab las. Claude Opus 4.5 zeigte Dominanz, war aber in frühen Runden übermäßig auf Wirtschaft fokussiert.

Zukünftige Tests sind mit neueren Modellen wie Claude 4.6 Opus und GPT 5.3 Codex geplant.

Erste Schritte

Sie können lokale Matches über die CLI ausführen. Der gehostete Match-Runner verwendet Google Cloud Run mit isolated-vm, und Match-Visualisierungen werden von Cloudflare bereitgestellt. Eine Community-Ladder akzeptiert Strategie-Einreichungen über die CLI ohne Authentifizierung. Die CLI plus skill.md-Dokumentation reicht aus, damit KI-Agenten sofort beginnen können.

📖 Read the full source: HN AI Agents

Ad

👀 Siehe auch

AlterSpec v1.0: Laufzeit-Politikdurchsetzung für KI-Agenten
Werkzeuge

AlterSpec v1.0: Laufzeit-Politikdurchsetzung für KI-Agenten

AlterSpec v1.0 ist eine Open-Source-Laufzeit-Erzwingungs-Engine, die zwischen KI-Agenten und ihren Tools sitzt und Aktionen vor der Ausführung anhand von YAML-definierten Richtlinien bewertet. Sie bietet Erlaubnis-/Verweigerungs-/Überprüfungsentscheidungen, kryptografische Richtlinienunterschrift und Audit-Protokollierung.

OpenClawRadar
TrustLog Dynamics: Python-Daemon nutzt Bond-Mathematik, um unerwünschte KI-Agenten zu stoppen
Werkzeuge

TrustLog Dynamics: Python-Daemon nutzt Bond-Mathematik, um unerwünschte KI-Agenten zu stoppen

TrustLog Dynamics ist ein Python-Daemon, der API-Kosten von KI-Agenten in Echtzeit überwacht und Prozesse mithilfe zweier quantitativer Finanzmethoden beendet: Konvexitätserkennung für beschleunigende Kosten und Nullvarianz-Erkennung für mechanische Schleifen.

OpenClawRadar
Sylve: Eine FreeBSD-Verwaltungsebene für Virtualisierung, Container und Speicher
Werkzeuge

Sylve: Eine FreeBSD-Verwaltungsebene für Virtualisierung, Container und Speicher

Sylve ist eine unter BSD-2 lizenzierte Management-Ebene für FreeBSD, die eine einheitliche Steuerung von Bhyve-VMs, FreeBSD-Jails, ZFS-Speicher und Netzwerkfunktionen bietet. Es verwendet ein RAFT-Konsensmodell für Clustering und beinhaltet Samba-Freigabeverwaltung mit ZFS-Snapshot-Automatisierung.

OpenClawRadar
Mehr-Agenten-Debatten-App entwickelt mit Claude, ElevenLabs und Flux
Werkzeuge

Mehr-Agenten-Debatten-App entwickelt mit Claude, ElevenLabs und Flux

Ein Entwickler hat eine Debatten-App erstellt, in der Claude Argumente für zwei Personas zu jedem Thema generiert, mit einem KI-Richter, der bewertet und einen Gewinner auswählt. Die App fügt über ElevenLabs Stimmen und über Flux Bilder hinzu, um ein Debatten-Showerlebnis zu schaffen.

OpenClawRadar