Testen von Claude Sonnet mit einem Strategiespiel: Herausforderungen bei der Regelbefolgung

Strategiespiele mit Claude Sonnet testen
Ein Entwickler auf r/ClaudeAI testete Claude Sonnet, indem er OFMOS® Essential spielte, ein patentiertes Strategiespiel, bei dem Spieler ein Produktportfolio auf einer Positionierungskarte verwalten. Der Test bestand darin, das Spiel manuell gegen das Modell zu spielen, Prompt für Prompt.
Implementierungsdetails
Der Entwickler entwarf ein strukturiertes System-Prompt, das enthielt:
- Das vollständige Regelwerk von OFMOS® Essential
- Eine textbasierte Brettdarstellung
- Aktionsdefinitionen
- Punktierungsanweisungen
- Zugverwaltungsanweisungen
Nach jedem Zug aktualisierte Claude den Brettstatus und die laufenden Punktestände basierend auf dem strukturierten Prompt-System.
Leistungsbewertung
Claude Sonnet zeigte mehrere Fähigkeiten:
- Verstand die Spielregeln korrekt
- Formulierte strategische Überlegungen während des Spiels
- Verfolgte die Punktestände konsequent während des gesamten Spiels
Das Modell machte jedoch häufig illegale Züge. Der Entwickler merkte an, dass dieses Verhalten erwartet wurde, da dem System eine eingeschränkte Zuggenerierungsschicht fehlte, was erforderte, dass das Modell die Regeln selbst durchsetzte – eine Aufgabe, bei der es oft versagte.
Fragen des Entwicklers
Der Entwickler sucht nach Community-Input zu ähnlichen Experimenten mit Brett- oder Strategiespielen und fragt speziell nach:
- Erfahrungen mit Regelbefolgung in verschiedenen Modellen
- Beobachtungen zur strategischen Tiefe im KI-Spiel
- Welche Modelle in ähnlichen Szenarien am besten abschnitten
Diese Art von Tests ist nützlich für Entwickler, die mit KI-Codierungsagenten arbeiten, um die praktischen Grenzen von Sprachmodellen in regelbasierten Umgebungen zu verstehen, in denen präzise Einschränkungsdurchsetzung erforderlich ist.
📖 Read the full source: r/ClaudeAI
👀 Siehe auch

Verwendung von Claude als Kreativdirektor in einem Sticker-Erstellungsprozess
Ein Entwickler baute eine Sticker-App, bei der Claude hochgeladene Benutzerfotos analysiert, neun Sticker-Konzepte generiert und detaillierte Prompts für Bildmodelle schreibt, was zu personalisierten statt generischen Stickern führt.

OpenClaw Agent Voice Call Demo mit Streaming TTS und Barge-in
Ein Entwickler hat seinen OpenClaw-Agenten demonstriert, der tatsächlich Telefonanrufe über Telegram tätigt. Dabei nutzt er Streaming-Text-to-Speech, der Satz für Satz antwortet und Barge-in für natürliche Gespräche unterstützt.

OpenClaw Agent automatisiert die gesamte Videoproduktionspipeline mit Remotion und Hyperframes
Ein Benutzer hat einen Agenten auf OpenClaw erstellt, der Dateisysteme verwaltet, Bilder generiert, animiert, Geschichten recherchiert und komplette Videos mit Remotion und Hyperframes erstellt – alles automatisiert und wiederholbar.

Autonomer Claude Code Loop betreibt Open-Source-GymCoach rund um die Uhr – Triage, Code, Merges
Ein Entwickler lässt Claude Code eine Open-Source-Fitness-App autonom betreiben: Issues triagieren, PRs implementieren, Green-Gate-Prüfungen bestehen, mergen und dokumentieren – alles ohne menschliches Eingreifen.