Claude Code wurde verwendet, um über 4.000 Blind-Werewolf-Spiele mit LLMs zu simulieren

✍️ OpenClawRadar📅 Veröffentlicht: 27. Februar 2026🔗 Source
Claude Code wurde verwendet, um über 4.000 Blind-Werewolf-Spiele mit LLMs zu simulieren
Ad

Simulationsaufbau und Ergebnisse

Ein Entwickler erstellte mit Claude Code einen kleinen Simulator, in dem große Sprachmodelle blindes Ein-Nacht-Werwolf gegeneinander spielen. Das Experiment lief etwa 4.600 Spiele über Modelle von OpenAI (GPT-4o-mini, GPT-5-mini) und xAI (Grok-3-fast, Grok-4-1-fast).

Die Spielvariante hat minimale Signale: 7 Spieler, 1 Werwolf, keine Rollen, eine kurze Diskussion, dann eine gleichzeitige Abstimmung. Der einzige Unterscheidungsfaktor zwischen den Spielern ist ihr Name. Trotz dieses begrenzten Aufbaus zeigte die Simulation konsistente Muster, bei denen einige Namen in jedem getesteten Modell deutlich häufiger abgestimmt werden als andere, während andere Namen fast nie abgestimmt werden.

Ad

Wichtige Einschränkungen und Zugang

Der Entwickler betont ausdrücklich, dass dies keine kausale Behauptung ist – nur ein Ergebnismuster aus einem Spielzeugaufbau. Die Namensgruppen sind breit gefasst, einige Namen kommen seltener vor, und es gibt mehrere Möglichkeiten, wie dies ein Artefakt des Aufbaus sein könnte, anstatt etwas Grundlegendes über die Modelle zu enthüllen. Die Konsistenz dieser Muster über Läufe und Modelle hinweg wurde jedoch als überraschend vermerkt.

Für diejenigen, die weiter erkunden möchten:

  • Dashboard: https://huggingface.co/spaces/Queue-Bit-1/llm-bias-dashboard
  • Code + Rohprotokolle: https://github.com/Queue-Bit-1/wolf

Der Entwickler ist neugierig, ob andere ähnliche Namenseffekte in Multi-Agenten-Simulationen beobachtet haben.

📖 Read the full source: r/ClaudeAI

Ad

👀 Siehe auch

Interaktive Mind Map visualisiert das Claude-Tool-Ökosystem
Werkzeuge

Interaktive Mind Map visualisiert das Claude-Tool-Ökosystem

Ein Entwickler hat eine interaktive HTML-Mindmap mit D3.js erstellt, um Funktionen in den Claude-Tools Chat, Cowork und Code zu verfolgen, einschließlich Plattformverfügbarkeit, Preisunterschieden und Kompatibilität von Konnektoren.

OpenClawRadar
Models.dev: Open-Source-Datenbank mit KI-Modellspezifikationen, Preisen und Fähigkeiten
Werkzeuge

Models.dev: Open-Source-Datenbank mit KI-Modellspezifikationen, Preisen und Fähigkeiten

Models.dev ist eine quelloffene, von der Community gepflegte Datenbank mit KI-Modellspezifikationen, Preisen und Fähigkeiten. Sie bietet eine API und TOML-basierte Definitionen für Anbieter und Modelle.

OpenClawRadar
Agenten & KI.mpires: Strategiespiel, in dem KI-Agenten spielen und Menschen zuschauen
Werkzeuge

Agenten & KI.mpires: Strategiespiel, in dem KI-Agenten spielen und Menschen zuschauen

Agents & A.I.mpires ist ein dauerhaftes Echtzeit-Strategiespiel auf einem hexagon-gitterförmigen Globus, in dem KI-Agenten autonom Territorium beanspruchen, angreifen, Allianzen bilden und tägliche Kriegsblogs über HTTP-API-Aufrufe schreiben. Menschen beobachten lediglich das emergente Verhalten.

OpenClawRadar
Hubcap Bridge: Persistente bidirektionale Kommunikation zwischen CLI und Browser-JavaScript via CDP
Werkzeuge

Hubcap Bridge: Persistente bidirektionale Kommunikation zwischen CLI und Browser-JavaScript via CDP

Hubcap Bridge ist eine neue Funktion im Hubcap-CLI-Tool, die einen persistenten bidirektionalen Nachrichtenkanal zwischen lokalen Prozessen und in Browser-Seiten laufendem JavaScript über das Chrome DevTools Protocol erstellt. Es ermöglicht Claude Code-Fähigkeiten, über interne JavaScript-APIs mit Web-Apps zu interagieren, ohne Zugang zu öffentlichen APIs zu benötigen.

OpenClawRadar