Código de Claude Utilizado para Simular Más de 4,000 Juegos de Hombre Lobo Ciego con LLMs

✍️ OpenClawRadar📅 Publicado: 27 de febrero de 2026🔗 Source
Código de Claude Utilizado para Simular Más de 4,000 Juegos de Hombre Lobo Ciego con LLMs
Ad

Configuración y Resultados de la Simulación

Un desarrollador construyó un pequeño simulador usando Claude Code donde los grandes modelos de lenguaje juegan al Werewolf ciego de una noche entre sí. El experimento ejecutó aproximadamente 4,600 juegos en modelos de OpenAI (GPT-4o-mini, GPT-5-mini) y xAI (Grok-3-fast, Grok-4-1-fast).

La variante del juego tiene señales mínimas: 7 jugadores, 1 lobo, sin roles, una discusión breve y luego una votación simultánea. El único factor diferenciador entre los jugadores es su nombre. A pesar de esta configuración limitada, la simulación reveló patrones consistentes donde algunos nombres son votados para salir significativamente más a menudo que otros en cada modelo probado, mientras que otros nombres casi nunca son votados para salir.

Ad

Advertencias Importantes y Acceso

El desarrollador afirma explícitamente que esto no es una afirmación causal, solo un patrón de resultados de una configuración de juguete. Los grupos de nombres son amplios, algunos nombres aparecen con menos frecuencia, y hay múltiples formas en que esto podría ser un artefacto de la configuración en lugar de revelar algo fundamental sobre los modelos. Sin embargo, se señaló como sorprendente la consistencia de estos patrones en todas las ejecuciones y modelos.

Para aquellos interesados en explorar más:

  • Panel de control: https://huggingface.co/spaces/Queue-Bit-1/llm-bias-dashboard
  • Código + registros sin procesar: https://github.com/Queue-Bit-1/wolf

El desarrollador tiene curiosidad por saber si otros han observado efectos similares de nombres en simulaciones multiagente.

📖 Read the full source: r/ClaudeAI

Ad

👀 Ver también

ProofShot: CLI para Agentes de IA para Verificar Código de Interfaz de Usuario con Grabación del Navegador
Herramientas

ProofShot: CLI para Agentes de IA para Verificar Código de Interfaz de Usuario con Grabación del Navegador

ProofShot es una herramienta CLI que permite a los agentes de codificación con IA abrir un navegador, interactuar con páginas, grabar sesiones y recopilar errores, luego empaqueta todo en un archivo HTML autónomo para revisión. Funciona con cualquier agente de IA mediante comandos de shell y se empaqueta como una habilidad.

OpenClawRadar
OpenClawDreams: Una Extensión de Simulador de Sueños para Agentes OpenClaw
Herramientas

OpenClawDreams: Una Extensión de Simulador de Sueños para Agentes OpenClaw

OpenClawDreams es una extensión que añade un proceso de reflexión en segundo plano y un ciclo de sueño nocturno a los agentes OpenClaw. Captura resúmenes cifrados de conversaciones en una base de datos SQLite local, los procesa durante ciclos en segundo plano y genera ideas consolidadas que se insertan en la memoria persistente del agente.

OpenClawRadar
El Servidor MCP de ExposureGuard Agrega Escaneo de Seguridad de Dominios a Claude Desktop
Herramientas

El Servidor MCP de ExposureGuard Agrega Escaneo de Seguridad de Dominios a Claude Desktop

Un desarrollador construyó un servidor MCP para escaneo de seguridad de dominios usando Claude Code, exponiendo cuatro herramientas que verifican SPF, DMARC, SSL, encabezados de seguridad, DNSSEC, puertos abiertos, MX y HTTPS. El servidor está disponible mediante pip install exposureguard-mcp con un nivel gratuito de 100 llamadas API por día.

OpenClawRadar
El cuello de botella en los agentes paralelos de IA: la cola de aprobación humana se estrangula a sí misma
Herramientas

El cuello de botella en los agentes paralelos de IA: la cola de aprobación humana se estrangula a sí misma

Un desarrollador que ejecuta agentes de Claude Code en paralelo describe el 'bottleself' — el punto en que el paralelismo deja de aumentar la producción y comienza a crear un acumulado de aprobaciones humanas. Su solución: un planificador que descompone objetivos en subtareas, genera agentes y solo notifica cuando hay decisiones no resueltas.

OpenClawRadar