클로드 코드를 사용하여 LLM으로 4,000건 이상의 블라인드 웨어울프 게임 시뮬레이션

✍️ OpenClawRadar📅 게시일: February 27, 2026🔗 Source
클로드 코드를 사용하여 LLM으로 4,000건 이상의 블라인드 웨어울프 게임 시뮬레이션
Ad

시뮬레이션 설정 및 결과

한 개발자가 Claude Code를 사용해 대규모 언어 모델들이 서로 눈가리개 원나이트 웨어울프를 플레이하는 작은 시뮬레이터를 구축했습니다. 이 실험은 OpenAI(GPT-4o-mini, GPT-5-mini)와 xAI(Grok-3-fast, Grok-4-1-fast) 모델을 대상으로 약 4,600게임을 실행했습니다.

이 게임 변형은 최소한의 신호만을 가지고 있습니다: 7명의 플레이어, 1마리의 늑대, 역할 없음, 짧은 토론 한 번, 그 후 동시 투표입니다. 플레이어들 사이의 유일한 차별화 요소는 그들의 이름입니다. 이 제한된 설정에도 불구하고, 시뮬레이션은 일부 이름들이 테스트된 모든 모델에서 다른 이름들보다 훨씬 더 자주 투표로 제외되는 반면, 다른 이름들은 거의 제외되지 않는 일관된 패턴을 드러냈습니다.

중요한 주의사항 및 접근 방법

개발자는 이것이 인과 관계 주장이 아니라 장난감 설정에서 나온 결과 패턴일 뿐이라고 명시적으로 밝혔습니다. 이름 그룹은 광범위하며, 일부 이름은 덜 자주 나타나고, 이것이 모델에 관한 근본적인 것을 드러내기보다는 설정의 부산물일 수 있는 여러 방법이 있습니다. 그러나 이러한 패턴의 실행과 모델 간 일관성은 놀라운 것으로 지적되었습니다.

더 탐구하고 싶은 분들을 위해:

  • 대시보드: https://huggingface.co/spaces/Queue-Bit-1/llm-bias-dashboard
  • 코드 + 원시 로그: https://github.com/Queue-Bit-1/wolf

개발자는 다른 사람들도 다중 에이전트 시뮬레이션에서 유사한 이름 효과를 관찰했는지 궁금해합니다.

📖 전체 출처 읽기: r/ClaudeAI

Ad

👀 See Also

Claude Code v2.1.143: 플러그인 종속성 적용, PowerShell 기본값 및 백그라운드 세션 수정
Tools

Claude Code v2.1.143: 플러그인 종속성 적용, PowerShell 기본값 및 백그라운드 세션 수정

Anthropic이 플러그인 종속성 강제, PowerShell -ExecutionPolicy Bypass, 새로운 워크트리 격리 옵션, 그리고 백그라운드 세션, Windows 터미널, macOS 파일 접근 관련 여러 수정 사항을 포함한 Claude Code v2.1.143을 출시했습니다.

OpenClawRadar
Depct 도구는 Claude가 프로덕션 문제를 디버깅하는 데 도움이 되도록 런타임 데이터를 수집합니다.
Tools

Depct 도구는 Claude가 프로덕션 문제를 디버깅하는 데 도움이 되도록 런타임 데이터를 수집합니다.

Depct는 Node.js 애플리케이션에서 런타임 계측 데이터를 수집하고, 이를 그래프로 구성한 후 AWS Bedrock을 통해 Claude에 전달하여 간헐적으로 발생하는 프로덕션 장애를 디버깅하는 데 도움을 주는 도구입니다. 또한 런타임 동작에서 아키텍처 다이어그램과 의존성 맵을 생성합니다.

OpenClawRadar
에이전트 프레임워크는 세션당 35만 개 이상의 토큰을 정적 파일 재전송에 낭비합니다.
Tools

에이전트 프레임워크는 세션당 35만 개 이상의 토큰을 정적 파일 재전송에 낭비합니다.

로컬 Qwen 3.5 122B 설정에서 수행한 벤치마크 결과, 에이전트 프레임워크가 정적 파일을 반복적으로 재전송함으로써 세션당 350,000개 이상의 토큰을 낭비하는 것으로 나타났습니다. 컴파일 타임 접근법을 통해 쿼리 컨텍스트를 1,373개 토큰에서 73개로 줄여 95% 감소를 달성했습니다.

OpenClawRadar
Pi 코딩 에이전트 Qwen 35B Q2: 파일 시스템을 외부 메모리로 사용하고 컨텍스트 가드 적용
Tools

Pi 코딩 에이전트 Qwen 35B Q2: 파일 시스템을 외부 메모리로 사용하고 컨텍스트 가드 적용

한 Reddit 사용자가 Qwen 35B Q2_K_XL 양자화 모델을 사용한 Pi 코딩 에이전트 기반 스택을 구축했습니다. 이 시스템은 100줄 이상의 편집을 거부하고, 사고 블록을 2000자로 제한하며, 컨텍스트 사용량을 65%/80%에서 모니터링합니다. 파일 시스템을 컨텍스트 창이 아닌 모델의 메모리로 취급합니다.

OpenClawRadar