클로드 코드를 사용하여 LLM으로 4,000건 이상의 블라인드 웨어울프 게임 시뮬레이션

시뮬레이션 설정 및 결과
한 개발자가 Claude Code를 사용해 대규모 언어 모델들이 서로 눈가리개 원나이트 웨어울프를 플레이하는 작은 시뮬레이터를 구축했습니다. 이 실험은 OpenAI(GPT-4o-mini, GPT-5-mini)와 xAI(Grok-3-fast, Grok-4-1-fast) 모델을 대상으로 약 4,600게임을 실행했습니다.
이 게임 변형은 최소한의 신호만을 가지고 있습니다: 7명의 플레이어, 1마리의 늑대, 역할 없음, 짧은 토론 한 번, 그 후 동시 투표입니다. 플레이어들 사이의 유일한 차별화 요소는 그들의 이름입니다. 이 제한된 설정에도 불구하고, 시뮬레이션은 일부 이름들이 테스트된 모든 모델에서 다른 이름들보다 훨씬 더 자주 투표로 제외되는 반면, 다른 이름들은 거의 제외되지 않는 일관된 패턴을 드러냈습니다.
중요한 주의사항 및 접근 방법
개발자는 이것이 인과 관계 주장이 아니라 장난감 설정에서 나온 결과 패턴일 뿐이라고 명시적으로 밝혔습니다. 이름 그룹은 광범위하며, 일부 이름은 덜 자주 나타나고, 이것이 모델에 관한 근본적인 것을 드러내기보다는 설정의 부산물일 수 있는 여러 방법이 있습니다. 그러나 이러한 패턴의 실행과 모델 간 일관성은 놀라운 것으로 지적되었습니다.
더 탐구하고 싶은 분들을 위해:
- 대시보드: https://huggingface.co/spaces/Queue-Bit-1/llm-bias-dashboard
- 코드 + 원시 로그: https://github.com/Queue-Bit-1/wolf
개발자는 다른 사람들도 다중 에이전트 시뮬레이션에서 유사한 이름 효과를 관찰했는지 궁금해합니다.
📖 전체 출처 읽기: r/ClaudeAI
👀 See Also

RAG-Engram 아키텍처로 미세 조정된 Qwen3.5-2B 모델은 8K 컨텍스트에서 근거 기반 답변 정확도를 50%에서 93%로 향상시킵니다.
한 개발자가 '중간에서 길을 잃는' 현상을 해결하기 위해 맞춤형 RAG-Engram 아키텍처로 Qwen3.5-2B를 미세 조정하여, 실제 질의에서 8K 토큰 기준 정답률을 50%에서 93%로 향상시켰습니다. 이 시스템은 정적 개체 임베딩과 동적 청크 탐색이라는 두 단계 접근법을 사용합니다.

Claude Code 세션 대시보드: 다중 세션 모니터링을 위한 오픈소스 도구
여러 개의 Claude Code 세션을 동시에 모니터링하는 오픈소스 대시보드로, 토큰 사용량, 비용, 세션 상태, 컨텍스트 창 사용량, 활성 서브에이전트를 보여줍니다. 설치에는 세 가지 명령어가 필요합니다: git clone, cd, npm install && npm start.

클로드 코드 v2.1.126: 모델 선택기, 프로젝트 정리, OAuth 수정 및 보안 개선
Claude Code v2.1.126은 Anthropic 호환 게이트웨이용 /model 선택기, 새로운 claude project purge 명령어, WSL2/SSH/컨테이너에서의 OAuth 로그인 수정, 관리 설정 및 Windows에서 클립보드 노출 관련 보안 문제 패치를 추가했습니다.

AI 코딩 에이전트를 위한 멀티 모델 협업 워크플로우
개발자가 코딩 작업을 코딩 에이전트에 전달하기 전에 세 가지 AI 모델(GPT-4o를 설계자, Claude를 회의론자, Gemini를 통합자로 사용)을 통해 검토하는 웹 도구를 만들었습니다. 이 도구는 명시적인 제약 조건이 포함된 PLAN.md를 생성하며 사용자가 자신의 API 키를 가져와야 합니다.