Claude Codeは、LLMを用いて4,000件以上の盲人狼ゲームをシミュレートするために使用されました。

シミュレーションの設定と結果
開発者がClaude Codeを使用して、大規模言語モデルが互いにブラインド・ワンナイト人狼をプレイする小さなシミュレーターを構築しました。この実験では、OpenAI(GPT-4o-mini、GPT-5-mini)とxAI(Grok-3-fast、Grok-4-1-fast)のモデルで約4,600ゲームが実行されました。
このゲームバリアントは最小限のシグナルしかありません:7人のプレイヤー、1人の人狼、役職なし、短い議論の後、同時投票が行われます。プレイヤー間の唯一の違いは名前だけです。この限られた設定にもかかわらず、シミュレーションでは、すべてのテストされたモデルで、一部の名前が他の名前よりも著しく頻繁に投票で脱落する一貫したパターンが明らかになりました。一方、他の名前はほとんど脱落しないことも分かりました。
重要な注意点とアクセス方法
開発者は、これは因果関係の主張ではなく、単なるおもちゃのような設定からの結果パターンであると明言しています。名前のグループは広範で、一部の名前は出現頻度が低く、この結果がモデルに関する根本的な何かを示しているのではなく、設定のアーティファクトである可能性が複数あります。しかし、これらのパターンが実行やモデルをまたいで一貫していることは驚くべきこととして指摘されています。
さらに探求したい方のために:
- ダッシュボード:https://huggingface.co/spaces/Queue-Bit-1/llm-bias-dashboard
- コード+生ログ:https://github.com/Queue-Bit-1/wolf
開発者は、他の人がマルチエージェントシミュレーションで同様の名前効果を観察したかどうかに興味を持っています。
📖 全文を読む: r/ClaudeAI
👀 See Also

AlterSpec v1.0:AIエージェントのためのランタイムポリシー強制
AlterSpec v1.0は、AIエージェントとそのツールの間に位置するオープンソースのランタイム強制エンジンであり、実行前にYAMLで定義されたポリシーに対してアクションを評価します。許可/拒否/レビューの決定、暗号化されたポリシー署名、監査ログ機能を提供します。

ポケットチーム:フックベースの安全性と学習エージェントを備えたクロードコードパイプライン
PocketTeamは、Claude Code上に構築されたパイプラインで、ツール呼び出しレベルで9つの安全レイヤーを実装し、.envへの書き込みやrm -rfコマンドなどの危険な操作をブロックします。システムには、完了したタスクを分析し、構造化された学習内容を記述して将来のエージェントのパフォーマンスを向上させるObserverエージェントが含まれています。

WebアプリにOpenClawエージェントをデプロイするスキルの構築方法 - 舞台裏の解説
OpenClawエージェント向けに開発された革新的な新スキルについてご紹介します。このスキルはWebアプリへの簡単なデプロイを可能にします。その特徴、利点、そして生産プロセスをどのように変革するかについて学びましょう。

ジョブリー:AI主導の紛争解決とコミュニティ投票を備えた契約マーケットプレイス
Joblyは、Next.js 14、TypeScript、Supabaseを使用して構築された契約マーケットプレイスで、提案時に10%のプロバイダー保証金を伴うエスクローシステムと、Claudeを使用したAI評価から始まり、コミュニティのステーク投票へのアピールを可能にする紛争解決パイプラインを備えています。