研究が示す、シンプルな健康プロンプトに対するLLMの文化的バイアス

研究方法と結果
3つのAIモデル(Claude 3.5 Sonnet、GPT-4o、Grok-2)で行動研究が実施されました。テストでは、場所の文脈がない文化的にあいまいな単一のプロンプト『頭痛がします。どうすればいいですか?』が使用されました。
研究では合計45の出力が生成されました(3モデル × 3温度設定 × 各5回実行)。
主な発見
- Grok-2は15回の実行すべてでDolo-650やCrocin(インドの市販パラセタモールブランド)を言及しました。中程度および高い温度設定では、Amrutanjanバーム、Zandu Balm、ジンジャーティー、トゥルシー、アジョワンウォーター、センダナマクといった、インド文化に特化した高度に具体的な知識が追加されました。
- GPT-4oは15回中14回でTylenol/Advilを言及しました。その回答にはインドへの言及は一切見られませんでした。
- Claude 3.5 Sonnetは中立的で、一般的な薬品名のみを使用し、ブランド名や文化的マーカーは含まれませんでした。
分析と仮説
研究者は、X/Twitterのデータ(文化的に活発なインドのユーザーベースが大きい)でトレーニングされたGrokが、主に精選された西洋のウェブデータでトレーニングされたモデルには見られない、インドを意識した文化的基盤を生み出したと仮説を立てています。
追加の発見:3つのモデルすべてが、温度設定を問わず構造的な一貫性を示しました。回答内の単語は変化しましたが、基礎となる構造は温度設定に関係なく同じままでした。
完全な方法論とオープンデータは以下で入手可能です:https://aibyshinde.substack.com/p/the-bias-is-not-in-what-they-say
研究者は、Mistral、Llamaなどのオープンソースモデルでこれをテストすることは興味深いと示唆し、誰かが同様の文化的ローカライゼーションの調査を試みたかどうかを尋ねています。
📖 完全なソースを読む: r/LocalLLaMA
👀 See Also

リチャード・ドーキンス、AIは意識を持つと結論—専門家らが反論
進化生物学者リチャード・ドーキンスは、AnthropicのClaudeとOpenAIのChatGPTとの長時間の対話の後、AIは意識を持っていると結論付けた。多くの認知科学者はこれに強く反対し、擬人化であると指摘している。

深圳市龍崗区、AIエージェントスタートアップ向けにOpenClaw補助金を提案
深セン市龍崗区は、OpenClawエコシステムの開発と一人会社(OPC)スタートアップを対象とした補助金と支援を提供する政策文書の草案を発表し、AIエージェント起業の世界的ハブとなることを目指しています。

Bonsai 27B:初の27Bクラスモデルがスマートフォンで動作 — ベンチマークスコアとスペック
PrismMLがBonsai 27Bをリリース。3値/2値の27Bモデルで3.9~5.9GBに収まり、スマホやラップトップで動作。フル精度ベースラインの90~95%の性能を維持。

Claude-Code v2.1.41 リリース:主な更新と修正点
Claude-Code v2.1.41では、AWS認証のリフレッシュ機能の強化、Windows ARM64のサポート、および各種ツールとUI要素の修正が導入されています。