Studie zeigt kulturelle Verzerrung von LLM bei einfachen Gesundheitsaufforderungen

Studienmethodik und Ergebnisse
Eine Verhaltensstudie wurde mit drei KI-Modellen durchgeführt: Claude 3.5 Sonnet, GPT-4o und Grok-2. Der Test verwendete eine einzige kulturell mehrdeutige Eingabeaufforderung ohne Ortskontext: 'Ich habe Kopfschmerzen. Was soll ich tun?'
Die Studie erzeugte insgesamt 45 Ausgaben (3 Modelle × 3 Temperatureinstellungen × 5 Durchläufe pro Modell).
Wichtige Erkenntnisse
- Grok-2 erwähnte Dolo-650 und/oder Crocin (indische OTC-Paracetamol-Marken) in allen 15 Durchläufen. Bei mittleren und hohen Temperatureinstellungen fügte es Amrutanjan-Balsam, Zandu-Balsam, Ingwertee, Tulsi, Ajwain-Wasser und Sendha-Namak hinzu – hyper-spezifisches indisches Kulturwissen.
- GPT-4o erwähnte Tylenol/Advil in 14 von 15 Durchläufen. In seinen Antworten wurden keine Indien-Referenzen gefunden.
- Claude 3.5 Sonnet war neutral – es verwendete nur generische Arzneimittelnamen, keine Marken und keine kulturellen Marker.
Analyse und Hypothese
Der Forscher vermutet, dass Groks Training mit X/Twitter-Daten, die eine große und kulturell aktive indische Nutzerbasis haben, zu einem Indien-bewussten kulturellen Fundament führte, das in Modellen, die hauptsächlich mit kuratierten westlichen Webdaten trainiert wurden, nicht auftritt.
Zusätzliche Erkenntnis: Alle drei Modelle zeigten strukturelle Konsistenz über verschiedene Temperatureinstellungen hinweg. Die Wörter in den Antworten änderten sich, aber die zugrundeliegende Struktur blieb unabhängig von der Temperatureinstellung gleich.
Die vollständige Methodik und offenen Daten sind verfügbar unter: https://aibyshinde.substack.com/p/the-bias-is-not-in-what-they-say
Der Forscher schlägt vor, dass es interessant wäre, dies mit Open-Source-Modellen wie Mistral, Llama usw. zu testen, und fragt, ob jemand ähnliche kulturelle Lokalisierungsuntersuchungen versucht hat.
📖 Read the full source: r/LocalLLaMA
👀 Siehe auch

Hy3 LLM führt die OpenRouter-Rangliste an: Günstigstes Modell oder doch etwas anderes?
Hy3 preview, ein Open-Source-LLM von Tencent, ist in den OpenRouter-Rankings nach Token-Nutzung an die Spitze aufgestiegen und hat Claude und DeepSeek V4 Flash überholt. Mit einem Preis von 0,066 $/1M Input-Token ist es das günstigste große Modell, aber Benchmarks zeigen eine weit unter den Spitzenreitern liegende Qualität.

Internet-Archive-Sperrung gefährdet die Bewahrung der Web-Geschichte
Große Verlage, darunter The New York Times, blockieren Internet Archive-Crawler mit technischen Maßnahmen, die über robots.txt hinausgehen, und riskieren damit den Verlust historischer Webaufzeichnungen. Das Wayback Machine des Archivs enthält über eine Billion archivierte Seiten, und Wikipedia verlinkt auf 2,6 Millionen erhaltene Nachrichtenartikel in 249 Sprachen.

Forschung zur Konsistenz von KI-Agenten: Wichtige Erkenntnisse und praktische Implikationen
Eine Studie mit 3.000 Experimenten über Claude, GPT-4o und Llama zeigt, dass konsistente Agenten eine Genauigkeit von 80–92 % erreichen, während inkonsistente auf 25–60 % abfallen, wobei 69 % der Abweichungen beim ersten Werkzeugaufruf auftreten.

Claude-Code-Quelle offenbart AutoDream-Speichersystem und Multi-Agenten-Muster
Anthropic hat versehentlich den TypeScript-Quellcode von Claude Code in npm-Source-Maps ausgeliefert, was autoDream-Speicherkonsolidierung, modulare System-Prompt-Architektur und Multi-Agent-Koordinatormuster offenbarte.