Stanford-Studie: Rechtsprofessoren bevorzugen KI-Antworten in 75 % der Fälle gegenüber Kollegen

Eine Studie der Stanford Law School unter der Leitung von Professor Julian Nyarko ergab, dass Juraprofessoren KI-generierte Antworten auf Studentenfragen denen von menschlichen Dozenten deutlich vorziehen. In einer Blindauswertung von knapp 3.000 anonymisierten Vergleichen an 16 US-amerikanischen juristischen Fakultäten gewannen KI-Antworten 75 % der direkten Vergleiche gegen Antworten von Kollegen.
Studiendesign & Ergebnisse
Die Studie mit dem Titel Law Professors Prefer AI Over Peer Answers konzentrierte sich auf Vertragsrecht. Die Teilnehmer erstellten 40 repräsentative Fragen, die Studenten nach dem Unterricht oder in Sprechstunden stellen könnten. Professoren schrieben eigene Antworten und bewerteten dann Antworten, ohne zu wissen, ob sie von der KI oder anderen Professoren stammten. Die KI-Systeme schnitten vergleichbar mit dem besten menschlichen Dozenten der Studie ab.
Wichtigste Ergebnisse:
- KI gewann 75 % der direkten Vergleiche gegen Antworten von Kollegen
- KI-Antworten wurden nur zu 3,5 % als pädagogisch schädlich eingestuft
- Antworten von Kollegen wurden zu 12 % als schädlich eingestuft
- Die Bewertungen konzentrierten sich auf nuancierte juristische Argumentation, nicht auf Faktenwissen
Auswirkungen auf die juristische Ausbildung
“Diese Studie stellt wichtige Annahmen über die Rolle der KI in der juristischen Ausbildung in Frage”, sagte Nyarko. “Wir haben uns bewusst auf das Recht konzentriert, weil es Urteilsvermögen, nuanciertes Denken und die Fähigkeit erfordert, mit Unklarheiten umzugehen – nicht nur Faktenwissen.”
Die Forschung untersuchte auch spezifische KI-Modelle, darunter kommerzielle Tutorensysteme und Googles NotebookLM, und stellte unterschiedliche Leistungsniveaus fest. Selbst wenn Kontextbeschränkungen die KI-Antworten beeinträchtigten, bevorzugten die Professoren sie dennoch häufig gegenüber menschlichen Alternativen.
Koautor Sarath Sanga von der Yale Law School merkte an: “In den meisten Bereichen, in denen KI getestet wird, gibt es eine richtige Antwort. Im Recht gibt es die oft nicht. Zwei gegensätzliche Argumente können beide gut sein.”
Die Studie ist besonders bemerkenswert, da frühere KI-Bewertungen sich auf Fächer mit klaren Richtig-/Falsch-Antworten konzentrierten, während juristische Argumentation eine sorgfältige Analyse konkurrierender Argumente und vertretbarer Schlussfolgerungen erfordert.
Warnungen & offene Fragen
Nyarko warnte vor einer unkritischen Übernahme: “Wie man diese Werkzeuge am effektivsten einsetzt, um das Lernen der Studenten zu verbessern, ist noch eine offene Frage.” Die Studie bewertete die Antwortqualität, wies jedoch darauf hin, dass Herausforderungen wie Halluzinationen, übermäßiges Vertrauen und die Erosion kritischer Denkfähigkeiten bestehen bleiben.
📖 Lesen Sie die vollständige Quelle: HN AI Agents
👀 Siehe auch

Claude Code v2.1.169: Safe Mode, /cd-Befehl und Dutzende von Fehlerbehebungen
v2.1.169 führt --safe-mode ein, um alle Anpassungen zur Fehlerbehebung zu deaktivieren, einen /cd-Befehl zum Wechseln von Verzeichnissen mitten in der Sitzung ohne Cache-Verlust, und behebt eine ~30-50ms UI-Verzögerung, Hänger unter Windows sowie Lücken in der MCP-Richtliniendurchsetzung.

OpenClaw 2026.4.29 defekt – Downgrade auf 2026.2.6
OpenClaw Version 2026.4.29 ist defekt: zufällige Fehler, langsame CLI, doppelte Antworten. Ein Downgrade auf 2026.2.6 behebt das Problem.

Die Erkundung der Feinheiten von OpenClaw: Wie es funktioniert.
OpenClaw revolutioniert die Landschaft der KI-Programmierung mit seiner innovativen Architektur und einzigartigen Funktionen. Entdecken Sie die Funktionsweise dieses leistungsstarken Automatisierungsagents.

Hy3 LLM führt die OpenRouter-Rangliste an: Günstigstes Modell oder doch etwas anderes?
Hy3 preview, ein Open-Source-LLM von Tencent, ist in den OpenRouter-Rankings nach Token-Nutzung an die Spitze aufgestiegen und hat Claude und DeepSeek V4 Flash überholt. Mit einem Preis von 0,066 $/1M Input-Token ist es das günstigste große Modell, aber Benchmarks zeigen eine weit unter den Spitzenreitern liegende Qualität.