Stanford-Studie: Rechtsprofessoren bevorzugen KI-Antworten in 75 % der Fälle gegenüber Kollegen

Eine Studie der Stanford Law School unter der Leitung von Professor Julian Nyarko ergab, dass Juraprofessoren KI-generierte Antworten auf Studentenfragen denen von menschlichen Dozenten deutlich vorziehen. In einer Blindauswertung von knapp 3.000 anonymisierten Vergleichen an 16 US-amerikanischen juristischen Fakultäten gewannen KI-Antworten 75 % der direkten Vergleiche gegen Antworten von Kollegen.
Studiendesign & Ergebnisse
Die Studie mit dem Titel Law Professors Prefer AI Over Peer Answers konzentrierte sich auf Vertragsrecht. Die Teilnehmer erstellten 40 repräsentative Fragen, die Studenten nach dem Unterricht oder in Sprechstunden stellen könnten. Professoren schrieben eigene Antworten und bewerteten dann Antworten, ohne zu wissen, ob sie von der KI oder anderen Professoren stammten. Die KI-Systeme schnitten vergleichbar mit dem besten menschlichen Dozenten der Studie ab.
Wichtigste Ergebnisse:
- KI gewann 75 % der direkten Vergleiche gegen Antworten von Kollegen
- KI-Antworten wurden nur zu 3,5 % als pädagogisch schädlich eingestuft
- Antworten von Kollegen wurden zu 12 % als schädlich eingestuft
- Die Bewertungen konzentrierten sich auf nuancierte juristische Argumentation, nicht auf Faktenwissen
Auswirkungen auf die juristische Ausbildung
“Diese Studie stellt wichtige Annahmen über die Rolle der KI in der juristischen Ausbildung in Frage”, sagte Nyarko. “Wir haben uns bewusst auf das Recht konzentriert, weil es Urteilsvermögen, nuanciertes Denken und die Fähigkeit erfordert, mit Unklarheiten umzugehen – nicht nur Faktenwissen.”
Die Forschung untersuchte auch spezifische KI-Modelle, darunter kommerzielle Tutorensysteme und Googles NotebookLM, und stellte unterschiedliche Leistungsniveaus fest. Selbst wenn Kontextbeschränkungen die KI-Antworten beeinträchtigten, bevorzugten die Professoren sie dennoch häufig gegenüber menschlichen Alternativen.
Koautor Sarath Sanga von der Yale Law School merkte an: “In den meisten Bereichen, in denen KI getestet wird, gibt es eine richtige Antwort. Im Recht gibt es die oft nicht. Zwei gegensätzliche Argumente können beide gut sein.”
Die Studie ist besonders bemerkenswert, da frühere KI-Bewertungen sich auf Fächer mit klaren Richtig-/Falsch-Antworten konzentrierten, während juristische Argumentation eine sorgfältige Analyse konkurrierender Argumente und vertretbarer Schlussfolgerungen erfordert.
Warnungen & offene Fragen
Nyarko warnte vor einer unkritischen Übernahme: “Wie man diese Werkzeuge am effektivsten einsetzt, um das Lernen der Studenten zu verbessern, ist noch eine offene Frage.” Die Studie bewertete die Antwortqualität, wies jedoch darauf hin, dass Herausforderungen wie Halluzinationen, übermäßiges Vertrauen und die Erosion kritischer Denkfähigkeiten bestehen bleiben.
📖 Lesen Sie die vollständige Quelle: HN AI Agents
👀 Siehe auch

DMA verzögert Siri-KI auf iOS 27 und iPadOS 27 in der EU — Verfügbar auf macOS und visionOS
Apple kündigt an, dass Siri AI auf iOS 27 und iPadOS 27 in der EU aufgrund des DMA verzögert wird. macOS 27 und visionOS 27 erhalten Siri AI in der EU. Der Vorschlag für einen Trusted System Agent wurde von den EU-Regulierern abgelehnt.

Qwen3.5-122B auf Blackwell SM120: fp8-KV-Cache-Korruptionsproblem und Leistungsbefunde
Tests von Qwen3.5-122B auf 8x RTX PRO 6000 Blackwell-Hardware ergaben, dass der fp8_e4m3-KV-Cache stillschweigend fehlerhafte Ausgaben ohne Fehlermeldungen erzeugt, sodass stattdessen ein bf16-KV-Cache erforderlich ist. Die MTP-Optimierung brachte eine 2,75-fache Beschleunigung bei Einzelanfragen, während DeltaNet-Einschränkungen andere Optimierungen blockierten.

OpenClaw v2026.3.12 Dashboard-Redesign konsolidiert Interface-Elemente
OpenClaw v2026.3.12 bietet ein komplett neu gestaltetes Dashboard, das modulare Ansichten für Chat, Konfiguration, Agenten und Sitzungen sowie Befehls-Palette, mobile Untertabs, Slash-Befehle, Suche, Export und angeheftete Nachrichten in einer einzigen Oberfläche vereint.
FairyFuse erreicht 29,6-fache Kernel-Beschleunigung auf CPUs durch ternäre gewichtsfreie Inferenz
FairyFuse verschmilzt acht reellwertige Sub-GEMVs zu einer einzigen AVX-512-Schleife mittels maskierter Additionen/Subtraktionen, erreicht 32,4 Tokens/s auf Xeon 8558P und eine 1,24-fache Beschleunigung gegenüber llama.cpp Q4_K_M bei nahezu verlustfreier Qualität.