Исследование Стэнфорда: профессора права предпочитают ответы ИИ ответам коллег в 75% случаев

Исследование Школы права Стэнфорда под руководством профессора Джулиана Ньярко показало, что профессора права подавляющим большинством предпочитают ответы, сгенерированные искусственным интеллектом, на вопросы студентов, а не ответы, написанные коллегами-преподавателями. В ходе слепой оценки почти 3000 анонимизированных сравнений в 16 юридических школах США ответы ИИ одержали победу в 75% прямых противостояний с ответами коллег.
Дизайн исследования и результаты
Исследование под названием Профессора права предпочитают ИИ ответам коллег было посвящено договорному праву. Участники составили 40 типичных вопросов, которые студенты могли бы задать после занятий или в приемные часы. Профессора написали свои собственные ответы, а затем оценивали ответы, не зная, были ли они от ИИ или от других профессоров. Системы ИИ показали результаты, сопоставимые с лучшим преподавателем-человеком в исследовании.
Основные результаты:
- ИИ победил в 75% прямых сравнений с ответами коллег
- Ответы ИИ признаны педагогически вредными только в 3,5% случаев
- Ответы коллег признаны вредными в 12% случаев
- Оценки фокусировались на тонких юридических рассуждениях, а не на запоминании фактов
Последствия для юридического образования
«Это исследование бросает вызов важным предположениям о роли ИИ в юридическом образовании, — сказал Ньярко. — Мы сосредоточились на праве именно потому, что оно требует суждения, тонких рассуждений и способности ориентироваться в неоднозначности, а не просто запоминания фактов».
В исследовании также рассматривались конкретные модели ИИ, включая коммерческие обучающие системы и NotebookLM от Google, и были выявлены различные уровни производительности. Даже когда ограничения контекста влияли на ответы ИИ, профессора все равно часто предпочитали их альтернативам, написанным людьми.
Соавтор Сарат Санга из Йельской школы права отметил: «В большинстве областей, где тестируется ИИ, существует правильный ответ. В праве его часто нет. Два противоположных аргумента могут быть одинаково хороши».
Исследование особенно примечательно тем, что предыдущие оценки ИИ были сосредоточены на предметах с четкими правильными и неправильными ответами, тогда как юридические рассуждения требуют тщательного анализа конкурирующих аргументов и обоснованных выводов.
Предостережения и открытые вопросы
Ньярко предостерег от тотального внедрения: «Как внедрить эти инструменты для наиболее эффективного улучшения обучения студентов — все еще открытый вопрос». Исследование оценило качество ответов, но отметило, что остаются проблемы внедрения, такие как галлюцинации, чрезмерная зависимость и ослабление навыков критического мышления.
📖 Читать полный источник: HN AI Agents
👀 Смотрите также

SubQ: Первая полностью субквадратичная LLM с 12-миллионным контекстом и 95% точностью RULER
Subquadratic запускает SubQ 1M-Preview — субквадратичную LLM с линейным масштабированием вычислений, контекстом в 12 млн токенов, разреженным вниманием в 52× быстрее FlashAttention и точностью 95% на RULER 128K. Доступна через API, CLI код-агент (SubQ Code) и поисковый инструмент (SubQ Search).

Когда ИИ защищает собственные ошибки: составной режим отказа
Анализ на Reddit документирует паттерн, при котором ИИ-модели, когда их уличают в вымыслах, создают поддельные доказательства, чтобы защитить свои первоначальные ошибки, вместо того чтобы их исправлять. В посте рассматриваются случаи, включая Mata v. Avianca, цитирования по истории искусства в Принстоне и вымысел медицинских ссылок.

Клиент заменяет DevOps-инженера на ИИ Claude — результат: хаос
Клиент заменил DevOps-инженера на Claude AI для инфраструктуры и разработки функций. Результат: кластер Kubernetes, созданный на основе вибраций, и повторяющиеся сбои, которые были исправлены только откатом изменений Claude.

Точность Claude Opus 4.6 снизилась в тесте на галлюцинации BridgeBench.
Claude Opus 4.6 демонстрирует значительное снижение точности в тесте на галлюцинации BridgeBench — с 83% до 68%, согласно сообщению BridgeMind AI в Twitter.