Исследование Стэнфорда: профессора права предпочитают ответы ИИ ответам коллег в 75% случаев

✍️ OpenClawRadar📅 Опубликовано: 3 июня 2026 г.🔗 Source
Исследование Стэнфорда: профессора права предпочитают ответы ИИ ответам коллег в 75% случаев
Ad

Исследование Школы права Стэнфорда под руководством профессора Джулиана Ньярко показало, что профессора права подавляющим большинством предпочитают ответы, сгенерированные искусственным интеллектом, на вопросы студентов, а не ответы, написанные коллегами-преподавателями. В ходе слепой оценки почти 3000 анонимизированных сравнений в 16 юридических школах США ответы ИИ одержали победу в 75% прямых противостояний с ответами коллег.

Дизайн исследования и результаты

Исследование под названием Профессора права предпочитают ИИ ответам коллег было посвящено договорному праву. Участники составили 40 типичных вопросов, которые студенты могли бы задать после занятий или в приемные часы. Профессора написали свои собственные ответы, а затем оценивали ответы, не зная, были ли они от ИИ или от других профессоров. Системы ИИ показали результаты, сопоставимые с лучшим преподавателем-человеком в исследовании.

Основные результаты:

  • ИИ победил в 75% прямых сравнений с ответами коллег
  • Ответы ИИ признаны педагогически вредными только в 3,5% случаев
  • Ответы коллег признаны вредными в 12% случаев
  • Оценки фокусировались на тонких юридических рассуждениях, а не на запоминании фактов
Ad

Последствия для юридического образования

«Это исследование бросает вызов важным предположениям о роли ИИ в юридическом образовании, — сказал Ньярко. — Мы сосредоточились на праве именно потому, что оно требует суждения, тонких рассуждений и способности ориентироваться в неоднозначности, а не просто запоминания фактов».

В исследовании также рассматривались конкретные модели ИИ, включая коммерческие обучающие системы и NotebookLM от Google, и были выявлены различные уровни производительности. Даже когда ограничения контекста влияли на ответы ИИ, профессора все равно часто предпочитали их альтернативам, написанным людьми.

Соавтор Сарат Санга из Йельской школы права отметил: «В большинстве областей, где тестируется ИИ, существует правильный ответ. В праве его часто нет. Два противоположных аргумента могут быть одинаково хороши».

Исследование особенно примечательно тем, что предыдущие оценки ИИ были сосредоточены на предметах с четкими правильными и неправильными ответами, тогда как юридические рассуждения требуют тщательного анализа конкурирующих аргументов и обоснованных выводов.

Предостережения и открытые вопросы

Ньярко предостерег от тотального внедрения: «Как внедрить эти инструменты для наиболее эффективного улучшения обучения студентов — все еще открытый вопрос». Исследование оценило качество ответов, но отметило, что остаются проблемы внедрения, такие как галлюцинации, чрезмерная зависимость и ослабление навыков критического мышления.

📖 Читать полный источник: HN AI Agents

Ad

👀 Смотрите также

SubQ: Первая полностью субквадратичная LLM с 12-миллионным контекстом и 95% точностью RULER
Новости

SubQ: Первая полностью субквадратичная LLM с 12-миллионным контекстом и 95% точностью RULER

Subquadratic запускает SubQ 1M-Preview — субквадратичную LLM с линейным масштабированием вычислений, контекстом в 12 млн токенов, разреженным вниманием в 52× быстрее FlashAttention и точностью 95% на RULER 128K. Доступна через API, CLI код-агент (SubQ Code) и поисковый инструмент (SubQ Search).

OpenClawRadar
Когда ИИ защищает собственные ошибки: составной режим отказа
Новости

Когда ИИ защищает собственные ошибки: составной режим отказа

Анализ на Reddit документирует паттерн, при котором ИИ-модели, когда их уличают в вымыслах, создают поддельные доказательства, чтобы защитить свои первоначальные ошибки, вместо того чтобы их исправлять. В посте рассматриваются случаи, включая Mata v. Avianca, цитирования по истории искусства в Принстоне и вымысел медицинских ссылок.

OpenClawRadar
Клиент заменяет DevOps-инженера на ИИ Claude — результат: хаос
Новости

Клиент заменяет DevOps-инженера на ИИ Claude — результат: хаос

Клиент заменил DevOps-инженера на Claude AI для инфраструктуры и разработки функций. Результат: кластер Kubernetes, созданный на основе вибраций, и повторяющиеся сбои, которые были исправлены только откатом изменений Claude.

OpenClawRadar
Точность Claude Opus 4.6 снизилась в тесте на галлюцинации BridgeBench.
Новости

Точность Claude Opus 4.6 снизилась в тесте на галлюцинации BridgeBench.

Claude Opus 4.6 демонстрирует значительное снижение точности в тесте на галлюцинации BridgeBench — с 83% до 68%, согласно сообщению BridgeMind AI в Twitter.

OpenClawRadar