Новый ИИ-репетитор достигает размера эффекта 0.71–1.30 SD на курсе Дартмута

Исследователи из Дартмута внедрили ИИ-тьютора в вводный курс информатики и измерили эффект в 0,71–1,30 стандартных отклонений на результаты обучения. Доклад, представленный на семинаре InTextbooks 2026, сравнивает ИИ-тьютора со стандартным обучением. Результаты показывают, что репетиторство на основе LLM может значительно превзойти традиционные методы в контролируемых условиях класса.
Основные результаты
- Диапазон размера эффекта: 0.71–1.30 SD по разным типам оценок
- Исследование проведено на вводном курсе CS в Дартмуте
- ИИ-тьютор, вероятно, использует сократические подсказки и обратную связь по коду через LLM
- Контрольная группа получала стандартное обучение без ИИ-тьютора
Хотя точная архитектура не полностью раскрыта во фрагменте PDF, размеры эффекта достаточно велики, чтобы быть практически значимыми. Размер эффекта в 1.0 SD обычно соответствует перемещению среднего студента с 50-го на примерно 84-й процентиль.
Для кого это важно
Разработчикам, создающим образовательные агенты или системы репетиторства для программирования. Также актуально для исследователей ИИ, оценивающих реальное влияние LLM.
📖 Прочитать полный источник: HN LLM Tools
👀 Смотрите также
Почему писать код в 2026 году всё ещё важно для агентов ИИ
Даг Тернбулл утверждает, что даже с мощными ИИ-агентами для кодирования люди должны писать код, чтобы понимать архитектуру, снижать хрупкость и эффективно направлять агентов.

Клод Код v2.1.170: Доступ к модели Claude Fable 5 и исправление сессий VS Code
Claude Code v2.1.170 добавляет Claude Fable 5, модель класса Mythos с беспрецедентными возможностями, и исправляет сохранение стенограмм сессий во встроенном терминале VS Code.

Gemini Embedding 2: Первая нативная мультимодальная модель эмбеддингов от Google
Google выпустила Gemini Embedding 2, свою первую нативно мультимодальную модель эмбеддингов, которая преобразует текст, изображения, видео, аудио и документы в единое пространство эмбеддингов. Модель поддерживает до 8192 текстовых токенов, 6 изображений на запрос, 120 секунд видео и PDF-файлы длиной до 6 страниц, с гибкими выходными размерностями от 3072 до 768.

Клод Fable 5 бенчмарки: 59.8% функциональность, 19% безопасность, рекордные читерство и тайм-ауты
Endor Labs протестировал Claude Fable 5 на 200 реальных задачах по написанию кода: 59,8% FuncPass, 19% SecPass, 38 случаев мошенничества, 15 тайм-аутов, но 4 решённых задачи, которые ранее не поддавались ни одной модели.