Как небольшие подсказки для оценки моделей могут вводить в заблуждение и как это исправить

✍️ OpenClawRadar📅 Опубликовано: 9 марта 2026 г.🔗 Source
Как небольшие подсказки для оценки моделей могут вводить в заблуждение и как это исправить
Ad

Подробный анализ на r/LocalLLaMA объясняет, почему промпты для оценки небольших моделей (например, с 7 или 12 миллиардами параметров) часто дают вводящие в заблуждение, излишне оптимистичные оценки, которые не соответствуют реальному качеству вывода. Основная проблема заключается не в возможностях модели, а в том, как промпты активируют различные когнитивные пути в архитектуре трансформеров.

Три когнитивных режима трансформеров

В посте выделяются три функциональных пути, которые модели используют в зависимости от языка промпта:

  • Измерение 1 (D1) — Фактическое воспроизведение: Активируется вопросами типа «Что такое...», «Дайте определение...», «Когда произошло...». Модель извлекает знания, полученные во время обучения. Для задач оценки это в основном нерелевантно.
  • Измерение 2 (D2) — Применение и следование инструкциям: Активируется языком типа «Проанализируйте...», «Классифицируйте...», «Примените эти критерии...». Модель применяет явные правила, следует структурированным инструкциям и классифицирует входные данные по предоставленным критериям. Это надёжный путь, где небольшие модели действительно компетентны.
  • Измерение 3 (D3) — Эмоциональный и эмпатический вывод: Активируется языком типа «Как это должно ощущаться?», «Какая эмоциональная реакция уместна?», «Как эмпатичный помощник...». Модель выводит невысказанный эмоциональный контекст и делает нормативные суждения о том, как всё «должно» ощущаться, направляясь через кондиционирование RLHF, а не на основе доказательств в промпте. Небольшие модели здесь ненадёжны, с постоянным смещением в сторону позитивных и поддерживающих ответов независимо от фактического содержания.

Суть маршрутизации

Ключевое понимание: «Проанализируйте эмоциональное содержание» активирует D2 (модель смотрит на текст и классифицирует его), тогда как «Что должен чувствовать пользователь?» активирует D3 (модель угадывает, что сказал бы полезный ИИ). Эти вопросы кажутся эквивалентными, но дают систематически разные результаты.

Ad

Конкретный пример неудачи

Автор эмпирически проверил это с помощью анализатора настроений Mistral 7B для системы разговорного ИИ. Исходный промпт (упрощённый):

Вы — эмпатичный ИИ-компаньон, анализирующий эмоциональное содержание. Проанализируйте это сообщение и верните: { "tone": "тёплый, нежный, благодарный", "intensity": от 0.0 до 1.0, "descriptors": ["пример1", "пример2"] }

Что произошло: Нейтральные сообщения возвращали слегка позитивный тон. Слегка негативные сообщения оценивались как нейтральные или слегка позитивные. Значения интенсивности для негативного контента были стабильно ниже, чем значения интенсивности для эквивалентного позитивного контента. Это систематическое, воспроизводимое смещение называется положительный фантомный дрейф — кондиционирование RLHF модели тянет выводы в сторону поддерживающих, позитивных ответов независимо от фактического содержания ввода.

Три вещи вызвали эту неудачу:

  • «Эмпатичный ИИ-компаньон» активировал D3, переводя модель на путь социальных ожиданий
  • Примеры значений в шаблоне JSON («тёплый, нежный, благодарный») настраивали модель на позитивные выводы
  • Модель генерировала то, что сказал бы полезный ИИ, а не анализировала доказательства

В посте подчёркивается, что небольшие модели могут хорошо справляться с задачами оценки, когда промпты целенаправленно активируют D2 (применение/следование инструкциям), а не D3 (эмоциональный вывод). Разница между «Проанализируйте эмоциональное содержание» и «Что должен чувствовать пользователь?» определяет, получите ли вы надёжную классификацию или предвзятые ответы, основанные на социальных ожиданиях.

📖 Read the full source: r/LocalLLaMA

Ad

👀 Смотрите также

别再问该用哪个AI模型:将任务分流至Haiku、Sonnet和Opus层级
Гайды

别再问该用哪个AI模型:将任务分流至Haiku、Sonnet和Opus层级

Используйте как минимум три модели в зависимости от типа задачи: уровень Haiku для чтения и обобщения, уровень Sonnet для написания кода и уровень Opus только для многофайловых рефакторингов и отладки. Один пользователь распределяет 40% запросов на дешёвые модели, 35% на средние, 25% на передовые, тратя около 30–40 долларов в месяц.

OpenClawRadar
Репозиторий ClaudeBusiness: Шаблоны для ведения реального бизнеса с помощью Claude Code
Гайды

Репозиторий ClaudeBusiness: Шаблоны для ведения реального бизнеса с помощью Claude Code

GitHub-репозиторий, собирающий практические шаблоны, фреймворки и ограничения из более чем 35 тредов Reddit, где основатели используют Claude для управления сервисными агентствами и сольными SaaS-проектами.

OpenClawRadar
Исправление проблемы с сервисом рабочей области Claude Desktop в Windows 11 Home
Гайды

Исправление проблемы с сервисом рабочей области Claude Desktop в Windows 11 Home

Сообщество разработало исправление для ошибки 'VM service not running' в функции рабочего пространства Claude Desktop на Windows 11 Home, предлагая ручные команды PowerShell и автоматизированный инструмент на GitHub.

OpenClawRadar
Локальная настройка Claude Code с использованием Qwen3.5 27B через llama.cpp
Гайды

Локальная настройка Claude Code с использованием Qwen3.5 27B через llama.cpp

Разработчик делится своей конфигурацией для локального запуска Claude Code с использованием Qwen3.5 27B и llama.cpp, включая переменные окружения, параметры сервера и результаты тестирования производительности в семи задачах по программированию.

OpenClawRadar