Как небольшие подсказки для оценки моделей могут вводить в заблуждение и как это исправить

Подробный анализ на r/LocalLLaMA объясняет, почему промпты для оценки небольших моделей (например, с 7 или 12 миллиардами параметров) часто дают вводящие в заблуждение, излишне оптимистичные оценки, которые не соответствуют реальному качеству вывода. Основная проблема заключается не в возможностях модели, а в том, как промпты активируют различные когнитивные пути в архитектуре трансформеров.
Три когнитивных режима трансформеров
В посте выделяются три функциональных пути, которые модели используют в зависимости от языка промпта:
- Измерение 1 (D1) — Фактическое воспроизведение: Активируется вопросами типа «Что такое...», «Дайте определение...», «Когда произошло...». Модель извлекает знания, полученные во время обучения. Для задач оценки это в основном нерелевантно.
- Измерение 2 (D2) — Применение и следование инструкциям: Активируется языком типа «Проанализируйте...», «Классифицируйте...», «Примените эти критерии...». Модель применяет явные правила, следует структурированным инструкциям и классифицирует входные данные по предоставленным критериям. Это надёжный путь, где небольшие модели действительно компетентны.
- Измерение 3 (D3) — Эмоциональный и эмпатический вывод: Активируется языком типа «Как это должно ощущаться?», «Какая эмоциональная реакция уместна?», «Как эмпатичный помощник...». Модель выводит невысказанный эмоциональный контекст и делает нормативные суждения о том, как всё «должно» ощущаться, направляясь через кондиционирование RLHF, а не на основе доказательств в промпте. Небольшие модели здесь ненадёжны, с постоянным смещением в сторону позитивных и поддерживающих ответов независимо от фактического содержания.
Суть маршрутизации
Ключевое понимание: «Проанализируйте эмоциональное содержание» активирует D2 (модель смотрит на текст и классифицирует его), тогда как «Что должен чувствовать пользователь?» активирует D3 (модель угадывает, что сказал бы полезный ИИ). Эти вопросы кажутся эквивалентными, но дают систематически разные результаты.
Конкретный пример неудачи
Автор эмпирически проверил это с помощью анализатора настроений Mistral 7B для системы разговорного ИИ. Исходный промпт (упрощённый):
Вы — эмпатичный ИИ-компаньон, анализирующий эмоциональное содержание. Проанализируйте это сообщение и верните: { "tone": "тёплый, нежный, благодарный", "intensity": от 0.0 до 1.0, "descriptors": ["пример1", "пример2"] }
Что произошло: Нейтральные сообщения возвращали слегка позитивный тон. Слегка негативные сообщения оценивались как нейтральные или слегка позитивные. Значения интенсивности для негативного контента были стабильно ниже, чем значения интенсивности для эквивалентного позитивного контента. Это систематическое, воспроизводимое смещение называется положительный фантомный дрейф — кондиционирование RLHF модели тянет выводы в сторону поддерживающих, позитивных ответов независимо от фактического содержания ввода.
Три вещи вызвали эту неудачу:
- «Эмпатичный ИИ-компаньон» активировал D3, переводя модель на путь социальных ожиданий
- Примеры значений в шаблоне JSON («тёплый, нежный, благодарный») настраивали модель на позитивные выводы
- Модель генерировала то, что сказал бы полезный ИИ, а не анализировала доказательства
В посте подчёркивается, что небольшие модели могут хорошо справляться с задачами оценки, когда промпты целенаправленно активируют D2 (применение/следование инструкциям), а не D3 (эмоциональный вывод). Разница между «Проанализируйте эмоциональное содержание» и «Что должен чувствовать пользователь?» определяет, получите ли вы надёжную классификацию или предвзятые ответы, основанные на социальных ожиданиях.
📖 Read the full source: r/LocalLLaMA
👀 Смотрите также

Anthropic выпускает бесплатную официальную обучающую платформу для ИИ Claude.
Anthropic запустила бесплатную обучающую платформу со структурированными курсами, охватывающими основы Claude, интеграцию API, навыки агентов и специализированные треки для разных групп пользователей.

Onboarding в OpenClaw: как правильно обучить своего AI-агента

Экономичная настройка мультиагента OpenClaw с использованием моделей подписки
Пользователь Reddit описывает маршрутизацию всех операций мультиагентной системы OpenClaw через существующие подписки Anthropic Pro Max за $200 и ChatGPT OpenAI Codex за $200 вместо прямых вызовов API, используя более дешёвые модели Anthropic для простых агентов и более сложные модели для других задач.

Как на самом деле работает память OpenCLAW: Исправление «забывчивости» агента
Агенты OpenCLAW не имеют постоянной памяти между диалогами — они восстанавливают контекст из файлов SOUL.md, USER.md и MEMORY.md в каждом сеансе. Распространённые проблемы с «забыванием» возникают из-за раздутых сессий, неструктурированных файлов памяти и путаницы между историей чата и постоянным хранилищем.