Тонкая настройка Phi-4-mini путем обучения только параметров LayerNorm не приводит к улучшению производительности.

✍️ OpenClawRadar📅 Опубликовано: 21 апреля 2026 г.🔗 Source
Тонкая настройка Phi-4-mini путем обучения только параметров LayerNorm не приводит к улучшению производительности.
Ad

Экспериментальная установка и методология

Эксперимент тестировал дообучение модели Phi-4-mini-instruct (3.8B, 32 слоя) путём обучения только параметров LayerNorm, назвав подход BALLAST. Модель запускалась на Mac Studio M3 Ultra 256GB с использованием MLX через встроенную функцию train() из mlx_lm с загрузкой GPU на 97%. Для отслеживания использовался самостоятельно размещённый W&B.

Важное замечание: Phi-4-mini использует RMSNorm, а не полный LayerNorm — только значения γ, без смещения. Автор признаёт, что опубликованные работы, показывающие положительные результаты, использовали модели с обоими параметрами γ и β, что, вероятно, важнее, чем изначально предполагалось.

Результаты тестирования

Базовые показатели для оригинальной Phi-4-mini (без обучения):

  • HumanEval pass@1: 0.646
  • MBPP pass@1: 0.558
  • MMLU acc: 0.667
  • ARC-Challenge acc_norm: 0.595
  • HellaSwag acc_norm: 0.728
  • MedQA acc: 0.545
  • GSM8K exact_match: 0.813

Эксперимент 1: Python-область

Обучение на 10K файлах из The Stack со скоростью обучения LR=5e-5 в течение 3 эпох:

  • BALLAST (196K параметров): Потери 1.39, HumanEval 0.616 (-0.030), MBPP 0.526 (-0.032)
  • LoRA-Match (180K параметров): Потери 1.30, HumanEval 0.634 (-0.012), MBPP 0.536 (-0.022)
  • LoRA-Std (11.5M параметров): Потери 1.07, HumanEval 0.439 (-0.207), MBPP 0.372 (-0.186)

LoRA-Standard показал классическое переобучение — 11.5M параметров запомнили 10K файлов вместо изучения обобщаемых паттернов. Дополнительное тестирование с LR=1e-4 для BALLAST показало снижение потерь до 1.31 с последующим ростом выше 1.44 к итерации 2300.

Ad

Эксперимент 2: Медицинский сырой текст

Обучение на 10K аннотациях из PubMed со скоростью обучения LR=5e-5 в течение 3 эпох:

  • BALLAST: MedQA 0.528 (-0.017)
  • LoRA-Match: MedQA 0.546 (+0.001)
  • LoRA-Std: MedQA 0.465 (-0.080)

Автор отмечает ошибку новичка: обучение на сырых аннотациях PubMed как предсказание следующего токена не помогает с MedQA, которая тестирует клиническое мышление через сценарии с множественным выбором.

Эксперимент 3: Медицинские вопросы-ответы с инструкциями

Исправленный формат данных с использованием 10K вопросов MedMCQA со скоростью обучения LR=1e-5 в течение 3 эпох. Формат: "Вопрос: ... A) X B) Y C) Z D) W Ответ: B"

  • BALLAST: MedQA 0.538 (-0.007)

Сводка тестирования скорости обучения

  • LR=1e-4 на Python: Превышение, потери разошлись к итерации 2300
  • LR=5e-5 на Python: Без изменений, незначительное ухудшение на тестах
  • LR=5e-5 на медицинских данных (сырой текст): Без изменений, незначительное ухудшение на MedQA
  • LR=1e-5 на медицинских данных (вопросы-ответы с инструкциями): Без изменений, незначительное ухудшение на MedQA

Ключевые выводы

Обучение только значений γ в LayerNorm не улучшает производительность ни на одном из протестированных тестов — ни на Python, ни на медицинских вопросах-ответах, ни при любой скорости обучения. Автор приходит к выводу, что трансформеры уже динамически направляют информацию через механизм внимания, поэтому нет смысла пытаться использовать LayerNorm в качестве дополнительного слоя для управления направленностью связей. В эксперименте использовалось всего 196K обучаемых параметров (0.005% модели) по сравнению с 11.5M параметрами LoRA в Phi-4-mini.

📖 Read the full source: r/LocalLLaMA

Ad

👀 Смотрите также

Qwen3.6 Plus Preview доступен бесплатно через OpenRouter для OpenClaw
Новости

Qwen3.6 Plus Preview доступен бесплатно через OpenRouter для OpenClaw

Модель Qwen3.6 Plus Preview теперь доступна бесплатно через OpenRouter для пользователей OpenClaw. Для настройки необходимо получить API-ключи от OpenRouter и настроить их в OpenClaw, при первом использовании будет предложено установить уровень мышления.

OpenClawRadar
Новый релиз OpenClaw: простое изменение имени или значительное обновление?
Новости

Новый релиз OpenClaw: простое изменение имени или значительное обновление?

OpenClaw, ранее известный как ClawDBot, претерпел трансформацию. Читайте дальше, чтобы узнать, является ли это изменение просто косметическим или же вводит новые функции и улучшенную стабильность.

OpenClawRadar
Открытие новых возможностей: использование Claude Max с Opus 4.6 в качестве API
Новости

Открытие новых возможностей: использование Claude Max с Opus 4.6 в качестве API

Откройте для себя творческий подход к использованию подписок Claude Max как API, совместимых с Opus 4.6, который был рассмотрен энтузиастами технологий в сообществе.

OpenClawRadar
CC v2.1.122: Удаление системных подсказок, обновление отладки и повышение уверенности в расписании
Новости

CC v2.1.122: Удаление системных подсказок, обновление отладки и повышение уверенности в расписании

Claude Code CC v2.1.122 удаляет отдельный подсказку для четвертой фазы в режиме плана, улучшает резервный контекст отладки демона и повышает порог уверенности для предложений /schedule с 70%+ до 85%+.

OpenClawRadar