Бенчмарки показывают, что дистиллированные модели соответствуют передовым LLM в структурированных задачах при 10-кратном снижении затрат.

Результаты бенчмарков: Дистиллированные vs. Передовые модели
Исследователи провели всестороннее сравнение небольших дистиллированных моделей с передовыми LLM на 9 наборах данных, охватывающих задачи классификации, вызова функций, вопросно-ответных систем и QA с открытой книгой. Все дистиллированные модели относятся к семейству Qwen3 (от 0,6B до 8B) и обучены всего на 50 примерах с использованием моделей-учителей с открытыми весами без привлечения выходных данных API передовых моделей для обучения.
Ключевые результаты производительности
- Дистиллированные модели соответствуют или превосходят лучшую передовую модель среднего уровня (<$1/MTok входных данных) на 6/9 задачах, эффективно сравниваясь на 7-й
- Text2SQL: Qwen3-4B дистиллированная достигает 98,0% против Claude Haiku 98,7%, GPT-5 nano 96,0% при $3/млн запросов против $378 и $24 соответственно
- Умный дом (вызов функций): Qwen3-0.6B набирает 98,7% против 92,0% у Gemini Flash
- HotpotQA: Дистиллированные модели набирают 92,0% против 98,0% у Haiku - открытое рассуждение с мировыми знаниями остаётся территорией передовых моделей
- Задачи классификации (Banking77, E-commerce, TREC): Дистиллированные модели находятся в пределах 0-1,5 процентных пунктов от лучшего передового варианта
Производительность вывода
Модели обслуживались через vLLM на одном H100 со следующей производительностью модели Text2SQL 4B:
- 222 RPS устойчивых
- p50: 390 мс, p95: 640 мс, p99: 870 мс
- 7,6 ГБ VRAM (BF16, без квантования)
- FP8 дал +15% пропускной способности, -44% памяти, без потери точности в кратких экспериментах
Методология
- Одинаковые тестовые наборы, одинаковые промпты, одинаковые критерии оценки для всех моделей
- Передовые модели запускались 3 раза на набор данных (указаны среднее ± стандартное отклонение), дистиллированные при temp=0
- Оценка: точное соответствие для классификации, tool_call_equivalence (сравнение JSON с нормализацией параметров по умолчанию) для вызова функций, Claude Sonnet 4.6 как LLM-судья для генерации
- Стоимость: передовые = измеренное использование токенов API × опубликованные цены (февраль 2026). Дистиллированные = H100 по $2,40/час ÷ измеренная устойчивая RPS
Практические рекомендации
- Дистилляция: структурированные задачи, чётко определённые схемы, высокий объём, требования к суверенитету данных
- API передовых моделей: широкие мировые знания, свободная генерация, низкий объём
- Лучшая настройка: маршрутизация между обоими
Доступные ресурсы
Весь код, модели, данные и скрипты оценки являются открытыми по адресу https://github.com/distil-labs/inference-efficiency-benchmarks/
Полный пост в блоге с графиками и разбивкой по наборам данных: https://www.distillabs.ai/blog/the-10x-inference-tax-you-dont-have-to-pay
📖 Read the full source: r/LocalLLaMA
👀 Смотрите также

Выпуск Claude Code 2.1.83: Кэширование промптов, проверка навыков и обновления SDK
Claude Code 2.1.83 добавляет кэширование промптов с руководством по проектированию, заменяет навык специалиста по верификации на новый навык Verify и обновляет ссылки на SDK для семи языков, включая поддержку бета-инструмента запуска для PHP.

Claude Code v2.1.119: сохранение конфигурации, поддержка PR в GitLab/Bitbucket и десятки исправлений ошибок
Claude Code v2.1.119 сохраняет настройки /config в ~/.claude/settings.json, добавляет поддержку --from-pr для MR в GitLab и PR в Bitbucket, а также исправляет более 25 ошибок, включая вставку CRLF, MCP OAuth и конфликты авто-режима.

Microsoft BitNet позволяет выполнять вывод LLM с 100 миллиардами параметров на одном процессоре.
Проект Microsoft с открытым исходным кодом BitNet обеспечивает вывод 100B-параметрической LLM со скоростью 5-7 токенов в секунду на одном CPU, при этом 2B-параметрическая модель использует 0,4 ГБ памяти и имеет задержку 29 мс, соответствуя полноразрядным моделям в тестах.
Обыденный риск: почему самые большие угрозы ИИ-безопасности скучны, а не драматичны
В эссе утверждается, что банальные сбои ИИ уже наносят масштабный ущерб, современные подходы к выравниванию слишком сильно зависят от изолированных сред, а конвергенция возможностей делает случайное попадание в открытый мир все более вероятным.