Тонко настроенные модели Qwen3 Small превосходят передовые LLM в определенных задачах при более низкой стоимости.

Систематическое сравнение небольших дистиллированных моделей Qwen3 с передовыми API-моделями показывает, что дообученные небольшие языковые модели могут превосходить более крупные и дорогие модели в конкретных структурированных задачах.
Результаты тестирования
Исследование сравнило модели Qwen3 (от 0,6 до 8 млрд параметров) с передовыми API, включая GPT-5 nano/mini/5.2, Gemini 2.5 Flash Lite/Flash, Claude Haiku 4.5/Sonnet 4.6/Opus 4.6 и Grok 4.1 Fast/Grok 4 на 9 наборах данных. Все дистиллированные модели обучались только с использованием открытых учителей, всего на 50 примерах. Вывод выполнялся на vLLM на одном H100.
Ключевые результаты производительности
- Вызов функций для умного дома: Qwen3-0.6B достиг точности 98,7% против 92,0% у Gemini Flash
- Text2SQL: Дистиллированная Qwen3-4B получила 98,0% против 98,7% у Claude Haiku и 96,0% у GPT-5 nano
- Сравнение стоимости: Стоимость Text2SQL за миллион запросов: Qwen3-4B ~$3 против $378 у Claude Haiku и $24 у GPT-5 nano
- Задачи классификации: Дистиллированные модели показали результат в пределах 0–1,5 процентных пунктов от лучшего передового варианта на наборах данных Banking77, E-commerce и TREC
- Преимущество передовых моделей: HotpotQA (открытое рассуждение + знания о мире) — 92,0% против 98,0% у Haiku
Метрики производительности
Для Text2SQL с Qwen3-4B на H100:
- Поддерживаемая скорость: 222 RPS
- p50: 390 мс | p95: 640 мс | p99: 870 мс
- 7,6 ГБ видеопамяти (BF16, без квантования)
- FP8 дал +15% пропускной способности, −44% видеопамяти, без заметной потери точности в кратких экспериментах
Методология
- Одинаковые тестовые наборы, промпты и критерии оценки для всех моделей
- Передовые модели запускались 3 раза на каждом наборе данных (отчёт о среднем ± стандартное отклонение), дистиллированные — при temperature=0
- Оценка: точное совпадение для классификации, tool_call_equivalence (сравнение JSON с нормализацией параметров по умолчанию) для вызова функций, Claude Sonnet 4.6 как LLM-судья для задач генерации
- Расчёт стоимости: передовые модели = измеренное использование токенов × опубликованные цены (февраль 2026); дистиллированные = H100 по $2,40/час ÷ поддерживаемая RPS
Практические рекомендации
- Используйте дистиллированные модели, когда: У вас структурированные задачи, чёткие схемы, высокий объём или требования к суверенитету данных
- Используйте передовые API, когда: Нужны широкие знания о мире, свободная генерация или объём настолько низок, что стоимость не имеет значения
- Гибридный подход: Маршрутизация между двумя вариантами в зависимости от требований задачи
Доступность
Весь код, модели, данные и скрипты оценки являются открытыми на GitHub: https://github.com/distil-labs/inference-efficiency-benchmarks/
Полный анализ с графиками доступен в блоге: https://www.distillabs.ai/blog/the-10x-inference-tax-you-dont-have-to-pay
📖 Read the full source: r/LocalLLaMA
👀 Смотрите также

Клиент заменяет DevOps-инженера на ИИ Claude — результат: хаос
Клиент заменил DevOps-инженера на Claude AI для инфраструктуры и разработки функций. Результат: кластер Kubernetes, созданный на основе вибраций, и повторяющиеся сбои, которые были исправлены только откатом изменений Claude.

Соучредитель Super Micro среди троих обвиняемых в деле об экспорте технологий ИИ.
Три человека, включая сооснователя Super Micro Computer Чарльза Лянга, обвинены властями США в планировании незаконного экспорта технологий искусственного интеллекта в Китай. Дело связано с предполагаемыми нарушениями законов об экспортном контроле.

Протестированы 1-битные модели Qwen от PrismML Bonsai: генерация 107 токенов в секунду на 8 ГБ видеопамяти.
Модели Bonsai от PrismML — это 1-битные квантованные версии Qwen3 8B, 4B и 1.7B, которые достигают скорости генерации 107 токенов в секунду и обработки промптов >1114 т/с на RTX 4060 с 8 ГБ видеопамяти, при значительно сниженных требованиях к памяти.

Subquadratic представляет 12-миллионное окно контекста для ИИ-моделей
Subquadratic выпускает окно контекста на 12 миллионов токенов, побив предыдущие ограничения для вывода LLM и обеспечивая обработку целых кодовых баз за один проход.