Бенчмарки спекулятивного декодирования на RTX 3090 с моделями Qwen для бизнес-применений в сфере HVAC

Аппаратное обеспечение и настройка
Разработчик использовал RTX 3090 24 ГБ, Ryzen 7600X, 32 ГБ ОЗУ и WSL2 Ubuntu. Он перешёл с Ollama на Windows на llama.cpp на WSL Linux со спекулятивным декодированием для внутренней AI-платформы, обрабатывающей поиск клиентов, форматирование предложений, исследование оборудования и разбор неструктурированных заметок о задачах.
Методология тестирования
Они протестировали 16 моделей GGUF из семейств Qwen2.5, Qwen3 и Qwen3.5, все комбинации целевых и черновых моделей, которые помещаются в 24 ГБ видеопамяти, кросс-генерационные пары черновых моделей (черновые модели Qwen2.5 на целевых моделях Qwen3 и наоборот), и отслеживали видеопамять для каждой комбинации, чтобы выявить оффлоадинг на ЦП. Оценка качества проводилась на реальных запросах HVAC-бизнеса для генерации SQL, форматирования предложений, разбора неструктурированных полевых заметок и анализа совместимости оборудования. Они использовали draftbench и llama-throughput-lab для замеров скорости, автоматизируя процесс с помощью Claude Code в течение ночи.
Лучшие результаты по скорости
- Qwen3-8B Q8_0 + Qwen3-1.7B Q4_K_M: 279,9 ток/сек (+236% ускорение, 13,6 ГБ видеопамяти)
- Qwen2.5-7B Q4_K_M + Qwen2.5-0.5B Q8_0: 205,4 ток/сек (+50% ускорение, ~6 ГБ видеопамяти)
- Qwen3-8B Q8_0 + Qwen3-0.6B Q4_0: 190,5 ток/сек (+129% ускорение, 12,9 ГБ видеопамяти)
- Qwen3-14B Q4_K_M + Qwen3-0.6B Q4_0: 159,1 ток/сек (+115% ускорение, 13,5 ГБ видеопамяти)
- Qwen2.5-14B Q8_0 + Qwen2.5-0.5B Q4_K_M: 137,5 ток/сек (+186% ускорение, ~16 ГБ видеопамяти)
- Qwen3.5-35B-A3B Q4_K_M (базовая, без черновой модели): 133,6 ток/сек (22 ГБ видеопамяти)
- Qwen2.5-32B Q4_K_M + Qwen2.5-1.5B Q4_K_M: 91,0 ток/сек (+156% ускорение, ~20 ГБ видеопамяти)
Комбинация Qwen3-8B + черновая модель 1,7B достигла 100% уровня принятия — идеальное совпадение черновой модели, где 1,7B точно предсказывает то, что сгенерировала бы 8B.
Проблема с режимом мышления Qwen3.5
Модели Qwen3.5 по умолчанию входят в режим мышления в llama.cpp, генерируя скрытые токены рассуждений перед ответом. Это вызывало нестабильные результаты бенчмарков: 0 ток/сек чередовались с 700 ток/сек, TTFT прыгал между 1 с и 28 с. Только три метода сработали для его отключения:
--jinja+ исправленный шаблон чата с жёстко заданнымenable_thinking=false✅- Сырой эндпоинт
/completion(полностью обходит шаблон чата) ✅ - Всё остальное (системные промпты, суффикс
/no_think, трюки с температурой) ❌
Если запускаете Qwen3.5 на llama.cpp, вам нужен исправленный шаблон, иначе получите некорректные бенчмарки.
Результаты оценки качества
Они запустили четыре сложных HVAC-специфичных промпта, тестирующих неоднозначные запросы клиентов, сложные предложения, неструктурированные заметки с опечатками и анализ совместимости оборудования. Ключевые выводы:
- Каждая модель провалила математику формулы ценообразования: 8B, 14B, 32B, 35B — ни одна не смогла правильно вычислить $4,811 / (1 - 0,47) = $9,077. LLM не могут надёжно выполнять бизнес-математику — размещайте свои формулы в коде.
- Модель 8B справилась с 3 из 4 сложных промптов — хорошо показала себя на неоднозначных запросах, неструктурированных заметках, ежедневных задачах — но провалила технический анализ оборудования.
- Модель 35B-A3B была единственной с реальными знаниями в области HVAC — правильно подобрала мощность мини-сплита для неутеплённого гаража в Чикаго, знала, что для холодного климата нужно рекомендовать серию Hyper-Heat, правильно указала, что для однозонной системы не нужен распределительный бокс — но пропустила номер модели в неструктурированных заметках и провалила математику.
- Больше ≠ лучше во всём: Qwen3-14B Q4_K_M (159 ток/сек) показала худшие результаты, чем 8B, на большинстве промптов. Модель 32B рекомендовала 5-тонную установку для гаража площадью 400 кв. футов.
- Qwen2.5-7B галлюцинировала на каждом тесте разбора заметок — постоянно выдумывала детали.
📖 Прочитать полный источник: r/LocalLLaMA
👀 Смотрите также

Создание менеджера буфера обмена для macOS с помощью Claude: Практический пример рабочего процесса
Разработчик создал Buffer — менеджер буфера обмена с открытым исходным кодом для macOS, используя Claude в качестве партнёра по планированию и парному программированию. Он обнаружил, что начинать с планов реализации перед написанием кода сокращает количество бесполезных запросов и отладки.

Фреймворк Autoevolve использует код Claude для разработки игрового ИИ через эволюцию в процессе самоигры.
Разработчик использовал исключительно Claude Code для участия в Game AI Cup, заняв 6-е место из 83 участников после 130 автоматизированных итераций. Фреймворк autoevolve реализует цикл самообучающейся эволюции, в котором Claude анализирует производительность бота, предлагает изменения и сравнивает новые версии с предыдущими.

Общая память превращает ИИ-агентов в офисных политиков: один агент пишет обзоры производительности
Разработчик создал систему общей памяти для ИИ-агентов. Вместо повышения эффективности исследовательский агент начал сохранять критику в адрес агента-программиста — создав «ИИ-рабочее место с HR».

Перенос логики ИИ-агента в YAML: запуск из Telegram, VS Code и CLI
Разработчик перенес бизнес-логику своего ИИ-агента из OpenClaw в YAML-файл, используя OE Runtime в качестве HTTP-сервера. Тот же agent.yaml теперь работает из Telegram, VS Code, CLI и HTTP без дублирования.