Настройка Qwen3.5-27B локально: сравнение vLLM и llama.cpp

Производительность и возможности Qwen3.5-27B
Модель Qwen3.5-27B демонстрирует высокую производительность в различных тестах согласно источнику: MMLU-Pro: 85.3, MMLU-Redux: 93.3, C-Eval: 90.2, общий показатель интеллекта: 42.1 (лучше, чем 91% сравниваемых моделей), и индекс программирования: 34.9 (превосходит 88% по возможностям кодирования). Модель имеет плотную архитектуру с нативным контекстом 262k, расширяемым до 1M+ токенов.
Сравнение бэкендов: llama.cpp vs vLLM
Источник сравнивает два основных подхода для локального развертывания:
Вариант 1: llama.cpp
- Преимущества: Низкое потребление ресурсов, простая настройка, поддерживает q4 KV кэш для разумного использования VRAM
- Недостатки: Серьезная проблема со случайным очищением KV кэша, что заставляет полностью переобрабатывать промпт в середине сессии. Спекулятивный декодинг через MTP не работает. Известная ошибка без надежных исправлений.
Вариант 2: vLLM
- Преимущества: Стабильные сессии, нет очистки KV кэша, поддерживает спекулятивный декодинг с MTP для более быстрой генерации
- Недостатки: Нет поддержки q4 KV, поэтому VRAM резко возрастает при контексте 256k. Парсинг вызовов инструментов работает с ошибками для Qwen3.5 в v0.17.1, исправления есть в открытых PR на GitHub, но еще не влиты. Это нарушает агентские потоки кодирования с некорректными JSON выходами.
Рекомендуемая конфигурация vLLM
Источник предоставляет конкретные рекомендации по настройке для стабильной и быстрой работы с моделью из HF: osoleve/Qwen3.5-27B-Text-NVFP4-MTP:
- Используйте бэкенд flashinfer cutlass для оптимизированной производительности
- Установите окно контекста на 128k (баланс между VRAM и удобством; увеличьте до 256k при наличии оборудования)
- Ограничьте использование GPU до 0.82, чтобы избежать сбоев из-за нехватки памяти
- Установите max-num-seq на 2 (хорошо обрабатывает одну сессию без перегрузки)
- Включите спекулятивный декодинг MTP для улучшения скорости
- Пропатчите vLLM исправлениями парсинга вызовов инструментов Qwen из открытых PR
- Используйте Claude code cli - в открытом коде все еще есть проблемы с парсингом вызовов инструментов, которые не проявляются в Claude code после патча
Результаты производительности
Согласно источнику, производительность зависит от оборудования:
- На RTX 5090 (32GB VRAM): ~50 TPS
- На RTX Pro 6000 (96GB VRAM): 70 TPS при полном контексте 256k
📖 Read the full source: r/LocalLLaMA
👀 Смотрите также

Проблемы и решения при установке NemoClaw на Windows
Установка NemoClaw на Windows завершается сбоем с тремя конкретными ошибками: неподдерживаемая среда в Git Bash, порт 18789 уже используется, и сборка Docker не удаётся при установке OpenClaw. Основная причина в том, что NemoClaw не был разработан с учётом Windows, для успешной настройки требуется WSL2 Ubuntu.

Советы по настройке OpenClaw из опыта пользователя: Gmail MCP, флаги профиля и проблемы с сетью
Пользователь, запускающий OpenClaw на Mac через UTM с виртуальной машиной Ubuntu, делится конкретными проблемами конфигурации, с которыми столкнулся: сервер Gmail MCP требует параметр html_body вместо body, необходим флаг --profile prod, чтобы избежать жестко заданной dev-идентичности, а API-ключи должны размещаться в auth-profiles.json с помощью команды paste-token.

Охота на баги: Сбои WireGuard и несоответствие MTU в GKE
Инженеры Lovable отследили пользовательские ошибки до крахов anetd из-за паники конкурентного доступа к карте в интеграции WireGuard от Google, а затем обнаружили вторичное несоответствие MTU после отключения шифрования.

OpenClaw 102: Обновленные рекомендации по настройке для безопасности и эффективности
Пользователь Reddit делится обновленными рекомендациями по настройке OpenClaw, включая шифрование API-ключей с помощью скриптов Windows PowerShell, защиту от инъекций промптов в AGENTS.md, использование Tailscale для удаленного доступа и правила против зацикливания для предотвращения повторяющихся сбоев.