Qwen3.5-122B на Blackwell SM120: проблема повреждения кэша KV в формате fp8 и результаты производительности

Ключевые результаты тестирования Qwen3.5-122B на Blackwell SM120
Детальное тестирование Qwen3.5-122B на оборудовании 8x RTX PRO 6000 Blackwell (AWS g7e.48xlarge, SM120) с использованием SGLang выявило критические проблемы конфигурации и характеристики производительности. Самый важный вывод: кэш KV fp8_e4m3 не приводит к сбоям, но молчаливо выдаёт повреждённые результаты без ошибок или предупреждений — вместо правильных ответов появляются восклицательные знаки и повторения. Единственное решение — использовать кэш KV bf16.
Требования к конфигурации
Слои DeltaNet в Qwen3.5-122B добавляют ограничения, которых нет в стандартных моделях MoE. Для настройки на оборудовании SM120 потребовалось 6 конкретных флагов бэкенда Triton:
- Бэкенд внимания принудительно переведён на Triton (для слоёв DeltaNet)
- Кэш KV принудительно переведён в bf16 (fp8 портит вывод)
- Без CUDA graphs (из-за переполнения SMEM в Triton)
- Без HiCache (несовместим с DeltaNet)
Это контрастирует с тестированием M2.5 на том же оборудовании, для которого потребовалось всего 2 флага бэкенда Triton.
Бенчмарки производительности
Все тесты использовали одинаковое оборудование и методологию с SGLang nightly (cu13 20260219), TP=8:
- Пиковая скорость (токенов/с): 1 985 против 1 818 (Qwen3.5-122B против M2.5)
- Онлайн 4 rps: 310 против 404
- Онлайн 8 rps: 514 против 744
- Скорость одиночного запроса (токенов/с): ~25 (с MTP) против 72
- Качество Arena-Hard: 6,99/10 против 4,94/10 (оценка Claude Opus 4.6, не сравнимо с результатами лидерборда)
Результаты оптимизации
Из протестированных путей оптимизации только MTP (Multi-Token Prediction) существенно улучшил производительность, обеспечив ускорение обработки одиночного запроса в 2,75 раза (~9 до ~25 токенов/с). Другие оптимизации, доступные на оборудовании SM120 — FP8 KV cache, CUDA graphs и HiCache — были заблокированы ограничениями DeltaNet в Qwen3.5-122B.
Qwen3.5-122B выигрывает по пиковой пропускной способности и метрикам качества, в то время как M2.5 всё ещё выигрывает по всем метрикам устойчивого обслуживания благодаря возможности использовать оптимизации, которые блокирует DeltaNet в Qwen3.5-122B.
Полные результаты, матрица совместимости, точные команды для воспроизведения и все артефакты JSONL доступны в связанном ниже issue на GitHub.
📖 Read the full source: r/LocalLLaMA
👀 Смотрите также

Claude Code v2.1.152: /code-review --fix, плагин disallowed-tools, хук MessageDisplay
Claude Code v2.1.152 представляет /code-review --fix для применения предложений к вашему рабочему дереву, /reload-skills, хук MessageDisplay и запрещенные инструменты плагинов в frontmatter. Также исправления деградации стилей в длительных сессиях, дедупликации MCP и отчетности кэша.

Ошибка в коде Claude заменяет немецкие умлауты на ASCII-заменители.
С декабря 2025 года Claude Code и приложение Claude.ai случайным образом заменяют немецкие умлауты (ä, ö, ü, ß) на ASCII-заменители (ae, oe, ue, ss). Ошибка сохраняется, несмотря на явные указания, и остаётся неисправленной уже более 3 месяцев без ответа от службы поддержки Anthropic.
Claude AI открывает объединенный PR для исправления ошибки magic-link, пока разработчик спит
Пользователь Reddit сообщает, что Claude AI автоматически исправил баг с magic-link в продакшене в 4:46 утра — шаг trim/lowercase перенесен перед регулярным выражением проверки email — PR принят без изменений.

Claude Code v2.1.139 добавляет Agent View, команду /goal и крупные улучшения MCP
Claude Code v2.1.139 представляет новый режим агента для управления сессиями, команду /goal для многозадачных задач, расширенные возможности хуков и исправления проблем с памятью MCP-сервера и повреждением терминала.