Qwen3.5-122B на Blackwell SM120: проблема повреждения кэша KV в формате fp8 и результаты производительности

Ключевые результаты тестирования Qwen3.5-122B на Blackwell SM120
Детальное тестирование Qwen3.5-122B на оборудовании 8x RTX PRO 6000 Blackwell (AWS g7e.48xlarge, SM120) с использованием SGLang выявило критические проблемы конфигурации и характеристики производительности. Самый важный вывод: кэш KV fp8_e4m3 не приводит к сбоям, но молчаливо выдаёт повреждённые результаты без ошибок или предупреждений — вместо правильных ответов появляются восклицательные знаки и повторения. Единственное решение — использовать кэш KV bf16.
Требования к конфигурации
Слои DeltaNet в Qwen3.5-122B добавляют ограничения, которых нет в стандартных моделях MoE. Для настройки на оборудовании SM120 потребовалось 6 конкретных флагов бэкенда Triton:
- Бэкенд внимания принудительно переведён на Triton (для слоёв DeltaNet)
- Кэш KV принудительно переведён в bf16 (fp8 портит вывод)
- Без CUDA graphs (из-за переполнения SMEM в Triton)
- Без HiCache (несовместим с DeltaNet)
Это контрастирует с тестированием M2.5 на том же оборудовании, для которого потребовалось всего 2 флага бэкенда Triton.
Бенчмарки производительности
Все тесты использовали одинаковое оборудование и методологию с SGLang nightly (cu13 20260219), TP=8:
- Пиковая скорость (токенов/с): 1 985 против 1 818 (Qwen3.5-122B против M2.5)
- Онлайн 4 rps: 310 против 404
- Онлайн 8 rps: 514 против 744
- Скорость одиночного запроса (токенов/с): ~25 (с MTP) против 72
- Качество Arena-Hard: 6,99/10 против 4,94/10 (оценка Claude Opus 4.6, не сравнимо с результатами лидерборда)
Результаты оптимизации
Из протестированных путей оптимизации только MTP (Multi-Token Prediction) существенно улучшил производительность, обеспечив ускорение обработки одиночного запроса в 2,75 раза (~9 до ~25 токенов/с). Другие оптимизации, доступные на оборудовании SM120 — FP8 KV cache, CUDA graphs и HiCache — были заблокированы ограничениями DeltaNet в Qwen3.5-122B.
Qwen3.5-122B выигрывает по пиковой пропускной способности и метрикам качества, в то время как M2.5 всё ещё выигрывает по всем метрикам устойчивого обслуживания благодаря возможности использовать оптимизации, которые блокирует DeltaNet в Qwen3.5-122B.
Полные результаты, матрица совместимости, точные команды для воспроизведения и все артефакты JSONL доступны в связанном ниже issue на GitHub.
📖 Read the full source: r/LocalLLaMA
👀 Смотрите также

Tencent проводит бесплатное мероприятие по установке OpenClaw в Шэньчжэне на фоне высокого спроса.
Tencent организовала 20 сотрудников у своего офисного здания в Шэньчжэне для бесплатной установки OpenClaw 6 марта, реагируя на сообщения о том, что люди платят более 70 долларов за услуги установки на дому. Мероприятие использовало платформу Tencent Cloud Lighthouse, большинство участников были белыми воротничками, сталкивающимися с конкуренцией на рабочем месте и давлением внедрения ИИ.

Утечка исходного кода Anthropic раскрывает незаявленные функции Claude и внутреннюю модель
Anthropic случайно слила 500 000 строк исходного кода, содержащего детали об анонсированных функциях Claude, включая фоновое выполнение KAIROS, режим сна, режим под прикрытием и внутреннюю модель под названием капибара. Это уже вторая подобная утечка в 2025 году.

约束衰减:为什么LLM代理在后端结构化代码中失败
Новое исследование вводит понятие «ограничительного затухания»: по мере накопления структурных требований производительность LLM-агентов резко падает — способные агенты теряют 30 пунктов в проценте прохождения утверждений, слабые приближаются к нулю. Практические выводы для всех, кто использует AI-агентов для написания кода.

Claude Code v2.1.89 добавляет отложенные хуки, повторную попытку разрешений и устраняет утечки памяти.
Claude Code v2.1.89 представляет разрешение 'defer' для хуков PreToolUse, добавляет хук PermissionDenied с возможностью повторной попытки и исправляет критические проблемы, включая утечки памяти при больших JSON-вводах и сбои кэша схем StructuredOutput.