DeepSeek-V4-Flash W4A16+FP8 с MTP-самоспекуляцией: 85 ток/с на 2x RTX PRO 6000 Max-Q

✍️ OpenClawRadar📅 Опубликовано: 10 мая 2026 г.🔗 Source
DeepSeek-V4-Flash W4A16+FP8 с MTP-самоспекуляцией: 85 ток/с на 2x RTX PRO 6000 Max-Q
Ad

DeepSeek-V4-Flash работает со скоростью 85.52 ток/с @ контекст 524k и ~111 ток/с @ 128k однопоточный на 2× RTX PRO 6000 Max-Q (по 96 ГБ каждый, без NVLink). Квант использует основу pasta-paul W4A16-FP8, но с доработанной головой MTP (оригинальный квант молча удаляет MTP при загрузке). Ключевые детали ниже.

Тесты производительности

  • База pasta-paul, без MTP, 524k: 52.85 ток/с, 91 мс TTFT (эталон)
  • Эта модель, 524k двухпоточный: 85.52 ток/с, 155 мс TTFT (+62%)
  • Эта модель, 128k однопоточный: ~111 ток/с, ~310 мс TTFT (+110%)
  • Проверочные тесты (маленькие выборки): GSM8K 93%, MMLU 53%, HumanEval (синтаксический) 90%

Детали квантования

  • 768 тензоров маршрутизируемых экспертов (256 экспертов × {w1, w2, w3}): W4A16 INT4 группа=128 сим, GPTQ (Frantar с Холецким H⁻¹). Калибровка на 256 промптах из ultrachat_200k × 256 макс_токенов – 17 701 дампов прямого прохода MTP, 473k токенов.
  • 5 проекций внимания: FP8_BLOCK (вышестоящие FP8 веса, переименованные scale → weight_scale для совместимости с compressed-tensors).
  • Общие эксперты, e_proj, h_proj, нормы, gate, attn_sink: BF16 / FP32.
Ad

Исправления для Max-Q

Передайте --disable-custom-all-reduce на рабочих станциях Max-Q (без NVLink). CustomAllreduce от vLLM использует CUDA P2P и зависает на топологии только PCIe. Настройка NCCL для более низкого TTFT (~91 мс против ~155 мс):

NCCL_PROTO=LL NCCL_ALGO=Ring NCCL_MIN_NCHANNELS=8 NCCL_NTHREADS=512

Как запустить

Требуется модифицированный форк vLLM из рабочего пространства pasta-paul с патчами MTP. Пример команды:

vllm serve LordNeel/DeepSeek-V4-Flash-Acti-MTP-W4A16-FP8 \
--tensor-parallel-size 2 --kv-cache-dtype fp8 --block-size 256 \
--max-model-len 524288 --max-num-seqs 2 \
--gpu-memory-utilization 0.93 \
--tokenizer-mode deepseek_v4 \
--tool-call-parser deepseek_v4 --enable-auto-tool-choice \
--reasoning-parser deepseek_v4 \
--trust-remote-code \
--disable-custom-all-reduce \
--speculative-config '{"method":"mtp","num_speculative_tokens":1}' \
--host 0.0.0.0 --port 8000

Модель также включает файл AGENTS.md с руководством по настройке через AI-агентов (Claude/Codex/Cursor).

📖 Read the full source: r/LocalLLaMA

Ad

👀 Смотрите также

Клод: Навыки кодирования vs. Пользовательские агенты: Ментальная модель, основанная на постоянстве задач
Гайды

Клод: Навыки кодирования vs. Пользовательские агенты: Ментальная модель, основанная на постоянстве задач

Пользователь Reddit объясняет разницу между навыками Claude Code и пользовательскими агентами: навыки выполняют одни и те же шаги каждый раз, в то время как пользовательские агенты требуют рассуждений и адаптации. В посте также рассматриваются параллельные подчинённые агенты, делегирование, хуки и строительные блоки.

OpenClawRadar
Советы по настройке OpenClaw из опыта пользователя: Gmail MCP, флаги профиля и проблемы с сетью
Гайды

Советы по настройке OpenClaw из опыта пользователя: Gmail MCP, флаги профиля и проблемы с сетью

Пользователь, запускающий OpenClaw на Mac через UTM с виртуальной машиной Ubuntu, делится конкретными проблемами конфигурации, с которыми столкнулся: сервер Gmail MCP требует параметр html_body вместо body, необходим флаг --profile prod, чтобы избежать жестко заданной dev-идентичности, а API-ключи должны размещаться в auth-profiles.json с помощью команды paste-token.

OpenClawRadar
Масштабирование агентного кодирования до 150+ PR в неделю: уроки от $85K токенов в Lovable
Гайды

Масштабирование агентного кодирования до 150+ PR в неделю: уроки от $85K токенов в Lovable

Александр Лебедев рассказывает, как он масштабировал процесс с 20–30 PR в неделю с одним человеком до 150+ PR в неделю с роем ИИ-агентов, потратив $85K на токены с января. Ключевые уроки: классификация рисков, замена ручного код-ревью на ИИ и проблема сохранения распространения знаний.

OpenClawRadar
12GB VRAM 基准测试:在 RTX 4070 Super 上运行 Qwen 3.6 和 Gemma 4 模型
Гайды

12GB VRAM 基准测试:在 RTX 4070 Super 上运行 Qwen 3.6 和 Gemma 4 模型

Пользователь Reddit делится подробными бенчмарками скорости для Qwen3.6-35B-A3B, Qwen3.6-27B, Gemma 4 26B и Gemma 4 31B на 12 ГБ RTX 4070 Super с оптимизированными настройками llama.cpp.

OpenClawRadar