DeepSeek-V4-Flash W4A16+FP8과 MTP 자기추측: 2x RTX PRO 6000 Max-Q에서 85 tok/s

✍️ OpenClawRadar📅 게시일: May 10, 2026🔗 Source
DeepSeek-V4-Flash W4A16+FP8과 MTP 자기추측: 2x RTX PRO 6000 Max-Q에서 85 tok/s
Ad

DeepSeek-V4-Flash가 2× RTX PRO 6000 Max-Q(각 96GB, NVLink 없음)에서 524k 컨텍스트에서 85.52 tok/s, 128k 단일 스트림에서 약 111 tok/s로 실행됩니다. 이 양자화는 pasta-paul의 W4A16-FP8 베이스를 사용하지만, MTP 헤드가 개조되었습니다(원래 양자화는 로드 시 MTP를 자동으로 제거합니다). 주요 세부 사항은 아래와 같습니다.

벤치마크

  • pasta-paul 베이스, MTP 없음, 524k: 52.85 tok/s, 91 ms TTFT (참조)
  • 이 모델, 524k 2-스트림: 85.52 tok/s, 155 ms TTFT (+62%)
  • 이 모델, 128k 단일 스트림: ~111 tok/s, ~310 ms TTFT (+110%)
  • 기본 벤치마크 (소규모 샘플): GSM8K 93%, MMLU 53%, HumanEval (구문) 90%

양자화 세부 사항

  • 768 라우팅된 전문가 텐서 (256 전문가 × {w1, w2, w3}): W4A16 INT4 group=128 sym, GPTQ (Cholesky H⁻¹을 사용한 Frantar). 256개의 ultrachat_200k 프롬프트 × 256 max_tokens로 보정 – 17,701 MTP 전방 덤프, 473k 토큰.
  • 5개의 어텐션 프로젝션: FP8_BLOCK (업스트림 FP8 가중치, 압축 텐서 호환성을 위해 scale → weight_scale로 이름 변경).
  • 공유 전문가, e_proj, h_proj, norms, gate, attn_sink: BF16 / FP32.

Max-Q 특정 수정 사항

Max-Q 워크스테이션 카드(NVLink 없음)에서 --disable-custom-all-reduce를 전달하세요. vLLM의 CustomAllreduce는 CUDA P2P를 사용하며 PCIe 전용 토폴로지에서 교착 상태에 빠집니다. TTFT를 낮추기 위한 NCCL 튜닝(~91 ms 대 ~155 ms):

NCCL_PROTO=LL NCCL_ALGO=Ring NCCL_MIN_NCHANNELS=8 NCCL_NTHREADS=512
Ad

실행 방법

MTP 패치가 포함된 pasta-paul의 워크스페이스의 패치된 vLLM 포크가 필요합니다. 예시 명령어:

vllm serve LordNeel/DeepSeek-V4-Flash-Acti-MTP-W4A16-FP8 \
--tensor-parallel-size 2 --kv-cache-dtype fp8 --block-size 256 \
--max-model-len 524288 --max-num-seqs 2 \
--gpu-memory-utilization 0.93 \
--tokenizer-mode deepseek_v4 \
--tool-call-parser deepseek_v4 --enable-auto-tool-choice \
--reasoning-parser deepseek_v4 \
--trust-remote-code \
--disable-custom-all-reduce \
--speculative-config '{"method":"mtp","num_speculative_tokens":1}' \
--host 0.0.0.0 --port 8000

모델에는 AI 코딩 에이전트(Claude/Codex/Cursor)를 통해 설정하기 위한 AGENTS.md 런북도 포함되어 있습니다.

📖 전체 소스 읽기: r/LocalLLaMA

Ad

👀 See Also

OpenClaw 응답 시간 개선 방법: 컨텍스트 비대화 줄이기
Guides

OpenClaw 응답 시간 개선 방법: 컨텍스트 비대화 줄이기

개발자가 OpenClaw에서 파일 구조 조정과 설정 변경을 통해 주입된 작업 공간 파일을 47,000자에서 16,000자로 줄이고, bootstrapMaxChars를 8000으로 설정하고 압축 안전장치를 추가하여 10분 응답 시간 문제를 해결했습니다.

OpenClawRadar
플로우 맵: 더 빠른 샘플링을 위한 확산 모델의 적분 학습
Guides

플로우 맵: 더 빠른 샘플링을 위한 확산 모델의 적분 학습

Sander Dieleman이 플로우 맵(flow maps)을 설명합니다. 이는 확산 모델의 ODE 적분을 직접 예측하는 신경망으로, 더 빠른 샘플링, 보상 기반 학습, 그리고 조종 가능성(steerability)을 가능하게 합니다.

OpenClawRadar
OpenClaw 신뢰성 문제에 대한 실용적인 해결 방법
Guides

OpenClaw 신뢰성 문제에 대한 실용적인 해결 방법

한 개발자가 OpenClaw 설정을 개선한 8가지 구체적인 기법을 공유했습니다. 여기에는 일일 로그와 지식 그래프를 포함한 3계층 메모리 시스템, 활성화 점수 관리, 파일 기반 규칙 강제 적용 등이 포함됩니다.

OpenClawRadar
24GB RAM M4 Mac Mini에서 GLM-4.7-Flash 최적화하기
Guides

24GB RAM M4 Mac Mini에서 GLM-4.7-Flash 최적화하기

개발자가 24GB RAM이 탑재된 M4 Mac Mini에서 GLM-4.7-Flash를 실행하기 위한 구체적인 구성 세부 정보를 공유했습니다. 여기에는 Q3_K_XL 양자화, MLA를 사용한 32k 컨텍스트 크기, Metal을 위한 메모리 할당 현실이 포함됩니다.

OpenClawRadar