DeepSeek-V4-Flash W4A16+FP8 avec auto-spéculation MTP : 85 tok/s sur 2x RTX PRO 6000 Max-Q

DeepSeek-V4-Flash fonctionnant à 85,52 tok/s @ contexte 524k et ~111 tok/s @ 128k en flux unique sur 2× RTX PRO 6000 Max-Q (96 Go chacun, sans NVLink). La quantification utilise la base W4A16-FP8 de pasta-paul mais avec une tête MTP rétrofitée (la quantification originale supprime silencieusement MTP au chargement). Détails clés ci-dessous.
Benchmarks
- Base pasta-paul, sans MTP, 524k : 52,85 tok/s, 91 ms TTFT (référence)
- Ce modèle, 524k 2 flux : 85,52 tok/s, 155 ms TTFT (+62%)
- Ce modèle, 128k flux unique : ~111 tok/s, ~310 ms TTFT (+110%)
- Benchmarks de validation (petits échantillons) : GSM8K 93%, MMLU 53%, HumanEval (syntaxique) 90%
Détails de quantification
- 768 tenseurs d'experts routés (256 experts × {w1, w2, w3}) : W4A16 INT4 groupe=128 sym, GPTQ (Frantar avec Cholesky H⁻¹). Calibré avec 256 prompts ultrachat_200k × 256 max_tokens – 17 701 déchargements forward MTP, 473k tokens.
- 5 projections d'attention : FP8_BLOCK (poids FP8 en amont, renommés scale → weight_scale pour compatibilité compressed-tensors).
- Experts partagés, e_proj, h_proj, norms, gate, attn_sink : BF16 / FP32.
Correctifs spécifiques Max-Q
Passer --disable-custom-all-reduce sur les cartes workstation Max-Q (pas de NVLink). CustomAllreduce de vLLM utilise CUDA P2P et se bloque sur une topologie PCIe uniquement. Réglage NCCL pour TTFT plus faible (~91 ms contre ~155 ms) :
NCCL_PROTO=LL NCCL_ALGO=Ring NCCL_MIN_NCHANNELS=8 NCCL_NTHREADS=512Comment exécuter
Nécessite le fork vLLM patché depuis l'espace de travail de pasta-paul avec les correctifs MTP. Exemple de commande :
vllm serve LordNeel/DeepSeek-V4-Flash-Acti-MTP-W4A16-FP8 \
--tensor-parallel-size 2 --kv-cache-dtype fp8 --block-size 256 \
--max-model-len 524288 --max-num-seqs 2 \
--gpu-memory-utilization 0.93 \
--tokenizer-mode deepseek_v4 \
--tool-call-parser deepseek_v4 --enable-auto-tool-choice \
--reasoning-parser deepseek_v4 \
--trust-remote-code \
--disable-custom-all-reduce \
--speculative-config '{"method":"mtp","num_speculative_tokens":1}' \
--host 0.0.0.0 --port 8000Le modèle inclut également un fichier AGENTS.md pour la configuration via des agents de codage IA (Claude/Codex/Cursor).
📖 Lire la source complète : r/LocalLLaMA
👀 See Also

Problèmes de mise à jour d'OpenClaw v2026.3.22 et correctifs en 30 secondes
La mise à jour OpenClaw v2026.3.22 a introduit 12 changements majeurs, notamment le fait que ClawHub est devenu le magasin de plugins par défaut et la suppression de variables d'environnement obsolètes. Cinq problèmes courants avec des solutions rapides incluent les pics de facturation API, les actions involontaires des agents et les erreurs de configuration.

Maîtriser OpenClaw 101 : Un Guide Débutant Inspiré des Avis de Redditeurs
Plongez dans OpenClaw avec notre guide complet, inspiré des idées de la communauté Reddit. Évitez les pièges courants et maximisez votre productivité avec ces conseils d'experts.

Création de Compétences Claude pour Automatiser les Processus Cognitifs
Claude Code inclut un créateur de compétences intégré qui vous permet de créer des compétences alimentées par l'IA en décrivant des processus en langage naturel au lieu d'écrire du code. La source décrit la création d'une compétence de validation de startup qui a réduit un processus manuel de 2 jours à 15 minutes.

Modèles de défaillance d'OpenClaw : 42 incidents réels en 28 jours
Un développeur utilisant OpenClaw quotidiennement a documenté 42 échecs spécifiques répartis en huit catégories, incluant des hallucinations de l'IA, des pannes d'authentification et des automatisations qui coûtent plus de temps qu'elles n'en font gagner. La source fournit des exemples concrets comme l'expiration des jetons OAuth de Google après 7 jours et Opus 4.6 ajoutant des métadonnées indésirables aux fichiers.