Qwen3.6 27B FP8 exécute 200k tokens avec cache KV BF16 à 80 TPS sur RTX 5000 PRO 48 Go

Un utilisateur de Reddit sur r/LocalLLaMA rapporte avoir exécuté Qwen3.6-27B-FP8 avec un cache KV BF16 de 200k tokens à 60–90 TPS sur une seule carte RTX 5000 PRO 48 Go. La configuration utilise vLLM 0.20.1, CUDA 12.9 et la quantification FP8 officielle de Qwen, préservant la multi-modalité et le décodage spéculatif MTP.
Détails de la configuration
L'environnement utilise FlashInfer FP8 MoE, FP8 Marlin et une planification asynchrone. Variables d'environnement clés et commande de lancement :
export VLLM_USE_FLASHINFER_MOE_FP8=1
export VLLM_TEST_FORCE_FP8_MARLIN=1
export VLLM_SLEEP_WHEN_IDLE=1
export VLLM_MEMORY_PROFILER_ESTIMATE_CUDAGRAPHS=1
export VLLM_LOG_STATS_INTERVAL=2
export VLLM_WORKER_MULTIPROC_METHOD=spawn
export SAFETENSORS_FAST_GPU=1
export CUDA_DEVICE_ORDER=PCI_BUS_ID
export TORCH_FLOAT32_MATMUL_PRECISION=high
export PYTORCH_ALLOC_CONF=expandable_segments:True
vllm serve Qwen/Qwen3.6-27B-FP8
--host 0.0.0.0 --port 8080
--performance-mode interactivity
--trust-remote-code
--enable-auto-tool-choice
--tool-call-parser qwen3_coder
--reasoning-parser qwen3
--mm-encoder-tp-mode data
--mm-processor-cache-type shm
--gpu-memory-utilization 0.975
--speculative-config '{"method":"mtp","num_speculative_tokens":2}'
--compilation-config '{"cudagraph_mode": "FULL_AND_PIECEWISE", "max_cudagraph_capture_size": 16, "mode": "VLLM_COMPILE"}'
--async-scheduling
--attention-backend flashinfer
--max-model-len 196608
--kv-cache-dtype bfloat16
--enable-prefix-caching
Observations sur les performances
Avec le décodage spéculatif MTP=2, le système produit 60–90 TPS lors de la génération de code. Le cache KV BF16 évite les problèmes de compaction observés avec le KV quantifié, rendant les longues sessions de codage plus fiables. L'utilisateur note que la configuration tourne sur une seule RTX 5000 PRO 48 Go avec 64 Go de RAM système et un processeur correct, la qualifiant d'excellent candidat pour une station de travail à 10 000 $ dédiée au développement LLM local.
À qui cela s'adresse
Développeurs ayant besoin d'une configuration locale de codage agentique à faible compression, avec un minimum d'artefacts de quantification et de longs contextes.
📖 Lire la source complète : r/LocalLLaMA
👀 See Also

OpenClaw v2026.6.10 : Mode Rapide Automatique, Corrections de Routage de Modèle et Politiques d’Outils de Confiance
OpenClaw v2026.6.10 ajoute le mode rapide automatique, corrige le routage des modèles pour Z.ai GLM-5, améliore l'identité de session entre les canaux et renforce les politiques d'outils de confiance.

L'IA dévore le monde (Printemps 2026) – Une analyse complète du marché
Un rapport PDF détaillé sur les tendances de l'industrie de l'IA, les tailles de marché et les métriques d'adoption pour le printemps 2026, couvrant les technologies clés, les acteurs et les prévisions.

MCP n'est qu'une bibliothèque réemballée : un éternel recommencement
Une discussion sur Reddit soutient que le MCP d'Anthropic est essentiellement un reconditionnement de bibliothèques de programmation, établissant des parallèles avec la conception de l'outil smolagents de Hugging Face et se demandant s'il faut construire de nouveaux MCP ou améliorer la documentation des bibliothèques existantes.
Les créatifs d'Hollywood forment l'IA pour les remplacer — et gagnent 12 à 200 dollars de l'heure
Des scénaristes, réalisateurs et producteurs primés acceptent des petits boulots pour former des modèles d'IA à écrire des scénarios, planifier des tournages, etc., alors que la production est en baisse de 35 %.