Qwen3.6 27B FP8 exécute 200k tokens avec cache KV BF16 à 80 TPS sur RTX 5000 PRO 48 Go

✍️ OpenClawRadar📅 Publié: May 5, 2026🔗 Source
Qwen3.6 27B FP8 exécute 200k tokens avec cache KV BF16 à 80 TPS sur RTX 5000 PRO 48 Go
Ad

Un utilisateur de Reddit sur r/LocalLLaMA rapporte avoir exécuté Qwen3.6-27B-FP8 avec un cache KV BF16 de 200k tokens à 60–90 TPS sur une seule carte RTX 5000 PRO 48 Go. La configuration utilise vLLM 0.20.1, CUDA 12.9 et la quantification FP8 officielle de Qwen, préservant la multi-modalité et le décodage spéculatif MTP.

Détails de la configuration

L'environnement utilise FlashInfer FP8 MoE, FP8 Marlin et une planification asynchrone. Variables d'environnement clés et commande de lancement :

export VLLM_USE_FLASHINFER_MOE_FP8=1
export VLLM_TEST_FORCE_FP8_MARLIN=1
export VLLM_SLEEP_WHEN_IDLE=1
export VLLM_MEMORY_PROFILER_ESTIMATE_CUDAGRAPHS=1
export VLLM_LOG_STATS_INTERVAL=2
export VLLM_WORKER_MULTIPROC_METHOD=spawn
export SAFETENSORS_FAST_GPU=1
export CUDA_DEVICE_ORDER=PCI_BUS_ID
export TORCH_FLOAT32_MATMUL_PRECISION=high
export PYTORCH_ALLOC_CONF=expandable_segments:True

vllm serve Qwen/Qwen3.6-27B-FP8
--host 0.0.0.0 --port 8080
--performance-mode interactivity
--trust-remote-code
--enable-auto-tool-choice
--tool-call-parser qwen3_coder
--reasoning-parser qwen3
--mm-encoder-tp-mode data
--mm-processor-cache-type shm
--gpu-memory-utilization 0.975
--speculative-config '{"method":"mtp","num_speculative_tokens":2}'
--compilation-config '{"cudagraph_mode": "FULL_AND_PIECEWISE", "max_cudagraph_capture_size": 16, "mode": "VLLM_COMPILE"}'
--async-scheduling
--attention-backend flashinfer
--max-model-len 196608
--kv-cache-dtype bfloat16
--enable-prefix-caching

Ad

Observations sur les performances

Avec le décodage spéculatif MTP=2, le système produit 60–90 TPS lors de la génération de code. Le cache KV BF16 évite les problèmes de compaction observés avec le KV quantifié, rendant les longues sessions de codage plus fiables. L'utilisateur note que la configuration tourne sur une seule RTX 5000 PRO 48 Go avec 64 Go de RAM système et un processeur correct, la qualifiant d'excellent candidat pour une station de travail à 10 000 $ dédiée au développement LLM local.

À qui cela s'adresse

Développeurs ayant besoin d'une configuration locale de codage agentique à faible compression, avec un minimum d'artefacts de quantification et de longs contextes.

📖 Lire la source complète : r/LocalLLaMA

Ad

👀 See Also

OpenClaw v2026.6.10 : Mode Rapide Automatique, Corrections de Routage de Modèle et Politiques d’Outils de Confiance
News

OpenClaw v2026.6.10 : Mode Rapide Automatique, Corrections de Routage de Modèle et Politiques d’Outils de Confiance

OpenClaw v2026.6.10 ajoute le mode rapide automatique, corrige le routage des modèles pour Z.ai GLM-5, améliore l'identité de session entre les canaux et renforce les politiques d'outils de confiance.

OpenClawRadar
L'IA dévore le monde (Printemps 2026) – Une analyse complète du marché
News

L'IA dévore le monde (Printemps 2026) – Une analyse complète du marché

Un rapport PDF détaillé sur les tendances de l'industrie de l'IA, les tailles de marché et les métriques d'adoption pour le printemps 2026, couvrant les technologies clés, les acteurs et les prévisions.

OpenClawRadar
MCP n'est qu'une bibliothèque réemballée : un éternel recommencement
News

MCP n'est qu'une bibliothèque réemballée : un éternel recommencement

Une discussion sur Reddit soutient que le MCP d'Anthropic est essentiellement un reconditionnement de bibliothèques de programmation, établissant des parallèles avec la conception de l'outil smolagents de Hugging Face et se demandant s'il faut construire de nouveaux MCP ou améliorer la documentation des bibliothèques existantes.

OpenClawRadar
🦀
News

Les créatifs d'Hollywood forment l'IA pour les remplacer — et gagnent 12 à 200 dollars de l'heure

Des scénaristes, réalisateurs et producteurs primés acceptent des petits boulots pour former des modèles d'IA à écrire des scénarios, planifier des tournages, etc., alors que la production est en baisse de 35 %.

OpenClawRadar