RTX 5000 PRO 48GB offre un cache de précision de 4400 tok/s pour Qwen3.6-27B

Un développeur a pris le risque de choisir la RTX 5000 Pro 48 Go (4300 $ taxes incluses) plutôt qu'un Mac Studio — et les chiffres justifient le saut : jusqu'à 4400 tokens/seconde en traitement des invites (PP) et 50–80 tok/s en génération de texte (TG) avec Qwen3.6-27B-FP8 et un cache KV BF16 pleine précision.
Répartition du matériel et des coûts
- Coût du GPU : 4300 $ (taxes incluses)
- Configuration totale : 5600 $ avec 64 Go de RAM
- Limite de contexte : 200 000 tokens en pleine précision (cache KV BF16)
Références de performance
- Traitement des invites : 4400 tok/s
- Génération de texte : 50–60 tok/s pour les très grandes invites, jusqu'à 80 tok/s pour les plus petites
- Modèle : Qwen3.6-27B-FP8 avec cache pleine précision
- Consommation électrique : Environ la moitié d'une configuration double RTX 5090
Observations clés
L'utilisateur a construit le PC sans aucune expérience préalable, en s'appuyant sur Claude Code (consommant 50 % des limites hebdomadaires de Claude Code Max pour l'installation de vLLM/Linux). Un post Reddit détaillant les paramètres exacts de vLLM pour Qwen3.6-27B-FP8 avec cache BF16 a servi de référence principale. L'auteur note que deux RTX 5090 seraient plus performantes, mais à un coût, un bruit et une consommation électrique nettement plus élevés.
📖 Lire la source complète : r/LocalLLaMA
👀 See Also

Traduire en français : Problème d'UX de Claude Cowork : La Boîte de Saisie Persistante Crée de Fausses Attentes de Continuité
Un utilisateur identifie un problème d'expérience utilisateur dans Claude Cowork où la boîte de saisie de texte persistante conserve le texte brouillon lors des changements de tâches, mais réinitialise le contexte et perd les pièces jointes, créant des signaux contradictoires sur la continuité.

Ohio suspend l'exonération fiscale des centres de données : les pressions sur les coûts de l'IA s'intensifient pour les entreprises technologiques
L'Ohio suspend une exonération de taxe de vente sur les équipements pour les nouveaux centres de données, y compris ceux alimentant l'IA. Cette décision reflète une surveillance accrue des incitations fiscales alors que la demande d'infrastructures IA explose.

Les agents IA qui ne réduisent pas les coûts de maintenance submergeront votre équipe
James Shore avance que doubler la vitesse de codage de l'IA sans réduire de moitié les coûts de maintenance entraîne une perte de productivité nette en quelques mois. Le modèle montre qu'un rendement de code 2x avec un coût de maintenance 2x par ligne conduit à une productivité pire que le point de départ après environ 5 mois.

Claude Opus 4.6 et Sonnet 4.6 proposent désormais un contexte de 1 million de tokens au tarif standard.
Claude Opus 4.6 et Sonnet 4.6 incluent désormais une fenêtre de contexte complète de 1 million à tarif standard sans supplément pour contexte long, ainsi que des limites médias étendues à 600 images ou pages PDF par requête.