RTX 5000 PRO 48GB liefert 4400 Tok/s Präzisions-Caching für Qwen3.6-27B

Ein Entwickler wagte das Experiment mit der RTX 5000 Pro 48GB (4300 $ inkl. Steuern) gegen ein Mac Studio – und die Zahlen rechtfertigen den Sprung: bis zu 4400 Token/Sekunde bei der Promptverarbeitung (PP) und 50–80 Tok/s bei der Textgenerierung (TG) mit Qwen3.6-27B-FP8 und einem vollpräzisen BF16-KV-Cache.
Hardware- und Kostenaufschlüsselung
- GPU-Kosten: 4300 $ (inkl. Steuern)
- Gesamtkosten: 5600 $ mit 64 GB RAM
- Kontextlimit: 200 K Token bei voller Präzision (BF16-KV-Cache)
Leistungsbenchmarks
- Promptverarbeitung: 4400 Tok/s
- Textgenerierung: 50–60 Tok/s bei sehr großen Prompts, bis zu 80 Tok/s bei kleineren
- Modell: Qwen3.6-27B-FP8 mit vollpräzisem Cache
- Stromverbrauch: Etwa die Hälfte eines Dual-RTX-5090-Setups
Wichtige Beobachtungen
Der Nutzer baute den PC ohne Vorkenntnisse und verließ sich dabei auf Claude Code (wobei 50 % des wöchentlichen Claude Code Max-Limits für die vLLM/Linux-Einrichtung aufgebraucht wurden). Ein Reddit-Beitrag mit genauen vLLM-Einstellungen für Qwen3.6-27B-FP8 mit BF16-Cache war die primäre Referenz. Der Autor merkt an, dass zwei RTX 5090s zwar leistungsstärker wären, aber zu deutlich höheren Kosten, mehr Lärm und höherem Stromverbrauch.
📖 Lies die vollständige Quelle: r/LocalLLaMA
👀 Siehe auch

Mit $3 und ohne menschliche Annotatoren feinabgestimmter Qwen2.5-7B erreicht 96% von Claude Haiku
Ein Entwickler hat Qwen2.5-7B mit nur 3 $ API-Kosten und ohne menschliche Annotatoren auf 96 % der Leistung von Claude Haiku bei einer domänenspezifischen Entscheidungsaufgabe gebracht – mittels einer neuartigen DV-DPO-Methode.

2.000 Stunden mit Claude Code: Der wahre Wandel liegt vom Programmieren zum Urteilsvermögen
Ein Entwickler hat seit Januar 2.000 Stunden damit verbracht, Claude Code zu leiten. Die Überraschung: Je besser der Agent bei der Ausführung wird, desto mehr schrumpft die menschliche Rolle auf Urteilsvermögen zusammen – Probleme definieren, Ergebnisse verifizieren und falsche Wege stoppen.

Krankenhaus-CEO behauptet, KI sei bereit, Radiologen zu ersetzen
Der CEO des größten öffentlichen Krankenhaussystems in Amerika sagt, er sei bereit, Radiologen durch KI zu ersetzen, laut einem Radiology Business-Artikel, der auf Hacker News mit 83 Kommentaren eine bedeutende Diskussion auslöste.

Claude Code-Nutzer stoßen schneller als erwartet an Nutzungsgrenzen, Fehler werden vermutet
Anthropic bestätigt, dass Claude Code-Nutzer ihre Kontingente 'viel schneller als erwartet' ausschöpfen, wobei Nutzer berichten, dass die Limits innerhalb von Stunden erreicht werden. Vermutete Fehler im Prompt-Caching könnten die Kosten um das 10- bis 20-fache erhöhen, und ein Downgrade auf Version 2.1.34 soll angeblich helfen.