RTX 5000 PRO 48GB liefert 4400 Tok/s Präzisions-Caching für Qwen3.6-27B

✍️ OpenClawRadar📅 Veröffentlicht: 14. Mai 2026🔗 Source
RTX 5000 PRO 48GB liefert 4400 Tok/s Präzisions-Caching für Qwen3.6-27B
Ad

Ein Entwickler wagte das Experiment mit der RTX 5000 Pro 48GB (4300 $ inkl. Steuern) gegen ein Mac Studio – und die Zahlen rechtfertigen den Sprung: bis zu 4400 Token/Sekunde bei der Promptverarbeitung (PP) und 50–80 Tok/s bei der Textgenerierung (TG) mit Qwen3.6-27B-FP8 und einem vollpräzisen BF16-KV-Cache.

Hardware- und Kostenaufschlüsselung

  • GPU-Kosten: 4300 $ (inkl. Steuern)
  • Gesamtkosten: 5600 $ mit 64 GB RAM
  • Kontextlimit: 200 K Token bei voller Präzision (BF16-KV-Cache)

Leistungsbenchmarks

  • Promptverarbeitung: 4400 Tok/s
  • Textgenerierung: 50–60 Tok/s bei sehr großen Prompts, bis zu 80 Tok/s bei kleineren
  • Modell: Qwen3.6-27B-FP8 mit vollpräzisem Cache
  • Stromverbrauch: Etwa die Hälfte eines Dual-RTX-5090-Setups
Ad

Wichtige Beobachtungen

Der Nutzer baute den PC ohne Vorkenntnisse und verließ sich dabei auf Claude Code (wobei 50 % des wöchentlichen Claude Code Max-Limits für die vLLM/Linux-Einrichtung aufgebraucht wurden). Ein Reddit-Beitrag mit genauen vLLM-Einstellungen für Qwen3.6-27B-FP8 mit BF16-Cache war die primäre Referenz. Der Autor merkt an, dass zwei RTX 5090s zwar leistungsstärker wären, aber zu deutlich höheren Kosten, mehr Lärm und höherem Stromverbrauch.

📖 Lies die vollständige Quelle: r/LocalLLaMA

Ad

👀 Siehe auch

Mit $3 und ohne menschliche Annotatoren feinabgestimmter Qwen2.5-7B erreicht 96% von Claude Haiku
Nachrichten

Mit $3 und ohne menschliche Annotatoren feinabgestimmter Qwen2.5-7B erreicht 96% von Claude Haiku

Ein Entwickler hat Qwen2.5-7B mit nur 3 $ API-Kosten und ohne menschliche Annotatoren auf 96 % der Leistung von Claude Haiku bei einer domänenspezifischen Entscheidungsaufgabe gebracht – mittels einer neuartigen DV-DPO-Methode.

OpenClawRadar
2.000 Stunden mit Claude Code: Der wahre Wandel liegt vom Programmieren zum Urteilsvermögen
Nachrichten

2.000 Stunden mit Claude Code: Der wahre Wandel liegt vom Programmieren zum Urteilsvermögen

Ein Entwickler hat seit Januar 2.000 Stunden damit verbracht, Claude Code zu leiten. Die Überraschung: Je besser der Agent bei der Ausführung wird, desto mehr schrumpft die menschliche Rolle auf Urteilsvermögen zusammen – Probleme definieren, Ergebnisse verifizieren und falsche Wege stoppen.

OpenClawRadar
Krankenhaus-CEO behauptet, KI sei bereit, Radiologen zu ersetzen
Nachrichten

Krankenhaus-CEO behauptet, KI sei bereit, Radiologen zu ersetzen

Der CEO des größten öffentlichen Krankenhaussystems in Amerika sagt, er sei bereit, Radiologen durch KI zu ersetzen, laut einem Radiology Business-Artikel, der auf Hacker News mit 83 Kommentaren eine bedeutende Diskussion auslöste.

OpenClawRadar
Claude Code-Nutzer stoßen schneller als erwartet an Nutzungsgrenzen, Fehler werden vermutet
Nachrichten

Claude Code-Nutzer stoßen schneller als erwartet an Nutzungsgrenzen, Fehler werden vermutet

Anthropic bestätigt, dass Claude Code-Nutzer ihre Kontingente 'viel schneller als erwartet' ausschöpfen, wobei Nutzer berichten, dass die Limits innerhalb von Stunden erreicht werden. Vermutete Fehler im Prompt-Caching könnten die Kosten um das 10- bis 20-fache erhöhen, und ein Downgrade auf Version 2.1.34 soll angeblich helfen.

OpenClawRadar