Qwen3.6 27B & 35B auf vLLM: Tuning-Ergebnisse für einzelne Radeon R9700

✍️ OpenClawRadar📅 Veröffentlicht: 9. August 2026🔗 Source
Ad

Ein r/LocalLLaMA-Beitrag beschreibt, wie man Qwen3.6 27B (dicht) und 35B (MoE) auf einer einzelnen Radeon AI Pro R9700 mit vLLM Radiance über Podman ausführt. Der Autor teilt seine genaue Konfiguration und Benchmark-Ergebnisse, die besonders für AMD-GPU-Nutzer nützlich sind.

Setup und wichtige Unterschiede

Sie verwenden den Container stilldeadcode/vllm-radiance:0.5.8, der mit einer Referenzkonfiguration für FP8-Gewichte auf zwei R9700 mit Tensor-Parallelismus (TP=2) ausgestattet ist. Für eine einzelne Karte mit INT4-Gewichten sind folgende Änderungen erforderlich:

  • --tensor-parallel-size 1 (keine zweite Karte)
  • --gpu-memory-utilization 0.98 (Referenz war 0.90–0.97)
  • num_speculative_tokens=4 beim 27B – Leitergetestet mit 2/3/4/8, wobei 4 um 17–48% besser war als 8 bei allen Tiefen.

Die Gewichte sind Avesed/Qwen3.6-{27B,35B}-INT4-W4A16 (compressed-tensors, group_size 32). Der 35B bei FP8 passt einfach nicht auf eine 32GB-Karte bei sinnvollen Kontextlängen.

Kritischer Fix: tokenizer.json

Das Avesed INT4-Repo enthält ein tokenizer.json mit truncation.max_length auf 512 und padding als Fixed(512) – wahrscheinlich aus der Kalibrierung. Dies bricht die Vision oberhalb von ~672px. Der Fix: beide auf null setzen.

Ad

Benchmark-Ergebnisse

35B-A3B MoE (KV-Pool-Tokens = 440,241)

TiefePrefill tok/sDecode tok/s
4k~7.80061,4
16k~7.70060,1
50k~6.04057,0
78k~5.12054,7
100k~4.58052,9
150k~3.69049,5

27B dicht, MTP spec=4 (KV-Pool-Tokens = 212,147)

TiefePrefill tok/sDecode tok/sMittlere akzeptierte Länge
4k~1.28859,64,4
16k~1.34562,34,6
50k~1.20759,64,5
100k~1.02753,74,5

Bemerkenswert: Der 35B MoE erreicht einen viel höheren Prefill-Durchsatz (bis zu 7,8k tok/s gegenüber 1,3k), aber ähnliche Decode-Geschwindigkeiten. Die MTP-Spekulation des 27B liefert eine akzeptierte Länge von ~4,5 Token.

Dies ist eine praktische Konfiguration für AMD-Nutzer, die keine zwei GPUs haben und diese Modelle lokal ausführen möchten. Der Autor stellt auf Anfrage Startskripte zur Verfügung.

📖 Vollständige Quelle lesen: r/LocalLLaMA

Ad

👀 Siehe auch

Nexus: Open-Source AI-zu-AI-Protokoll mit Discovery, Vertrauen und Zahlungen
Werkzeuge

Nexus: Open-Source AI-zu-AI-Protokoll mit Discovery, Vertrauen und Zahlungen

Nexus ist ein selbst gehostetes Protokoll, das KI-Agenten ermöglicht, sich gegenseitig zu entdecken, Bedingungen auszuhandeln, Antworten zu verifizieren und Mikrozahlungen ohne menschliches Eingreifen abzuwickeln. Es umfasst fünf Ebenen: Entdeckung, Vertrauen, Protokoll, Routing und Föderation, mit 66 Tests und MIT-Lizenz.

OpenClawRadar
Project Headroom: Open-Source-Tool eines Netflix-Ingenieurs senkt KI-Token-Kosten um 90%
Werkzeuge

Project Headroom: Open-Source-Tool eines Netflix-Ingenieurs senkt KI-Token-Kosten um 90%

Netflix-Senioringenieur Tejas Chopra hat Project Headroom entwickelt, einen Open-Source-Proxy, der KI-Kontext-Eingaben um bis zu 90 % komprimiert und seit Januar 2026 schätzungsweise 700.000 US-Dollar bei den Nutzern eingespart hat. Er läuft lokal auf Port 8787 und umschließt jedes LLM-CLI.

OpenClawRadar
NVIDIA kündigt NemoClaw Agent-Plattform mit Datenschutzfunktionen an
Werkzeuge

NVIDIA kündigt NemoClaw Agent-Plattform mit Datenschutzfunktionen an

NVIDIA hat NemoClaw gestartet, eine Agenten-Plattform, mit der Nutzer Nimotron-Modelle und die Open Shell-Laufzeitumgebung mit einem einzigen Befehl installieren können, während sie Datenschutz- und Sicherheitskontrollen für autonome Agenten hinzufügt.

OpenClawRadar
ClawCall erhält dedizierte Telefonnummern: Agenten können jetzt eine Nummer für ausgehende Anrufe reservieren
Werkzeuge

ClawCall erhält dedizierte Telefonnummern: Agenten können jetzt eine Nummer für ausgehende Anrufe reservieren

ClawCall, die KI-Telefonie-Fähigkeit für OpenClaw-Agenten, ermöglicht jetzt die Reservierung einer Telefonnummer nach Vorwahl. Ihr Agent verwendet sie standardmäßig für Anrufe. 10.000 Downloads, 300 Anrufe/Tag.

OpenClawRadar