Qwen3.6 27B & 35B auf vLLM: Tuning-Ergebnisse für einzelne Radeon R9700
Ein r/LocalLLaMA-Beitrag beschreibt, wie man Qwen3.6 27B (dicht) und 35B (MoE) auf einer einzelnen Radeon AI Pro R9700 mit vLLM Radiance über Podman ausführt. Der Autor teilt seine genaue Konfiguration und Benchmark-Ergebnisse, die besonders für AMD-GPU-Nutzer nützlich sind.
Setup und wichtige Unterschiede
Sie verwenden den Container stilldeadcode/vllm-radiance:0.5.8, der mit einer Referenzkonfiguration für FP8-Gewichte auf zwei R9700 mit Tensor-Parallelismus (TP=2) ausgestattet ist. Für eine einzelne Karte mit INT4-Gewichten sind folgende Änderungen erforderlich:
--tensor-parallel-size 1(keine zweite Karte)--gpu-memory-utilization 0.98(Referenz war 0.90–0.97)num_speculative_tokens=4beim 27B – Leitergetestet mit 2/3/4/8, wobei 4 um 17–48% besser war als 8 bei allen Tiefen.
Die Gewichte sind Avesed/Qwen3.6-{27B,35B}-INT4-W4A16 (compressed-tensors, group_size 32). Der 35B bei FP8 passt einfach nicht auf eine 32GB-Karte bei sinnvollen Kontextlängen.
Kritischer Fix: tokenizer.json
Das Avesed INT4-Repo enthält ein tokenizer.json mit truncation.max_length auf 512 und padding als Fixed(512) – wahrscheinlich aus der Kalibrierung. Dies bricht die Vision oberhalb von ~672px. Der Fix: beide auf null setzen.
Benchmark-Ergebnisse
35B-A3B MoE (KV-Pool-Tokens = 440,241)
| Tiefe | Prefill tok/s | Decode tok/s |
|---|---|---|
| 4k | ~7.800 | 61,4 |
| 16k | ~7.700 | 60,1 |
| 50k | ~6.040 | 57,0 |
| 78k | ~5.120 | 54,7 |
| 100k | ~4.580 | 52,9 |
| 150k | ~3.690 | 49,5 |
27B dicht, MTP spec=4 (KV-Pool-Tokens = 212,147)
| Tiefe | Prefill tok/s | Decode tok/s | Mittlere akzeptierte Länge |
|---|---|---|---|
| 4k | ~1.288 | 59,6 | 4,4 |
| 16k | ~1.345 | 62,3 | 4,6 |
| 50k | ~1.207 | 59,6 | 4,5 |
| 100k | ~1.027 | 53,7 | 4,5 |
Bemerkenswert: Der 35B MoE erreicht einen viel höheren Prefill-Durchsatz (bis zu 7,8k tok/s gegenüber 1,3k), aber ähnliche Decode-Geschwindigkeiten. Die MTP-Spekulation des 27B liefert eine akzeptierte Länge von ~4,5 Token.
Dies ist eine praktische Konfiguration für AMD-Nutzer, die keine zwei GPUs haben und diese Modelle lokal ausführen möchten. Der Autor stellt auf Anfrage Startskripte zur Verfügung.
📖 Vollständige Quelle lesen: r/LocalLLaMA
👀 Siehe auch

Nexus: Open-Source AI-zu-AI-Protokoll mit Discovery, Vertrauen und Zahlungen
Nexus ist ein selbst gehostetes Protokoll, das KI-Agenten ermöglicht, sich gegenseitig zu entdecken, Bedingungen auszuhandeln, Antworten zu verifizieren und Mikrozahlungen ohne menschliches Eingreifen abzuwickeln. Es umfasst fünf Ebenen: Entdeckung, Vertrauen, Protokoll, Routing und Föderation, mit 66 Tests und MIT-Lizenz.

Project Headroom: Open-Source-Tool eines Netflix-Ingenieurs senkt KI-Token-Kosten um 90%
Netflix-Senioringenieur Tejas Chopra hat Project Headroom entwickelt, einen Open-Source-Proxy, der KI-Kontext-Eingaben um bis zu 90 % komprimiert und seit Januar 2026 schätzungsweise 700.000 US-Dollar bei den Nutzern eingespart hat. Er läuft lokal auf Port 8787 und umschließt jedes LLM-CLI.

NVIDIA kündigt NemoClaw Agent-Plattform mit Datenschutzfunktionen an
NVIDIA hat NemoClaw gestartet, eine Agenten-Plattform, mit der Nutzer Nimotron-Modelle und die Open Shell-Laufzeitumgebung mit einem einzigen Befehl installieren können, während sie Datenschutz- und Sicherheitskontrollen für autonome Agenten hinzufügt.

ClawCall erhält dedizierte Telefonnummern: Agenten können jetzt eine Nummer für ausgehende Anrufe reservieren
ClawCall, die KI-Telefonie-Fähigkeit für OpenClaw-Agenten, ermöglicht jetzt die Reservierung einer Telefonnummer nach Vorwahl. Ihr Agent verwendet sie standardmäßig für Anrufe. 10.000 Downloads, 300 Anrufe/Tag.