Qwen3.6 27B & 35B auf vLLM: Tuning-Ergebnisse für einzelne Radeon R9700
Ein r/LocalLLaMA-Beitrag beschreibt, wie man Qwen3.6 27B (dicht) und 35B (MoE) auf einer einzelnen Radeon AI Pro R9700 mit vLLM Radiance über Podman ausführt. Der Autor teilt seine genaue Konfiguration und Benchmark-Ergebnisse, die besonders für AMD-GPU-Nutzer nützlich sind.
Setup und wichtige Unterschiede
Sie verwenden den Container stilldeadcode/vllm-radiance:0.5.8, der mit einer Referenzkonfiguration für FP8-Gewichte auf zwei R9700 mit Tensor-Parallelismus (TP=2) ausgestattet ist. Für eine einzelne Karte mit INT4-Gewichten sind folgende Änderungen erforderlich:
--tensor-parallel-size 1(keine zweite Karte)--gpu-memory-utilization 0.98(Referenz war 0.90–0.97)num_speculative_tokens=4beim 27B – Leitergetestet mit 2/3/4/8, wobei 4 um 17–48% besser war als 8 bei allen Tiefen.
Die Gewichte sind Avesed/Qwen3.6-{27B,35B}-INT4-W4A16 (compressed-tensors, group_size 32). Der 35B bei FP8 passt einfach nicht auf eine 32GB-Karte bei sinnvollen Kontextlängen.
Kritischer Fix: tokenizer.json
Das Avesed INT4-Repo enthält ein tokenizer.json mit truncation.max_length auf 512 und padding als Fixed(512) – wahrscheinlich aus der Kalibrierung. Dies bricht die Vision oberhalb von ~672px. Der Fix: beide auf null setzen.
Benchmark-Ergebnisse
35B-A3B MoE (KV-Pool-Tokens = 440,241)
| Tiefe | Prefill tok/s | Decode tok/s |
|---|---|---|
| 4k | ~7.800 | 61,4 |
| 16k | ~7.700 | 60,1 |
| 50k | ~6.040 | 57,0 |
| 78k | ~5.120 | 54,7 |
| 100k | ~4.580 | 52,9 |
| 150k | ~3.690 | 49,5 |
27B dicht, MTP spec=4 (KV-Pool-Tokens = 212,147)
| Tiefe | Prefill tok/s | Decode tok/s | Mittlere akzeptierte Länge |
|---|---|---|---|
| 4k | ~1.288 | 59,6 | 4,4 |
| 16k | ~1.345 | 62,3 | 4,6 |
| 50k | ~1.207 | 59,6 | 4,5 |
| 100k | ~1.027 | 53,7 | 4,5 |
Bemerkenswert: Der 35B MoE erreicht einen viel höheren Prefill-Durchsatz (bis zu 7,8k tok/s gegenüber 1,3k), aber ähnliche Decode-Geschwindigkeiten. Die MTP-Spekulation des 27B liefert eine akzeptierte Länge von ~4,5 Token.
Dies ist eine praktische Konfiguration für AMD-Nutzer, die keine zwei GPUs haben und diese Modelle lokal ausführen möchten. Der Autor stellt auf Anfrage Startskripte zur Verfügung.
📖 Vollständige Quelle lesen: r/LocalLLaMA
👀 Siehe auch

Conduid: Vertrauensinfrastrukturschicht für MCP-Server, erstellt mit Claude
Conduid indiziert über 25.000 MCP-Server auf GitHub, npm, PyPI und in wichtigen Verzeichnissen und bewertet jeden mit 0–100 Punkten basierend auf GitHub-Aktivität, Sicherheitslage, Dokumentationsqualität und Wartungssignalen. Die gesamte Codebasis wurde von einem Einzelgründer mit Claude geschrieben.

Agent Factory: Autonomes System erstellt KI-Agenten aus Online-Problemdiskussionen
Agent Factory ist ein autonomes System, das Reddit, HN, GitHub und Twitter nach echten Problemen durchsucht, diese nach Nachfrage, Marktlücke und Umsetzbarkeit bewertet und dann eigenständige KI-Agenten für vielversprechende Ideen erstellt. Das System verwendet eine minimale Next.js-Vorlage mit 7 Tools und führt Claude Code über ein Shell-Skript im Headless-Modus aus.

Open-Source-Claude-Fähigkeit für Management-Consulting-Frameworks und Fallstudien
Ein kostenloses, MIT-lizenziertes Claude-Skill bietet strukturiertes Referenzmaterial für Management-Consulting-Arbeit, einschließlich Frameworks, Branchenkontext und Fallstudien. Das Projekt besteht aus 80+ Markdown-Dateien, die nach Domänen organisiert sind, und sucht Mitwirkende, um die Abdeckung zu erweitern.

Kostenloses MCP ermöglicht Claude die automatische Analyse von Google Search Console-Daten
Ein kostenloser MCP-Server (Model Context Protocol) ermöglicht es Claude, Google Search Console-Daten für jede Website abzufragen, auf die Sie Zugriff haben. Fragen Sie nach Suchanfragen, Seiten, Klicks, Impressionen, CTR und Position – ohne manuellen CSV-Export.