Qwen3.6 27B & 35B auf vLLM: Tuning-Ergebnisse für einzelne Radeon R9700
Ein r/LocalLLaMA-Beitrag beschreibt, wie man Qwen3.6 27B (dicht) und 35B (MoE) auf einer einzelnen Radeon AI Pro R9700 mit vLLM Radiance über Podman ausführt. Der Autor teilt seine genaue Konfiguration und Benchmark-Ergebnisse, die besonders für AMD-GPU-Nutzer nützlich sind.
Setup und wichtige Unterschiede
Sie verwenden den Container stilldeadcode/vllm-radiance:0.5.8, der mit einer Referenzkonfiguration für FP8-Gewichte auf zwei R9700 mit Tensor-Parallelismus (TP=2) ausgestattet ist. Für eine einzelne Karte mit INT4-Gewichten sind folgende Änderungen erforderlich:
--tensor-parallel-size 1(keine zweite Karte)--gpu-memory-utilization 0.98(Referenz war 0.90–0.97)num_speculative_tokens=4beim 27B – Leitergetestet mit 2/3/4/8, wobei 4 um 17–48% besser war als 8 bei allen Tiefen.
Die Gewichte sind Avesed/Qwen3.6-{27B,35B}-INT4-W4A16 (compressed-tensors, group_size 32). Der 35B bei FP8 passt einfach nicht auf eine 32GB-Karte bei sinnvollen Kontextlängen.
Kritischer Fix: tokenizer.json
Das Avesed INT4-Repo enthält ein tokenizer.json mit truncation.max_length auf 512 und padding als Fixed(512) – wahrscheinlich aus der Kalibrierung. Dies bricht die Vision oberhalb von ~672px. Der Fix: beide auf null setzen.
Benchmark-Ergebnisse
35B-A3B MoE (KV-Pool-Tokens = 440,241)
| Tiefe | Prefill tok/s | Decode tok/s |
|---|---|---|
| 4k | ~7.800 | 61,4 |
| 16k | ~7.700 | 60,1 |
| 50k | ~6.040 | 57,0 |
| 78k | ~5.120 | 54,7 |
| 100k | ~4.580 | 52,9 |
| 150k | ~3.690 | 49,5 |
27B dicht, MTP spec=4 (KV-Pool-Tokens = 212,147)
| Tiefe | Prefill tok/s | Decode tok/s | Mittlere akzeptierte Länge |
|---|---|---|---|
| 4k | ~1.288 | 59,6 | 4,4 |
| 16k | ~1.345 | 62,3 | 4,6 |
| 50k | ~1.207 | 59,6 | 4,5 |
| 100k | ~1.027 | 53,7 | 4,5 |
Bemerkenswert: Der 35B MoE erreicht einen viel höheren Prefill-Durchsatz (bis zu 7,8k tok/s gegenüber 1,3k), aber ähnliche Decode-Geschwindigkeiten. Die MTP-Spekulation des 27B liefert eine akzeptierte Länge von ~4,5 Token.
Dies ist eine praktische Konfiguration für AMD-Nutzer, die keine zwei GPUs haben und diese Modelle lokal ausführen möchten. Der Autor stellt auf Anfrage Startskripte zur Verfügung.
📖 Vollständige Quelle lesen: r/LocalLLaMA
👀 Siehe auch

OpenClaw Shared Memory Plugin: SQLite-basierte Multi-Agenten-Koordination
Ein Entwickler hat ein Plugin für OpenClaw-Multi-Agenten-Setups erstellt, das es Agenten ermöglicht, Speicher mit SQLite zu teilen, wodurch externe Dienste überflüssig werden. Das Plugin ermöglicht explizite Speicherfreigabe über ein Tool, automatische Kontextextraktion, Zugriffskontrolle, Entitätsverfolgung und Widerspruchserkennung.

Claude Skills Hub: Durchsuchbares Repository für 789+ Claude Code Skills und 10 autonome Agenten
Claude Skills Hub (clskills.in) bietet eine zentralisierte Suchoberfläche für 789+ Claude Code Skill-Dateien in 71 Kategorien sowie 10 autonome KI-Agenten, die mehrere Skills zu vollständigen Workflows verknüpfen. Das Open-Source-Projekt sammelt Skills aus mehreren Community-Sammlungen und ermöglicht Downloads mit einem Klick.

OpenCortex: Ein sich selbst verbesserndes Speichersystem für OpenClaw
OpenCortex ersetzt die flache MEMORY.md-Datei von OpenClaw durch strukturierte Speicherdateien, die nach Projekten, Kontakten, Workflows, Präferenzen, Runbooks, Tools und Infrastruktur organisiert sind. Es umfasst nächtliche Destillation mit Prüfungen zur Durchsetzung von Prinzipien und wöchentliche Synthese mit Mustererkennung und automatischer Runbook-Erstellung.

Rivet Actors fügt SQLite-Speicher hinzu: eine Datenbank pro Agent, Mandant oder Dokument
Rivet Actors unterstützt jetzt SQLite-Speicher, wobei jeder Actor seine eigene SQLite-Datenbank erhält. Dies ermöglicht Millionen unabhängiger Datenbanken für KI-Agenten, mehrinstanzenfähige SaaS-Anwendungen, kollaborative Dokumente oder benutzerspezifische Isolation.