Qwen3.6-27B passt auf eine einzelne 24-GB-GPU, schlägt das frühere 397B MoE auf SWE-bench

✍️ OpenClawRadar📅 Veröffentlicht: 29. April 2026🔗 Source
Qwen3.6-27B passt auf eine einzelne 24-GB-GPU, schlägt das frühere 397B MoE auf SWE-bench
Ad

Qwen3.6-27B wurde am 22. April veröffentlicht und bringt ein 27B dichtes Modell, das in eine einzelne 24-GB-GPU bei Q4_K_M (~16,8 GB) passt und 77,2 Punkte im SWE-bench Verified erzielt – und damit das bisherige 397B MoE-Modell (76,2) übertrifft. Für Entwickler, die lokale Codierungsagenten auf Consumer-Hardware betreiben, verschiebt dies die Schwelle für leistungsfähige agentische Modelle.

Wichtige Spezifikationen und Architektur

  • 262K Kontextlänge
  • Apache 2.0 Lizenz
  • Gated DeltaNet lineare Aufmerksamkeit (3 von 4 Unterschichten) mit Gated Attention für den Rest
  • „Thinking Preservation“ überträgt Reasoning-Spuren über mehrere Schritte, reduziert redundante Token-Erzeugung und verbessert die KV-Cache-Effizienz in langen Agentensitzungen
Ad

Hardware-Anforderungen

Bei Q4_K_M benötigt das Modell ~16,8 GB VRAM und passt bequem auf eine einzelne 24-GB-Karte (z. B. RTX 3090/4090, A10G). Im Gegensatz dazu benötigt Qwen3-Coder-Next (80B MoE, 3B aktiv) bei derselben Quantisierung 45–80 GB, was es auf Dual-GPU-Setups oder Apple Silicon mit 48 GB+ Unified Memory beschränkt.

Einschränkungen und Fallstricke

  • Verwenden Sie NICHT CUDA 13.2 – es produziert fehlerhafte Ausgaben. Bleiben Sie bei CUDA 13.1 oder 12.x.
  • Für Benutzer, die Coder-Next bereits auf 48 GB+ Hardware für agentische Aufgaben ausführen, ist der Wechsel nicht offensichtlich vorteilhaft.
  • Für Single-GPU-Benutzer, die auf ältere oder schwächere lokale Codierungsmodelle angewiesen sind, ist Qwen3.6-27B derzeit die leistungsfähigste Option in der 24-GB-Klasse.

📖 Lesen Sie die vollständige Quelle: r/LocalLLaMA

Ad

👀 Siehe auch

Das Feinabstimmen von Phi-4-mini durch das Trainieren ausschließlich der LayerNorm-Parameter führt zu keiner Leistungsverbesserung.
Nachrichten

Das Feinabstimmen von Phi-4-mini durch das Trainieren ausschließlich der LayerNorm-Parameter führt zu keiner Leistungsverbesserung.

Ein Hobbyist testete das Training nur der LayerNorm-γ-Werte bei Phi-4-mini in Python- und medizinischen Domänen mit verschiedenen Lernraten und Datenformaten. Die Leistung verschlechterte sich bei allen Benchmarks leicht im Vergleich zur Basislinie, wobei der Autor zu dem Schluss kam, dass Transformer-Modelle Informationen bereits dynamisch durch Attention lenken.

OpenClawRadar
Organisationen, die GitHub per IP-Adresse blockieren, haben Verbindungsprobleme mit Claude
Nachrichten

Organisationen, die GitHub per IP-Adresse blockieren, haben Verbindungsprobleme mit Claude

Eine automatische Statusmeldung berichtet über Verbindungsfehler für Organisationen, die den GitHub-Zugriff per IP-Adresse einschränken, mit fortlaufender Incident-Verfolgung über status.claude.com.

OpenClawRadar
Alibaba startet Wukong AI-Plattform für Unternehmensautomatisierung
Nachrichten

Alibaba startet Wukong AI-Plattform für Unternehmensautomatisierung

Alibaba hat Wukong gestartet, eine KI-Plattform, die mehrere Agenten koordiniert, um komplexe Geschäftsaufgaben wie Dokumentenbearbeitung, Tabellenkalkulationsaktualisierungen, Meeting-Transkription und Recherche zu bewältigen. Sie befindet sich derzeit in einer Einladungs-Betatestphase.

OpenClawRadar
Qwen3.6 27B FP8 läuft mit 200k Tokens BF16 KV-Cache bei 80 TPS auf RTX 5000 PRO 48GB
Nachrichten

Qwen3.6 27B FP8 läuft mit 200k Tokens BF16 KV-Cache bei 80 TPS auf RTX 5000 PRO 48GB

Ein Reddit-Benutzer stellt ein vLLM-Setup für Qwen3.6 27B FP8 mit BF16-KV-Cache bei 200.000 Token vor und erreicht 60-90 TPS auf einer einzelnen RTX 5000 PRO 48GB. Vollständige Umgebungsvariablen, Konfiguration und Benchmark-Ergebnisse werden bereitgestellt.

OpenClawRadar