Qwen3.6-27B passt auf eine einzelne 24-GB-GPU, schlägt das frühere 397B MoE auf SWE-bench

Qwen3.6-27B wurde am 22. April veröffentlicht und bringt ein 27B dichtes Modell, das in eine einzelne 24-GB-GPU bei Q4_K_M (~16,8 GB) passt und 77,2 Punkte im SWE-bench Verified erzielt – und damit das bisherige 397B MoE-Modell (76,2) übertrifft. Für Entwickler, die lokale Codierungsagenten auf Consumer-Hardware betreiben, verschiebt dies die Schwelle für leistungsfähige agentische Modelle.
Wichtige Spezifikationen und Architektur
- 262K Kontextlänge
- Apache 2.0 Lizenz
- Gated DeltaNet lineare Aufmerksamkeit (3 von 4 Unterschichten) mit Gated Attention für den Rest
- „Thinking Preservation“ überträgt Reasoning-Spuren über mehrere Schritte, reduziert redundante Token-Erzeugung und verbessert die KV-Cache-Effizienz in langen Agentensitzungen
Hardware-Anforderungen
Bei Q4_K_M benötigt das Modell ~16,8 GB VRAM und passt bequem auf eine einzelne 24-GB-Karte (z. B. RTX 3090/4090, A10G). Im Gegensatz dazu benötigt Qwen3-Coder-Next (80B MoE, 3B aktiv) bei derselben Quantisierung 45–80 GB, was es auf Dual-GPU-Setups oder Apple Silicon mit 48 GB+ Unified Memory beschränkt.
Einschränkungen und Fallstricke
- Verwenden Sie NICHT CUDA 13.2 – es produziert fehlerhafte Ausgaben. Bleiben Sie bei CUDA 13.1 oder 12.x.
- Für Benutzer, die Coder-Next bereits auf 48 GB+ Hardware für agentische Aufgaben ausführen, ist der Wechsel nicht offensichtlich vorteilhaft.
- Für Single-GPU-Benutzer, die auf ältere oder schwächere lokale Codierungsmodelle angewiesen sind, ist Qwen3.6-27B derzeit die leistungsfähigste Option in der 24-GB-Klasse.
📖 Lesen Sie die vollständige Quelle: r/LocalLLaMA
👀 Siehe auch

KI schrieb eine PHP-Engine in Rust, besteht 17 % der PHP-src-Tests, rendert WordPress
Phargo, ein von Grund auf in Rust geschriebener PHP-Interpreter, komplett von KI erstellt, besteht 3.844 von 22.037 PHP-Upstream-Tests (17,4 %) und rendert WordPress-Seiten aus SQLite.

Papst Leo XIV. 'Magnifica Humanitas': Eine 40.000 Wörter umfassende Enzyklika zur Abrüstung der KI
Papst Leo XIV. veröffentlicht Magnifica Humanitas, eine 40.000 Worte umfassende Enzyklika, die zur Abrüstung der KI aufruft, autonome Waffen, Datenkolonialismus und Technologiemonopole kritisiert. Der Mitbegründer von Anthropic war bei der Veröffentlichung anwesend.

Pentagon gibt Anthropic 72 Stunden Zeit, um militärische Nutzung von Claude AI zu ermöglichen
Das Pentagon hat Anthropic ein 72-Stunden-Ultimatum gestellt, um der US-Militär die Nutzung seiner Claude KI zu erlauben, und droht damit, ein Gesetz aus dem Jahr 1950 anzuwenden, um die Einhaltung zu erzwingen, falls das Startup nicht nachkommt.

MLX-Inferenzleistungsupdate: Benchmarks und Funktionen vom April 2026
Die MLX-Inferenzleistung hat sich erheblich verbessert, wobei Qwen3.5-35B-A3B bei einem 4K-Kontext 71,8 Token/Sekunde erreicht. Neue Funktionen wie Multi-Token Prediction und SpecPrefill bieten für große Modelle eine 2,3- bis 5,5-fache Beschleunigung.