Qwen3.6 Plus Benchmark-Vergleich mit westlichen SOTA-Modellen

Ein Reddit-Beitrag auf r/LocalLLaMA vergleicht Qwen3.6 Plus mit mehreren westlichen State-of-the-Art-Modellen über mehrere Benchmarks hinweg. Der Vergleich umfasst spezifische Leistungsmetriken für jedes Modell.
Benchmark-Ergebnisse
Die Quelle liefert diese genauen Werte:
- Qwen3.6-Plus: SWE-bench Verified 78,8, GPQA / GPQA Diamond 90,4, HLE (ohne Werkzeuge) 28,8, MMMU-Pro 78,8
- GPT‑5.4 (xhigh): SWE-bench Verified 78,2, GPQA / GPQA Diamond 93,0, HLE (ohne Werkzeuge) 39,8, MMMU-Pro 81,2
- Claude Opus 4.6 (thinking heavy): SWE-bench Verified 80,8, GPQA / GPQA Diamond 91,3, HLE (ohne Werkzeuge) 34,44, MMMU-Pro 77,3
- Gemini 3.1 Pro Preview: SWE-bench Verified 80,6, GPQA / GPQA Diamond 94,3, HLE (ohne Werkzeuge) 44,7, MMMU-Pro 80,5
Der Beitrag enthält einen visuellen Vergleichs-Chart unter: https://preview.redd.it/6kq4tt07yrsg1.png?width=714&format=png&auto=webp&s=ad8b207fb13729ae84f5b74cec5fd84a81dcface
Nutzerbewertung
Der ursprüngliche Poster stellt fest, dass Qwen3.6 Plus "wettbewerbsfähig, aber nicht die Spitze" ist und erklärt: "Wird mein neues Modell sein, da es so günstig ist, aber ob es in der Praxis wirklich gut ist, hängt von mehr als Benchmarks ab." Er bemerkt auch, dass "Opus alle anderen trotz Platz 3 oder 4 bei artificalanalysis zerstört."
📖 Read the full source: r/LocalLLaMA
👀 Siehe auch
The Atlantic berichtet über zunehmende Anti-KI-Gewalt und politische Gegenreaktionen
Bernie Sanders und Steve Bannon bezeichnen KI gleichermaßen als Bedrohung für Arbeiter. Ein Molotowcocktail-Angriff auf Sam Altmans Haus und die Schießerei auf einen Stadtrat in Indianapolis zeigen, dass die Gewalt gegen Rechenzentren zunimmt.

Mistral Medium 3.5 128B veröffentlicht: Dichtes Modell mit konfigurierbarem Reasoning und Vision
Mistral AI hat Mistral Medium 3.5 veröffentlicht, ein dichtes Modell mit 128B Parametern, 256k Kontext, konfigurierbarem Reasoning-Aufwand und Vision-Funktionen, unter einer modifizierten MIT-Lizenz.

Training GPT-1 auf einer RTX 2060 Super 8GB – Machbarkeitsnachweis für lokales Vortraining
Ein Entwickler trainierte das ursprüngliche GPT-1 (117M Parameter) lokal auf einer RTX 2060 Super mit 8 GB VRAM in 1 Stunde und beweist damit, dass jeder mit einer Gaming-GPU ein 1B-Modell vortrainieren kann. Code und Gewichte sind Open Source.

Reddit-Benutzer meldet 18,8 Tok/s CPU-Inferenz mit Qwen 3 30B Q4 auf Zen 4
Ein Nutzer auf r/LocalLLaMA testete Qwen 3 30B Q4 auf CPU und erreichte 18,8 Token pro Sekunde mit einem Zen-4-Prozessor und DDR5-Arbeitsspeicher, was die Erwartungen von 3-5 Tok/s deutlich übertraf.