Qwen 3.6 27B im DeepSWE-Benchmark: 2% Punktzahl, 70 Stunden, 44k durchschnittliche Ausgabetoken

Ein Reddit-Nutzer hat Qwen 3.6 27B auf dem DeepSWE-Benchmark getestet und erreichte eine Punktzahl von 2% (1,79% aufgerundet) – Platz 18 von 20, vor Haiku 4.5 und Minimax M2.7. Der gesamte Lauf dauerte 70 Stunden, mit einer durchschnittlichen Aufgabenzeit von 32 Minuten und durchschnittlich 44k Ausgabetoken pro Aufgabe – überraschenderweise auf Augenhöhe mit dem größeren Qwen 3.6 Plus, trotz des Rufs des 27B-Modells für Ausführlichkeit.
Methodik
- Modell: Qwen 3.6 27B FP8 mit BF16 KV-Cache, Reasoning aktiviert, 262k Kontextfenster, bereitgestellt über VLLM
- Hardware: 1x RTX6000 Pro Blackwell auf RunPod
- Agent-Werkzeug: mini-swe auf Modal-Sandboxes
- 1 Durchlauf pro Aufgabe (statt der offiziellen 4) um Zeit zu sparen; keine Punktzahlspanne
- Kosten basierend auf RunPod-Stundensatz für abgeschlossene Aufgaben
- Orchestrierung: Codex 5.5xhigh überwachte und verwaltete den gesamten Lauf
Wichtige Beobachtungen
Der Autor merkt an, dass die Punktzahl verdächtig nahe an Qwen 3.6 Plus liegt, was Fragen zu den architektonischen Unterschieden aufwirft. Er argumentiert, dass lokale Modelle weiter hinter den führenden Closed-Source-Angeboten zurückfallen: K2.6 ist das beste Open-Source-Modell, aber die meisten können es nicht einmal lokal ausführen. Qwen 3.6 27B wird als "arme Leute SOTA"-Option für den lokalen Betrieb positioniert. Der Trend deutet darauf hin, dass Spitzenleistungen große Skalierung erfordern, was oft zu Closed Source führt, was lokale Inferenz in Bezug auf Wettbewerbsfähigkeit zu einem verlorenen Spiel macht.
📖 Vollständige Quelle lesen: r/LocalLLaMA
👀 Siehe auch

KI-gesteuerte Roboterhunde für Überwachung in Atlanta eingesetzt
Vierbeinige Roboterhunde, die mit Kameras und KI ausgestattet sind, patrouillieren auf den Straßen, in Wohnanlagen und auf Baustellen in Atlanta. Sie streamen rund um die Uhr 360°-Video an entfernte Operatoren als kostengünstigere Alternative zu menschlichen Wachleuten.

Claude Code 2.1.63 fügt gebündelte Slash-Befehle, HTTP-Hooks und Speicherleck-Behebungen hinzu
Anthropic hat Claude Code 2.1.63 veröffentlicht mit 26 CLI-Änderungen, darunter neue /simplify- und /batch-Slash-Befehle, HTTP-Hooks, die JSON an URLs senden, und Behebungen für mehrere Speicherlecks in lang laufenden Sitzungen.

OpenClaw-Agenten treten in einer KI-exklusiven Pokémon-Rot-Liga an
Eine neue Plattform namens AgentMonLeague ermöglicht es autonomen OpenClaw-Agenten, sich mit einem Pokémon-Rot-Emulator zu verbinden, eigene Entscheidungen während eines kompletten Durchspielens zu treffen und darum zu konkurrieren, das Spiel als Erster zu beenden. Die Läufe sind live verfolgbar, während die Agenten voranschreiten.

OpenClaw-Ökosystemwachstum und Schlüsselakteure kartiert
Ein Community-Mitglied hat die rasante Expansion des OpenClaw-Ökosystems kartiert und verzeichnete innerhalb von 60 Tagen nach dem Start über 230.000 GitHub-Sterne, über 116.000 Discord-Mitglieder sowie aufkommende Unternehmen in den Bereichen Managed Hosting, LLM-Routing und Sicherheitsschichten.