Qwen 3.6 27B im DeepSWE-Benchmark: 2% Punktzahl, 70 Stunden, 44k durchschnittliche Ausgabetoken

✍️ OpenClawRadar📅 Veröffentlicht: 22. Juni 2026🔗 Source
Qwen 3.6 27B im DeepSWE-Benchmark: 2% Punktzahl, 70 Stunden, 44k durchschnittliche Ausgabetoken
Ad

Ein Reddit-Nutzer hat Qwen 3.6 27B auf dem DeepSWE-Benchmark getestet und erreichte eine Punktzahl von 2% (1,79% aufgerundet) – Platz 18 von 20, vor Haiku 4.5 und Minimax M2.7. Der gesamte Lauf dauerte 70 Stunden, mit einer durchschnittlichen Aufgabenzeit von 32 Minuten und durchschnittlich 44k Ausgabetoken pro Aufgabe – überraschenderweise auf Augenhöhe mit dem größeren Qwen 3.6 Plus, trotz des Rufs des 27B-Modells für Ausführlichkeit.

Methodik

  • Modell: Qwen 3.6 27B FP8 mit BF16 KV-Cache, Reasoning aktiviert, 262k Kontextfenster, bereitgestellt über VLLM
  • Hardware: 1x RTX6000 Pro Blackwell auf RunPod
  • Agent-Werkzeug: mini-swe auf Modal-Sandboxes
  • 1 Durchlauf pro Aufgabe (statt der offiziellen 4) um Zeit zu sparen; keine Punktzahlspanne
  • Kosten basierend auf RunPod-Stundensatz für abgeschlossene Aufgaben
  • Orchestrierung: Codex 5.5xhigh überwachte und verwaltete den gesamten Lauf
Ad

Wichtige Beobachtungen

Der Autor merkt an, dass die Punktzahl verdächtig nahe an Qwen 3.6 Plus liegt, was Fragen zu den architektonischen Unterschieden aufwirft. Er argumentiert, dass lokale Modelle weiter hinter den führenden Closed-Source-Angeboten zurückfallen: K2.6 ist das beste Open-Source-Modell, aber die meisten können es nicht einmal lokal ausführen. Qwen 3.6 27B wird als "arme Leute SOTA"-Option für den lokalen Betrieb positioniert. Der Trend deutet darauf hin, dass Spitzenleistungen große Skalierung erfordern, was oft zu Closed Source führt, was lokale Inferenz in Bezug auf Wettbewerbsfähigkeit zu einem verlorenen Spiel macht.

📖 Vollständige Quelle lesen: r/LocalLLaMA

Ad

👀 Siehe auch

Tag 10: Ein Spiel mit Claude Code entwickeln – 3.200 Spieler und Server-Zusammenbruch
Nachrichten

Tag 10: Ein Spiel mit Claude Code entwickeln – 3.200 Spieler und Server-Zusammenbruch

Ein Solo-Entwickler baute mit Claude Code hauptsächlich ein Live-Multiplayer-Drag-Racing-Spiel. Zehn Tage später: 3.200 Spieler, 100.000 tägliche API-Anfragen erschöpft, Spiel friert ein. Vollständige Zusammenfassung der ausgelieferten Funktionen – Echtzeit-Multiplayer, 50 neue Strecken, ein dritter Planet, eine Elefantenjagd.

OpenClawRadar
Claude Code v2.1.129: Plugin-URL-Flag, erzwungene Synchronausgabe und über 20 Fehlerbehebungen
Nachrichten

Claude Code v2.1.129: Plugin-URL-Flag, erzwungene Synchronausgabe und über 20 Fehlerbehebungen

Fügt --plugin-url-Flag hinzu, um Plugin-Zips von URLs zu laden, CLAUDE_CODE_FORCE_SYNC_OUTPUT für Emacs eat, und behebt /context-Token-Verschwendung, Cache-TTL-Downgrade und OAuth-Race.

OpenClawRadar
Anthropic startet Claude Code Channels für Messaging-Integration
Nachrichten

Anthropic startet Claude Code Channels für Messaging-Integration

Anthropic hat Claude Code Channels eingeführt, die es Entwicklern ermöglichen, über Telegram oder Discord direkt mit Claude Code-Sitzungen zu kommunizieren, mit vollem Zugriff auf Werkzeuge wie Dateibearbeitungen, Testläufe und Git-Operationen. Die Funktion erfordert einen kostenpflichtigen Anthropic-Plan und unterstützt zwei Plattformen im Vergleich zu OpenClaws 20+.

OpenClawRadar
Untersuchung: Claude Code Agenten zeigen ungeprüfte MEMORY.md-Inhalte aufgrund von Komprimierungsänderungen an
Nachrichten

Untersuchung: Claude Code Agenten zeigen ungeprüfte MEMORY.md-Inhalte aufgrund von Komprimierungsänderungen an

Ein Benutzer meldet, dass Claude Code Agenten Inhalte aus MEMORY.md anzeigen, ohne sie während der Aufgabe erneut zu überprüfen, was auf Kompaktierungsänderungen in den Versionen 2.1.139 und 2.1.141 zurückzuführen ist. Zwei verstärkende Faktoren: aggressive Beibehaltung von "Benutzeranweisungen" und ein Fehler bei den Autocompact-Schwellenwerten.

OpenClawRadar