Qwen 3.6 27B F16 besteht den Pacman-Codierungstest, aber 8-Bit-Quantisierungen scheitern — Wichtige Lektionen zu Vorlagen und MTP-spekulativer Dekodierung

Ein Entwickler auf r/LocalLLaMA hat einen praktischen Code-Benchmark geteilt: Einseitig eine einseitige Pacman-Klon-Seite aus einer guten Eingabeaufforderung erstellen, drei Versuche, das beste Ergebnis behalten. Qwen 3.6 27B F16 produzierte zwei fast perfekte Spiele – das erste lokale Modell, das erfolgreich war. Der Wechsel zur 8-Bit-Quantisierung führte jedoch selbst nach fünf Versuchen zu keinen reproduzierbaren guten Ergebnissen, was die Behauptung untermauert, dass 8-Bit-Quantisierung bei komplexen generativen Aufgaben nicht verlustfrei ist.
Wichtige technische Erkenntnisse aus dem Beitrag:
- Chat-Vorlage ist entscheidend: Die offizielle Qwen-Chat-Vorlage ist auf vLLM abgestimmt und enthält Fehler in llama.cpp und anderen Ausführungsprogrammen. Der Autor hat die Fehler iterativ behoben, und nach der Feinabstimmung fühlte sich das Modell wie „eine neue Stufe der Intelligenz“ an.
- MTP-Spekulationsdekodierung variiert je nach Aufgabe: Bei deterministischen Aufgaben wie dem Programmieren lag die generative Tok/s zwischen 8 und 18 Tok/s (Basislinie ohne MTP: 6,6 Tok/s). Kreative Aufgaben erfahren weniger Beschleunigung.
- Die Wahl des Frameworks beeinflusst die Geschwindigkeit mehr als die Codequalität: Qwen CLI schnitt überraschend gut ab – vergleichbar mit Claude Code in der Ausgabequalität, aber viel schneller, da die zusätzlichen Eingabeaufforderungen von Claude Code lokale Modelle verlangsamen. Bei einem langsamen Modell wie Qwen 3.6 27B mit ~6 Tok/s fügt jede zusätzliche Aufforderung schmerzhafte Latenz hinzu.
- Nicht in die Kontextverwaltung eingreifen: Das native Kontext-Caching und die Komprimierung des Modells funktionieren gut. Plugins oder Tools, die den Cache oder Kontext manipulieren, verwirren das Modell und verschlechtern die Leistung.
- Toolaufrufe und Subagenten funktionieren einwandfrei nach korrekter Reparatur der Chat-Vorlage. Kontextkomprimierung, Shell-Nutzung und parallele Subagenten funktionieren wie erwartet.
Der Autor warnt, dass die Ergebnisse stark von der Konfiguration des Ausführungsprogramms abhängen: Verwenden Sie F16-Gewichte, eine korrigierte Chat-Vorlage und vermeiden Sie schwere Frameworks, sofern Sie keine schnelle Inferenz haben. Das vollständig spielbare Pacman-Ergebnis ist verfügbar unter guigand.com/pacman.
📖 Read the full source: r/LocalLLaMA
👀 Siehe auch
Needle: Ein Tool-Calling-Modell mit 26 Millionen Parametern, vollständig ohne FFNs aufgebaut
Needle ist ein 26M-Parameter-Modell für Funktionsaufrufe ohne MLPs, das auf Endgeräten 6000 tok/s Prefill und 1200 tok/s Decode erreicht. Es schlägt FunctionGemma-270M, Qwen-0.6B, Granite-350M und LFM2.5-350M beim einmaligen Tool-Aufruf.

Open-Source Claude-Fähigkeiten für Produktmanager: PRD-Generator, User Stories, Meeting-Notizen
Ein Entwickler hat fünf kostenlose Claude AI-Fähigkeiten für Produktmanager veröffentlicht, die formatierte .docx-Dateien für PRDs, User Stories, Meeting-Synthesen, Marktforschung und Stakeholder-Updates generieren. Die Tools vermeiden halluzinierte Inhalte und nutzen strukturierte Vorlagen.
Tendril: Ein sich selbst erweiternder Agent, der Werkzeuge im Handumdrehen erstellt und registriert
Tendril ist eine agentische Sandbox, die autonom Werkzeuge entdeckt, erstellt und registriert. Sie startet mit nur drei Bootstrap-Werkzeugen und erweitert dynamisch ihre Fähigkeitsregistrierung, ohne den Nutzer zu fragen.

Claude Code v2.1.143: Plugin-Abhängigkeitsdurchsetzung, PowerShell-Standardeinstellungen und Hintergrundsitzungs-Korrekturen
Anthropic hat Claude Code v2.1.143 mit Plugin-Abhängigkeitserzwingung, PowerShell -ExecutionPolicy Bypass, einer neuen Worktree-Isolationsoption und zahlreichen Fehlerbehebungen für Hintergrundsitzungen, Windows Terminal und macOS-Dateizugriff veröffentlicht.