Qwen 3.6 27B F16 besteht den Pacman-Codierungstest, aber 8-Bit-Quantisierungen scheitern — Wichtige Lektionen zu Vorlagen und MTP-spekulativer Dekodierung

Ein Entwickler auf r/LocalLLaMA hat einen praktischen Code-Benchmark geteilt: Einseitig eine einseitige Pacman-Klon-Seite aus einer guten Eingabeaufforderung erstellen, drei Versuche, das beste Ergebnis behalten. Qwen 3.6 27B F16 produzierte zwei fast perfekte Spiele – das erste lokale Modell, das erfolgreich war. Der Wechsel zur 8-Bit-Quantisierung führte jedoch selbst nach fünf Versuchen zu keinen reproduzierbaren guten Ergebnissen, was die Behauptung untermauert, dass 8-Bit-Quantisierung bei komplexen generativen Aufgaben nicht verlustfrei ist.
Wichtige technische Erkenntnisse aus dem Beitrag:
- Chat-Vorlage ist entscheidend: Die offizielle Qwen-Chat-Vorlage ist auf vLLM abgestimmt und enthält Fehler in llama.cpp und anderen Ausführungsprogrammen. Der Autor hat die Fehler iterativ behoben, und nach der Feinabstimmung fühlte sich das Modell wie „eine neue Stufe der Intelligenz“ an.
- MTP-Spekulationsdekodierung variiert je nach Aufgabe: Bei deterministischen Aufgaben wie dem Programmieren lag die generative Tok/s zwischen 8 und 18 Tok/s (Basislinie ohne MTP: 6,6 Tok/s). Kreative Aufgaben erfahren weniger Beschleunigung.
- Die Wahl des Frameworks beeinflusst die Geschwindigkeit mehr als die Codequalität: Qwen CLI schnitt überraschend gut ab – vergleichbar mit Claude Code in der Ausgabequalität, aber viel schneller, da die zusätzlichen Eingabeaufforderungen von Claude Code lokale Modelle verlangsamen. Bei einem langsamen Modell wie Qwen 3.6 27B mit ~6 Tok/s fügt jede zusätzliche Aufforderung schmerzhafte Latenz hinzu.
- Nicht in die Kontextverwaltung eingreifen: Das native Kontext-Caching und die Komprimierung des Modells funktionieren gut. Plugins oder Tools, die den Cache oder Kontext manipulieren, verwirren das Modell und verschlechtern die Leistung.
- Toolaufrufe und Subagenten funktionieren einwandfrei nach korrekter Reparatur der Chat-Vorlage. Kontextkomprimierung, Shell-Nutzung und parallele Subagenten funktionieren wie erwartet.
Der Autor warnt, dass die Ergebnisse stark von der Konfiguration des Ausführungsprogramms abhängen: Verwenden Sie F16-Gewichte, eine korrigierte Chat-Vorlage und vermeiden Sie schwere Frameworks, sofern Sie keine schnelle Inferenz haben. Das vollständig spielbare Pacman-Ergebnis ist verfügbar unter guigand.com/pacman.
📖 Read the full source: r/LocalLLaMA
👀 Siehe auch

LLM-Agent erstellt vollständigen Godot-4-Dungeon-Crawler mithilfe visueller Rückmeldungen
Ein Entwickler verband einen LLM-Agenten mit Godot 4 über ein MCP-Tool und gab ihm eine einzige Aufforderung, um einen Dungeon-Crawler-FPS zu erstellen. Der Agent erstellte einen vollständigen Prototyp mit 3 Räumen, Beleuchtung, Kampfsystem, Gegnern und Fortschrittsmechaniken, indem er das Spiel ausführte, Screenshots machte und visuelle Probleme behob.

Agent-Frameworks verschwenden pro Sitzung über 350.000 Token durch erneutes Senden statischer Dateien.
Ein Benchmark auf einem lokalen Qwen 3.5 122B-Setup zeigte, dass Agent-Frameworks pro Sitzung über 350.000 Token verschwenden, indem sie statische Dateien erneut senden. Ein Compile-Time-Ansatz reduzierte den Abfragekontext von 1.373 Token auf 73, was einer Reduzierung um 95 % entspricht.

OmniCoder-9B: Ein 9-Milliarden-Parameter-Codierungsagent, feinabgestimmt auf 425.000 agentische Trajektorien
Tesslate hat OmniCoder-9B veröffentlicht, ein 9-Milliarden-Parameter-Modell für Coding-Agenten, das auf der hybriden Architektur von Qwen3.5-9B feinabgestimmt wurde. Es wurde mit über 425.000 kuratierten agentischen Coding-Trajektorien von Claude Opus 4.6, GPT-5.4, GPT-5.3-Codex und Gemini 3.1 Pro trainiert.

MOOSE-Star: Ein 7B-Modell und 108K-Papierdatensatz für die wissenschaftliche Hypothesenentdeckung – ICML 2026
MiroMind veröffentlicht MOOSE-Star auf Hugging Face: ein 7B-Modell (DeepSeek-R1-Distill-Qwen-7B-Feintuning) für die Entdeckung wissenschaftlicher Hypothesen, zusammen mit dem 108.000 Paper umfassenden TOMATO-Star-Datensatz. Benchmarks zeigen, dass MS-7B eine Inspirationsabrufgenauigkeit von 54,34 % erreicht und damit GPT-5.4 übertrifft und sich Gemini-3 Pro annähert.