MTP-Akzeptanzrate: 50%-Schwelle bestimmt Nutzen spekulativer Dekodierung

Ein Reddit-Nutzer testete MTP (Multi-Token Prediction) mit mlx-vlm auf Gemma-4 (26B, 4-Bit) und stellte fest, dass die Leistung vollständig von der Akzeptanzrate der Draft-Tokens abhängt. Messungen auf einem M4 Max Studio zeigen konkrete Schwellenwerte.
Workload-Ergebnisse
- Code-Generierung: 75 tok/s → 114,8 tok/s (1,53× schneller) — Akzeptanzrate: 66 % der Slots
- Langform-Prosa: 75 tok/s → 71,1 tok/s (0,95×, praktisch gleich) — Akzeptanzrate: 31 % der Slots
- JSON-Ausgabe: 51,3 tok/s → 25,6 tok/s (0,50× langsamer) — Akzeptanzrate: 8 % der Slots
Der Schwellenwert scheint bei etwa 50 % Akzeptanz zu liegen. Darunter überwiegt der Overhead des spekulativen Decodings den Gewinn.
Testdetails: Code war „schreibe einige Python-Funktionen, um X zu tun“; Langform-Prosa war „schreibe einen 800-Wörter-Aufsatz über Papiergeld in der Tang-Dynastie“; JSON-Ausgabe gruppierte Elemente nach Ähnlichkeit in strukturierte Ausgabe.
Bonus-Tipp: Der Nutzer bemerkt, dass Gemmas JSON-Strukturbefolgung ordentlich ist, aber die Aktivierung von strukturierter Ausgabe (json_schema) etwa 20 % Overhead hinzufügt. Er empfiehlt, leicht ungenaues JSON zu akzeptieren und es zur Laufzeit zu korrigieren. mlx-vlm unterstützt ohnehin kein json_schema für spekulatives Decoding.
Fazit: MTP ist großartig für lokales Codieren, kann aber die Leistung bei strukturierten oder Prosa-Aufgaben mit niedrigen Akzeptanzraten verschlechtern.
📖 Read the full source: r/LocalLLaMA
👀 Siehe auch

Haben Sie in einem Monat 850 Dollar für OpenClaw ausgegeben? Beheben Sie Ihre Architektur, nicht Ihr Modell
Ein Entwickler verbrannte in einem Monat 850 $ für ein OpenClaw-Multi-Agenten-Setup – davon 350 $ an einem einzigen Tag. Die Lösung war nicht ein günstigeres Modell, sondern das Systemdesign: striktes Context-Pruning, Sitzungsrücksetzungen, n8n für Nicht-Denksportaufgaben und eine Routing-Ebene für günstige vs. leistungsstarke Modelle.

Agentenbereite Codebasen: Negative Regeln, präzise Namen, Verzeichnis-READMEs
Ein Entwickler erklärt, wie CLAUDE.md-Regeln, negative Anweisungen und präzise Benennung Token-Verschwendung reduzieren und Claude Code davon abhalten, Klassen wie UserManager aufzublähen.

CLAUDE.md-Einträge, die das menschliche Tempoverhalten von Opus 4.7 deaktivieren
Drei CLAUDE.md-Direktiven, die Claude 4.7 Opus davon abhalten, Pausen vorzuschlagen, Zeitüberschätzungen zu liefern und Aufgaben in Phasen aufzuteilen – während langer Codierungssitzungen.

Wichtige benutzerdefinierte Anweisungen für Claude, um häufige Ärgernisse zu vermeiden
Ein Reddit-Nutzer teilt drei spezifische benutzerdefinierte Anweisungen, um häufige Ärgernisse bei Claude zu beheben: Warnungen vor zerstörerischen Befehlen zu verlangen, Planänderungen mitten in Antworten zu verhindern und Codeblöcke ausschließlich für funktionalen Code zu verwenden.