MTP-Akzeptanzrate: 50%-Schwelle bestimmt Nutzen spekulativer Dekodierung

Ein Reddit-Nutzer testete MTP (Multi-Token Prediction) mit mlx-vlm auf Gemma-4 (26B, 4-Bit) und stellte fest, dass die Leistung vollständig von der Akzeptanzrate der Draft-Tokens abhängt. Messungen auf einem M4 Max Studio zeigen konkrete Schwellenwerte.
Workload-Ergebnisse
- Code-Generierung: 75 tok/s → 114,8 tok/s (1,53× schneller) — Akzeptanzrate: 66 % der Slots
- Langform-Prosa: 75 tok/s → 71,1 tok/s (0,95×, praktisch gleich) — Akzeptanzrate: 31 % der Slots
- JSON-Ausgabe: 51,3 tok/s → 25,6 tok/s (0,50× langsamer) — Akzeptanzrate: 8 % der Slots
Der Schwellenwert scheint bei etwa 50 % Akzeptanz zu liegen. Darunter überwiegt der Overhead des spekulativen Decodings den Gewinn.
Testdetails: Code war „schreibe einige Python-Funktionen, um X zu tun“; Langform-Prosa war „schreibe einen 800-Wörter-Aufsatz über Papiergeld in der Tang-Dynastie“; JSON-Ausgabe gruppierte Elemente nach Ähnlichkeit in strukturierte Ausgabe.
Bonus-Tipp: Der Nutzer bemerkt, dass Gemmas JSON-Strukturbefolgung ordentlich ist, aber die Aktivierung von strukturierter Ausgabe (json_schema) etwa 20 % Overhead hinzufügt. Er empfiehlt, leicht ungenaues JSON zu akzeptieren und es zur Laufzeit zu korrigieren. mlx-vlm unterstützt ohnehin kein json_schema für spekulatives Decoding.
Fazit: MTP ist großartig für lokales Codieren, kann aber die Leistung bei strukturierten oder Prosa-Aufgaben mit niedrigen Akzeptanzraten verschlechtern.
📖 Read the full source: r/LocalLLaMA
👀 Siehe auch

Komprimieren Sie CLAUDE.md-Dateien, um die Systemaufforderungsaufblähung in Claude Code zu reduzieren
Eine Technik zum Komprimieren von CLAUDE.md-Dateien durch Entfernen menschenlesbarer Formatierungen wie Markdown-Überschriften und Fließtext, die durch kompakte Notationen wie pipe-getrennte Listen ersetzt werden, wodurch eine Reduzierung um 60-70 % der Zeichen erreicht wird, während die gleichen Informationen für Claude erhalten bleiben.

Verwendung von ntfy für OpenClaw-Agenten-Benachrichtigungen
Ein Entwickler teilt seine Erfahrungen mit der selbst gehosteten Version von ntfy.sh für Push-Benachrichtigungen von OpenClaw-Agenten, indem er Discord/Telegram-Bots vermeidet, ntfy serve auf demselben VPS ausführt und HTTP-POST-Anfragen nutzt.

Wie deaktiviere ich die Verb-Spinner-Funktion von Claude Code?
Claude Code enthält einen standardmäßigen Verb-Spinner, der während der Verarbeitung verspielte Gerundien wie 'Seasoning' und 'Crafting' anzeigt. Sie können ihn deaktivieren, indem Sie die settings.json-Datei bearbeiten und ein Leerzeichen in das spinnerVerbs-Array einfügen.

Claude-Benutzereinstellungen: Ein Reddit-Nutzer-Setup für präzise, kritische Antworten
Ein Reddit-Nutzer teilt seine Claude User Preferences-Anpassungen, um weniger geschäftliche und direkt kritische Antworten zu erhalten. Tipps zur Vermeidung von Wiederholungen, zum Beginnen mit Schlussfolgerungen und zur Vereinfachung der Zeichensetzung.