MTP-Akzeptanzrate: 50%-Schwelle bestimmt Nutzen spekulativer Dekodierung

✍️ OpenClawRadar📅 Veröffentlicht: 9. Mai 2026🔗 Source
MTP-Akzeptanzrate: 50%-Schwelle bestimmt Nutzen spekulativer Dekodierung
Ad

Ein Reddit-Nutzer testete MTP (Multi-Token Prediction) mit mlx-vlm auf Gemma-4 (26B, 4-Bit) und stellte fest, dass die Leistung vollständig von der Akzeptanzrate der Draft-Tokens abhängt. Messungen auf einem M4 Max Studio zeigen konkrete Schwellenwerte.

Ad

Workload-Ergebnisse

  • Code-Generierung: 75 tok/s → 114,8 tok/s (1,53× schneller) — Akzeptanzrate: 66 % der Slots
  • Langform-Prosa: 75 tok/s → 71,1 tok/s (0,95×, praktisch gleich) — Akzeptanzrate: 31 % der Slots
  • JSON-Ausgabe: 51,3 tok/s → 25,6 tok/s (0,50× langsamer) — Akzeptanzrate: 8 % der Slots

Der Schwellenwert scheint bei etwa 50 % Akzeptanz zu liegen. Darunter überwiegt der Overhead des spekulativen Decodings den Gewinn.

Testdetails: Code war „schreibe einige Python-Funktionen, um X zu tun“; Langform-Prosa war „schreibe einen 800-Wörter-Aufsatz über Papiergeld in der Tang-Dynastie“; JSON-Ausgabe gruppierte Elemente nach Ähnlichkeit in strukturierte Ausgabe.

Bonus-Tipp: Der Nutzer bemerkt, dass Gemmas JSON-Strukturbefolgung ordentlich ist, aber die Aktivierung von strukturierter Ausgabe (json_schema) etwa 20 % Overhead hinzufügt. Er empfiehlt, leicht ungenaues JSON zu akzeptieren und es zur Laufzeit zu korrigieren. mlx-vlm unterstützt ohnehin kein json_schema für spekulatives Decoding.

Fazit: MTP ist großartig für lokales Codieren, kann aber die Leistung bei strukturierten oder Prosa-Aufgaben mit niedrigen Akzeptanzraten verschlechtern.

📖 Read the full source: r/LocalLLaMA

Ad

👀 Siehe auch

Komprimieren Sie CLAUDE.md-Dateien, um die Systemaufforderungsaufblähung in Claude Code zu reduzieren
Tipps

Komprimieren Sie CLAUDE.md-Dateien, um die Systemaufforderungsaufblähung in Claude Code zu reduzieren

Eine Technik zum Komprimieren von CLAUDE.md-Dateien durch Entfernen menschenlesbarer Formatierungen wie Markdown-Überschriften und Fließtext, die durch kompakte Notationen wie pipe-getrennte Listen ersetzt werden, wodurch eine Reduzierung um 60-70 % der Zeichen erreicht wird, während die gleichen Informationen für Claude erhalten bleiben.

OpenClawRadar
Verwendung von ntfy für OpenClaw-Agenten-Benachrichtigungen
Tipps

Verwendung von ntfy für OpenClaw-Agenten-Benachrichtigungen

Ein Entwickler teilt seine Erfahrungen mit der selbst gehosteten Version von ntfy.sh für Push-Benachrichtigungen von OpenClaw-Agenten, indem er Discord/Telegram-Bots vermeidet, ntfy serve auf demselben VPS ausführt und HTTP-POST-Anfragen nutzt.

OpenClawRadar
Wie deaktiviere ich die Verb-Spinner-Funktion von Claude Code?
Tipps

Wie deaktiviere ich die Verb-Spinner-Funktion von Claude Code?

Claude Code enthält einen standardmäßigen Verb-Spinner, der während der Verarbeitung verspielte Gerundien wie 'Seasoning' und 'Crafting' anzeigt. Sie können ihn deaktivieren, indem Sie die settings.json-Datei bearbeiten und ein Leerzeichen in das spinnerVerbs-Array einfügen.

OpenClawRadar
Claude-Benutzereinstellungen: Ein Reddit-Nutzer-Setup für präzise, kritische Antworten
Tipps

Claude-Benutzereinstellungen: Ein Reddit-Nutzer-Setup für präzise, kritische Antworten

Ein Reddit-Nutzer teilt seine Claude User Preferences-Anpassungen, um weniger geschäftliche und direkt kritische Antworten zu erhalten. Tipps zur Vermeidung von Wiederholungen, zum Beginnen mit Schlussfolgerungen und zur Vereinfachung der Zeichensetzung.

OpenClawRadar