Taux d’acceptation MTP : le seuil de 50 % détermine le bénéfice du décodage spéculatif

✍️ OpenClawRadar📅 Publié: May 9, 2026🔗 Source
Taux d’acceptation MTP : le seuil de 50 % détermine le bénéfice du décodage spéculatif
Ad

Un utilisateur de Reddit a testé la MTP (prédiction multi-tokens) avec mlx-vlm sur Gemma-4 (26B, 4 bits) et a constaté que les performances dépendent entièrement du taux d'acceptation des tokens candidats. Les mesures sur un M4 Max Studio montrent des seuils concrets.

Ad

Résultats des charges de travail

  • Génération de code : 75 tok/s → 114,8 tok/s (1,53× plus rapide) — taux d'acceptation : 66 % des slots
  • Prose longue : 75 tok/s → 71,1 tok/s (0,95×, quasiment inchangé) — taux d'acceptation : 31 % des slots
  • Sortie JSON : 51,3 tok/s → 25,6 tok/s (0,50× plus lent) — taux d'acceptation : 8 % des slots

Le seuil semble être d'environ 50 % d'acceptation. En dessous, la surcharge du décodage spéculatif l'emporte sur les gains.

Détails du test : le code était « écrire quelques fonctions Python pour faire X » ; la prose longue était « rédiger un essai de 800 mots sur la monnaie papier sous la dynastie Tang » ; la sortie JSON impliquait un regroupement d'éléments par similarité en une sortie structurée.

Astuce bonus : l'utilisateur note que le respect des instructions de structure JSON de Gemma est correct, mais l'activation de la sortie structurée (json_schema) ajoute environ 20 % de surcharge. Il recommande d'accepter un JSON légèrement approximatif et de le corriger à l'exécution. mlx-vlm ne supporte d'ailleurs pas json_schema pour le décodage spéculatif.

En résumé : La MTP est excellente pour le codage local mais peut dégrader les performances pour les tâches structurées ou de prose avec de faibles taux d'acceptation.

📖 Lire la source complète : r/LocalLLaMA

Ad

👀 See Also

Conseils pratiques pour un flux de travail efficace avec Claude Code dans les projets de développement complexes
Tips

Conseils pratiques pour un flux de travail efficace avec Claude Code dans les projets de développement complexes

Un utilisateur de Claude Pro partage des stratégies de flux de travail spécifiques pour développer des plugins audio complexes, incluant l'utilisation du mode planification pour les fonctionnalités majeures, la création de fichiers de contexte, la gestion de l'utilisation des tokens et la mise en œuvre d'étapes de validation.

OpenClawRadar
La négociation par incitation est faible : décrivez plutôt explicitement le comportement souhaité
Tips

La négociation par incitation est faible : décrivez plutôt explicitement le comportement souhaité

Une analyse Reddit montre que dire à Claude « ne sois pas bavard » ou « ne moralise pas » fonctionne à peine. Utilisez plutôt des instructions positives comme « réponds en 1 à 2 phrases » ou « donne-moi une réponse directe, considère les mises en garde comme facultatives ». Aussi, terminer par « merci ! » adoucit le ton.

OpenClawRadar
🦀
Tips

Scripts de démarrage à froid et de fin de session : une meilleure mémoire d'agent pour OpenClaw

Un utilisateur d'OpenClaw partage ses scripts de démarrage à froid et de fin de session, ainsi qu'un répertoire SOP, pour aider les agents à changer de contexte et à résoudre des problèmes récurrents sans réapprendre les solutions.

OpenClawRadar
Des invites système courtes améliorent l'adhérence de Claude et réduisent le gaspillage de jetons
Tips

Des invites système courtes améliorent l'adhérence de Claude et réduisent le gaspillage de jetons

Un développeur a découvert qu'en remplaçant une instruction système de 3 847 mots par plusieurs petites instructions ciblées (total ~200 mots), les dérives d'oubli des instructions de Claude ont disparu.

OpenClawRadar