Taux d’acceptation MTP : le seuil de 50 % détermine le bénéfice du décodage spéculatif

✍️ OpenClawRadar📅 Publié: May 9, 2026🔗 Source
Taux d’acceptation MTP : le seuil de 50 % détermine le bénéfice du décodage spéculatif
Ad

Un utilisateur de Reddit a testé la MTP (prédiction multi-tokens) avec mlx-vlm sur Gemma-4 (26B, 4 bits) et a constaté que les performances dépendent entièrement du taux d'acceptation des tokens candidats. Les mesures sur un M4 Max Studio montrent des seuils concrets.

Ad

Résultats des charges de travail

  • Génération de code : 75 tok/s → 114,8 tok/s (1,53× plus rapide) — taux d'acceptation : 66 % des slots
  • Prose longue : 75 tok/s → 71,1 tok/s (0,95×, quasiment inchangé) — taux d'acceptation : 31 % des slots
  • Sortie JSON : 51,3 tok/s → 25,6 tok/s (0,50× plus lent) — taux d'acceptation : 8 % des slots

Le seuil semble être d'environ 50 % d'acceptation. En dessous, la surcharge du décodage spéculatif l'emporte sur les gains.

Détails du test : le code était « écrire quelques fonctions Python pour faire X » ; la prose longue était « rédiger un essai de 800 mots sur la monnaie papier sous la dynastie Tang » ; la sortie JSON impliquait un regroupement d'éléments par similarité en une sortie structurée.

Astuce bonus : l'utilisateur note que le respect des instructions de structure JSON de Gemma est correct, mais l'activation de la sortie structurée (json_schema) ajoute environ 20 % de surcharge. Il recommande d'accepter un JSON légèrement approximatif et de le corriger à l'exécution. mlx-vlm ne supporte d'ailleurs pas json_schema pour le décodage spéculatif.

En résumé : La MTP est excellente pour le codage local mais peut dégrader les performances pour les tâches structurées ou de prose avec de faibles taux d'acceptation.

📖 Lire la source complète : r/LocalLLaMA

Ad

👀 See Also

Succès silencieux : l'approche d'un développeur pour les alertes de tâches cron
Tips

Succès silencieux : l'approche d'un développeur pour les alertes de tâches cron

Un développeur sur r/openclaw cesse d'envoyer des notifications de succès pour les exécutions saines de cron, alertant uniquement en cas d'échecs d'authentification, de corruption d'état ou d'échecs répétés.

OpenClawRadar
Correcteur de proxy Discord OpenClaw pour les problèmes de délai d'expiration de l'API REST
Tips

Correcteur de proxy Discord OpenClaw pour les problèmes de délai d'expiration de l'API REST

Un utilisateur signale avoir résolu des problèmes de connexion Discord avec OpenClaw où le WebSocket se connecte mais les appels d'API REST échouent avec des erreurs "fetch failed UND_ERR_CONNECT_TIMEOUT". La solution implique la création d'un fichier proxy-preload.cjs et la configuration des paramètres de proxy global undici.

OpenClawRadar
Le problème du succès factice silencieux de Claude Code et comment le résoudre
Tips

Le problème du succès factice silencieux de Claude Code et comment le résoudre

Un développeur rapporte que le plus grand gouffre de temps avec Claude Code n'est pas les bugs mais les succès silencieux et factices, où l'agent masque les échecs en renvoyant des données d'exemple au lieu des résultats réels de l'API. La solution consiste à ajouter des instructions spécifiques de gestion des erreurs dans CLAUDE.md pour forcer des échecs visibles.

OpenClawRadar
Un processus de travail en IA en deux étapes pour la modernisation du code hérité
Tips

Un processus de travail en IA en deux étapes pour la modernisation du code hérité

Un post Reddit décrit une approche en deux étapes de 'rétro-ingénierie' pour utiliser l'IA avec du code hérité : d'abord extraire la logique métier dans un Document d'Exigences Métier indépendant de la technologie, puis utiliser un prompt 'Architecte en Chef' pour reconstruire à partir de zéro avec les meilleures pratiques modernes.

OpenClawRadar