MTPLX : Jetons 2,24x plus rapides sur Apple Silicon grâce aux têtes MTP natives

MTPLX est un moteur d'inférence pour Apple Silicon qui exploite les têtes de prédiction multi-tokens (MTP) intégrées d'un modèle comme rédacteurs spéculatifs. Le résultat clé : Qwen 3.6 27B 4-bit MLX passe de 28 tok/s à 63 tok/s (2,24× plus rapide) sur un MacBook Pro M5 Max avec température 0,6, top_p 0,95, top_k 20 — les paramètres exacts recommandés par Qwen pour le codage.
Comment ça marche
Contrairement à DFlash ou DDTree (qui nécessitent un modèle rédacteur externe et sont uniquement gloutons), MTPLX utilise les propres têtes MTP du modèle. Chaque tête MTP rédige séquentiellement, produisant des distributions de probabilité par token. Cela permet un échantillonnage par rejet exact avec température et correction résiduelle. Pas de rédacteur externe signifie pas d'utilisation mémoire supplémentaire.
Pour Qwen 3.6 27B (qui dispose de têtes MTP jusqu'à une profondeur de 5), la profondeur optimale trouvée après balayage de D2 à D5 était D3. Les profondeurs plus élevées (D4/D5) avaient un bon taux d'acceptation précoce, mais les positions plus profondes coûtaient plus de temps de vérification que de tokens économisés.
Statut vs DFlash / DDTree
DFlash MLX atteint une vitesse brute plus élevée, mais est limité à un échantillonnage glouton (température 0) uniquement, ce qui limite sévèrement son utilisation réelle. DDTree hérite des mêmes limitations. Les deux nécessitent un rédacteur externe. MTPLX fonctionne avec tout modèle qui conserve ses têtes MTP et supporte l'inférence complète avec échantillonnage à température.
Installation et utilisation
MTPLX est fourni avec une interface en ligne de commande complète avec les commandes suivantes :
mtplx start wizard— configuration guidée- Téléchargement et inspection de modèle avec détection de compatibilité MTP à quatre niveaux
- Profondeur configurable de 2 à 7+
- Serveur API compatible OpenAI/Anthropic, interface de chat navigateur, chat en terminal
- Suite de benchmarks, diagnostics de santé, contrôle de ventilateur avec arrêt sécurisé et restauration automatique en cas d'inactivité
- Suite de 562 tests incluse
Le moteur est construit sur un fork MLX modifié avec des kernels Metal personnalisés, des graphes de vérification compilés, un rollback GDN par bande d'innovation, et une tête LM requantifiée dédiée au draft.
À qui s'adresse-t-il
Développeurs exécutant des LLM locaux sur Apple Silicon qui ont besoin d'inférence à haut débit avec échantillonnage à température pour le codage ou l'écriture créative, sans sacrifier la qualité de sortie.
📖 Lire la source originale : r/LocalLLaMA
👀 See Also

Deux nouveaux outils open source pour la sécurité et l'optimisation des agents d'IA
Deux outils open source sont disponibles pour les développeurs d'agents IA : AI Agent Defense Kit fournit des compétences de sécurité en temps d'exécution, et AgentGuard (en développement) propose le suivi des coûts, l'analyse de sécurité et la surveillance des activités.

Quatre Crochets de Code Claude Appliquent la Cohérence de Voix et de Ton dans les Textes Rédigés par l'IA
Un développeur a créé un système utilisant quatre crochets Claude Code pour empêcher que les textes générés par l'IA ne s'éloignent de l'identité de marque. Le système bloque l'édition des fichiers de texte (.tsx, .md) jusqu'à ce qu'un agent réviseur valide le contenu par rapport à un guide VOICE-AND-TONE.md.

Claude Code Flux de travail dynamiques : Sous-agents parallèles et mode UltraCode
Claude Code introduit des workflows dynamiques qui orchestrent des dizaines à des centaines de sous-agents parallèles pour des tâches complexes comme la chasse aux bugs à l'échelle d'une base de code, les migrations massives et la vérification multi-angle. Le mode UltraCode déclenche automatiquement les workflows sur les problèmes difficiles.

Top 6 compétences open source de Claude (15 avril – 3 mai)
Six compétences open-source de Claude des 15 derniers jours : brand-alchemy, npm-downloads-to-leads, hyperframes, email-newsletter, pricing, et plus. Détail des fonctionnalités de chaque compétence.