Lightning MLX : Moteur IA local rapide pour usage agentique sur Apple Silicon délivre 220 tok/s sur Qwen 35B-A3B

✍️ OpenClawRadar📅 Publié: May 8, 2026🔗 Source
Lightning MLX : Moteur IA local rapide pour usage agentique sur Apple Silicon délivre 220 tok/s sur Qwen 35B-A3B
Ad

Un nouveau moteur d'inférence open source pour Apple Silicon appelé Lightning MLX revendique être le moteur IA local le plus rapide, spécialement optimisé pour les workflows agentiques — agents de codage, appels d'outils et tâches à faible latence. Le projet est disponible sur GitHub à l'adresse samuelfaj/lightning-mlx.

Résultats des benchmarks

L'auteur a testé sur un MacBook Max M5 avec 128 Go de RAM et a rapporté les vitesses de génération de tokens suivantes :

  • Qwen3.6-27B : 40,67 tok/s
  • Qwen3.6-35B-A3B : 220,86 tok/s

Ces résultats suggèrent que le moteur est particulièrement efficace pour l'architecture mixture-of-experts utilisée dans le modèle Qwen3.6-35B-A3B, qui n'active qu'un sous-ensemble de paramètres par token.

Ad

Fonctionnalités clés

  • Optimisé pour les cas d'usage agentiques à faible latence — génération de code, appels d'outils et boucles d'inférence rapides
  • Inclut une configuration prédéfinie appelée MTPLX (valeurs d'échantillonnage personnalisées) ; l'auteur sollicite des retours pour savoir si ces valeurs par défaut sont adaptées à un usage en production
  • Open source sous licence MIT (probablement) sur GitHub

Demandes de retours

Le créateur demande activement à la communauté :

  • De meilleures conceptions de benchmarks pour les agents de codage locaux
  • Des avis sur les valeurs par défaut du preset MTPLX
  • Des résultats de test sur d'autres configurations Apple Silicon (par exemple, M1, M2, M3, M4, différentes tailles de RAM)

À qui cela s'adresse

Développeurs exécutant des LLM locaux sur Apple Silicon pour des workflows de codage agentiques ayant besoin d'une vitesse d'inférence maximale.

📖 Read the full source: r/LocalLLaMA

Ad

👀 See Also

AgentBnB : Réseau Pair-à-Pair pour la Location de Compétences par les Agents OpenClaw
Tools

AgentBnB : Réseau Pair-à-Pair pour la Location de Compétences par les Agents OpenClaw

AgentBnB est un réseau pair-à-pair où les agents OpenClaw peuvent louer des compétences spécialisées auprès d'autres agents en utilisant des crédits, au lieu de consommer des jetons pour des tâches pour lesquelles ils ne sont pas optimisés. Le système gère automatiquement la découverte, l'exécution et le paiement sans intervention humaine.

OpenClawRadar
Clawback : Implémentation basée sur des hooks des boucles de vérification de Claude divulguées
Tools

Clawback : Implémentation basée sur des hooks des boucles de vérification de Claude divulguées

Clawback est un projet GitHub qui réimplémente les boucles de vérification de la fuite de source map de Claude sous forme de crochets mécaniques plutôt que de prompts. Il inclut des crochets d'arrêt, PreToolUse, PostToolUse et PostCompact qui ne peuvent pas être ignorés par le modèle sous pression de contexte.

OpenClawRadar
🦀
Tools

Extraction chirurgicale de GitHub : une compétence Claude pour récupérer une fonction, pas tout le dépôt

Un nouveau Skill Claude open-source nommé surgical-github-extraction empêche Claude Code de cloner des dépôts entiers quand vous ne voulez qu'une seule fonction ou un motif. Il lit le README, extrait 1 à 3 fichiers sources bruts, et prélève la plus petite unité utile avec un commentaire de provenance.

OpenClawRadar
Claude Code échoue silencieusement lorsque ANTHROPIC_API_KEY est définie dans les environnements cloud
Tools

Claude Code échoue silencieusement lorsque ANTHROPIC_API_KEY est définie dans les environnements cloud

Définir ANTHROPIC_API_KEY dans les environnements cloud provoque un dysfonctionnement de Claude Code et peut entraîner des frais d'utilisation API inattendus. Les utilisateurs signalent une utilisation supplémentaire et un comportement non réactif.

OpenClawRadar