Benchmark : MLX vs Ollama exécutant Qwen3-Coder-Next 8-Bit sur MacBook Pro M5 Max

✍️ OpenClawRadar📅 Publié: April 16, 2026🔗 Source
Benchmark : MLX vs Ollama exécutant Qwen3-Coder-Next 8-Bit sur MacBook Pro M5 Max
Ad

Un benchmark a été réalisé comparant deux backends d'inférence locaux—MLX (le framework ML natif d'Apple) et Ollama (basé sur llama.cpp)—exécutant le même modèle Qwen3-Coder-Next en quantification 8 bits sur Apple Silicon. L'objectif était de mesurer le débit brut (tokens par seconde), le temps jusqu'au premier token (TTFT) et la capacité globale de programmation sur des tâches de codage réelles.

Méthodologie

La configuration utilisée :

  • Backend MLX : mlx-lm v0.29.1 servant mlx-community/Qwen3-Coder-Next-8bit via son serveur HTTP compatible OpenAI intégré sur le port 8080.
  • Backend Ollama : Ollama servant qwen3-coder-next:Q8_0 via son API compatible OpenAI sur le port 11434.

Les deux backends ont été accédés via le même harnais de benchmark Python utilisant la bibliothèque cliente OpenAI avec le streaming activé. Chaque test a été exécuté 3 itérations par prompt, avec les résultats moyennés et en excluant le TTFT de la première itération pour le prompt de démarrage à froid initial (chargement du modèle).

Suite de tests

Six prompts couvraient un spectre de tâches de programmation :

  • Complétion courte : Écrire une fonction de vérification de palindrome (150 tokens maximum)
  • Génération moyenne : Implémenter une classe de cache LRU avec des indications de type (500 tokens maximum)
  • Raisonnement long : Expliquer async/await vs threading avec des exemples (1000 tokens maximum)
  • Tâche de débogage : Trouver et corriger des bugs dans le tri fusion + recherche binaire (800 tokens maximum)
  • Codage complexe : File d'attente bloquante bornée thread-safe avec gestionnaire de contexte (1000 tokens maximum)
  • Revue de code : Examiner 3 fonctions pour la performance/correction/style (1000 tokens maximum)
Ad

Résultats

Débit (Tokens par Seconde) sur M5 Max avec 128 Go de RAM :

  • Complétion courte : Ollama 32,51 tok/s, MLX 69,62 tok/s (MLX +114 %)
  • Génération moyenne : Ollama 35,97 tok/s, MLX 78,28 tok/s (MLX +118 %)
  • Raisonnement long : Ollama 40,45 tok/s, MLX 78,29 tok/s (MLX +94 %)
  • Tâche de débogage : Ollama 37,06 tok/s, MLX 74,89 tok/s (MLX +102 %)
  • Codage complexe : Ollama 35,84 tok/s, MLX 76,99 tok/s (MLX +115 %)
  • Revue de code : Ollama 39,00 tok/s, MLX 74,98 tok/s (MLX +92 %)

Moyenne globale : MLX a atteint environ 72 tokens par seconde, soit environ le double du débit d'Ollama. Les métriques mesurées incluaient les tokens/sec (tokens de sortie générés par seconde, plus élevé est meilleur), TTFT (temps entre l'envoi de la requête et la réception du premier token, plus bas est meilleur), temps total (temps horloge pour la réponse complète, plus bas est meilleur) et l'utilisation de la mémoire mesurée via psutil.

📖 Read the full source: r/LocalLLaMA

Ad

👀 See Also

Les frameworks d'agents gaspillent plus de 350 000 jetons par session en renvoyant des fichiers statiques.
Tools

Les frameworks d'agents gaspillent plus de 350 000 jetons par session en renvoyant des fichiers statiques.

Un benchmark sur une configuration locale Qwen 3.5 122B a révélé que les frameworks d'agents gaspillent plus de 350 000 tokens par session en renvoyant des fichiers statiques. Une approche de compilation a réduit le contexte de requête de 1 373 tokens à 73, réalisant une réduction de 95 %.

OpenClawRadar
Mode Contexte : Un serveur MCP qui compresse les sorties d'outils pour Claude Code
Tools

Mode Contexte : Un serveur MCP qui compresse les sorties d'outils pour Claude Code

Le mode Contexte est un serveur MCP qui s'intercale entre Claude Code et les sorties d'outils, les traitant dans des sandbox et ne renvoyant que des résumés. Il réduit 315 Ko de sortie MCP à 5,4 Ko, prolongeant la durée de session avant ralentissement d'environ 30 minutes à environ 3 heures.

OpenClawRadar
Le plugin Claude-ETA ajoute le chronométrage des tâches et la détection de boucles de réparation à Claude Code.
Tools

Le plugin Claude-ETA ajoute le chronométrage des tâches et la détection de boucles de réparation à Claude Code.

Claude-ETA est un plugin Claude Code qui chronomètre les tâches, apprend votre vitesse réelle et renvoie des données réelles à Claude avant qu'il ne réponde. Il détecte également les boucles de réparation en identifiant le contenu des erreurs et intervient après trois échecs identiques.

OpenClawRadar
Agent de Trading IA avec Garde-fous de Risque pour l'Investissement Éducatif
Tools

Agent de Trading IA avec Garde-fous de Risque pour l'Investissement Éducatif

Un développeur a créé un assistant de trading alimenté par l'IA qui connecte Claude à un compte de courtage avec un moteur de risque positionné entre l'IA et l'argent. Le système inclut des vérifications de sécurité comme le blocage des transactions dépassant 50 % de l'allocation du portefeuille, l'arrêt automatique à 3 % de perte quotidienne et un interrupteur d'urgence à 20 % de baisse.

OpenClawRadar