Qwen3.5-122B-A10B-MINT-MLX fonctionne parfaitement sur M5 Pro avec 64 Go de RAM.

✍️ OpenClawRadar📅 Publié: April 20, 2026🔗 Source
Qwen3.5-122B-A10B-MINT-MLX fonctionne parfaitement sur M5 Pro avec 64 Go de RAM.
Ad

Performance des LLM locaux sur Apple Silicon

Un utilisateur de Reddit a partagé son expérience d'exécution du modèle Qwen3.5-122B-A10B-MINT-MLX localement sur un M5 Pro avec 64 Go de RAM. Cette configuration démontre que les grands modèles de langage peuvent fonctionner efficacement sur du matériel grand public avec une configuration appropriée.

Détails de la configuration

L'utilisateur a obtenu des performances fluides en utilisant des commandes terminal spécifiques pour l'allocation de VRAM :

sysctl iogpu.unified_memory_limit_percentage
sudo sysctl iogpu.wired_limit_mb=61440

Dans LM Studio, ils ont défini la fenêtre de contexte à 16384 tokens. Avec cette configuration, le système a maintenu des performances stables tout en exécutant Safari avec plusieurs onglets, Messages et Activity Monitor simultanément.

Ad

Benchmarks de performance

Le modèle Qwen3.5-122B-A10B-MINT-MLX a fourni :

  • Temps jusqu'au premier token : 0,86 secondes
  • Vitesse de génération des tokens : 39,58 tokens/seconde

L'utilisateur a noté que le modèle "a résolu correctement plusieurs énigmes et a fait un peu de programmation intuitive" sans se plaindre de la quantification MINT 3 bits. Le seul problème est survenu lorsque la fenêtre de contexte s'est remplie près de 59 Go d'utilisation de VRAM, provoquant un blocage du système.

Comparaison avec d'autres modèles

L'utilisateur a également testé "Qwen3.5 40B Claude 4.6 Opus Deckard Heretic Uncensored Thinking Mxfp8", qu'il a trouvé plus précis que le modèle 122B mais significativement plus lent :

  • Vitesse de génération des tokens : 6,93 tokens/seconde
  • Le traitement des invites est resté rapide malgré une génération plus lente

Cela démontre le compromis entre la taille du modèle, la quantification et la vitesse d'inférence auquel les développeurs sont confrontés lors du choix des configurations de LLM locaux.

📖 Lire la source complète : r/LocalLLaMA

Ad

👀 See Also

Panne généralisée de Claude AI : interface web indisponible, erreurs API en hausse
News

Panne généralisée de Claude AI : interface web indisponible, erreurs API en hausse

Claude.ai est indisponible et l'API renvoie des taux d'erreur élevés depuis le 28 avril 2025 à 19:15 UTC. La page de statut officielle confirme un incident en cours.

OpenClawRadar
L'armée américaine fait pression sur Anthropic pour supprimer les protections de Claude à des fins militaires.
News

L'armée américaine fait pression sur Anthropic pour supprimer les protections de Claude à des fins militaires.

Des responsables militaires américains, dont le secrétaire à la Défense Pete Hegseth, ont rencontré des dirigeants d'Anthropic pour exiger la suppression des protections de Claude contre les applications militaires comme la surveillance de masse et les armes autonomes. Le Pentagone a donné à Anthropic jusqu'à vendredi pour se conformer, sous peine de sanctions incluant l'annulation de contrat.

OpenClawRadar
🦀
News

La Nouvelle-Orléans teste l'IA Carbyne pour le triage des appels 911 — ce que cela signifie pour la technologie d'urgence

Nouvelle-Orléans teste le système de triage des appels d'urgence IA de Carbyne pour le 911. L'IA gère les appels répétés concernant un même incident et dirige les autres vers des humains, réduisant ainsi la charge des répartiteurs.

OpenClawRadar
Titre : Claude Code refuserait des demandes ou facturerait des frais supplémentaires lorsque les commits mentionnent 'OpenClaw'
News

Titre : Claude Code refuserait des demandes ou facturerait des frais supplémentaires lorsque les commits mentionnent 'OpenClaw'

Un tweet de Theo prétend que Claude Code refuse les demandes ou facture des frais supplémentaires si vos commits git mentionnent 'OpenClaw', suscitant une discussion sur HN.

OpenClawRadar