Qwen3.5-122B-A10B-MINT-MLX fonctionne parfaitement sur M5 Pro avec 64 Go de RAM.

✍️ OpenClawRadar📅 Publié: April 20, 2026🔗 Source
Qwen3.5-122B-A10B-MINT-MLX fonctionne parfaitement sur M5 Pro avec 64 Go de RAM.
Ad

Performance des LLM locaux sur Apple Silicon

Un utilisateur de Reddit a partagé son expérience d'exécution du modèle Qwen3.5-122B-A10B-MINT-MLX localement sur un M5 Pro avec 64 Go de RAM. Cette configuration démontre que les grands modèles de langage peuvent fonctionner efficacement sur du matériel grand public avec une configuration appropriée.

Détails de la configuration

L'utilisateur a obtenu des performances fluides en utilisant des commandes terminal spécifiques pour l'allocation de VRAM :

sysctl iogpu.unified_memory_limit_percentage
sudo sysctl iogpu.wired_limit_mb=61440

Dans LM Studio, ils ont défini la fenêtre de contexte à 16384 tokens. Avec cette configuration, le système a maintenu des performances stables tout en exécutant Safari avec plusieurs onglets, Messages et Activity Monitor simultanément.

Ad

Benchmarks de performance

Le modèle Qwen3.5-122B-A10B-MINT-MLX a fourni :

  • Temps jusqu'au premier token : 0,86 secondes
  • Vitesse de génération des tokens : 39,58 tokens/seconde

L'utilisateur a noté que le modèle "a résolu correctement plusieurs énigmes et a fait un peu de programmation intuitive" sans se plaindre de la quantification MINT 3 bits. Le seul problème est survenu lorsque la fenêtre de contexte s'est remplie près de 59 Go d'utilisation de VRAM, provoquant un blocage du système.

Comparaison avec d'autres modèles

L'utilisateur a également testé "Qwen3.5 40B Claude 4.6 Opus Deckard Heretic Uncensored Thinking Mxfp8", qu'il a trouvé plus précis que le modèle 122B mais significativement plus lent :

  • Vitesse de génération des tokens : 6,93 tokens/seconde
  • Le traitement des invites est resté rapide malgré une génération plus lente

Cela démontre le compromis entre la taille du modèle, la quantification et la vitesse d'inférence auquel les développeurs sont confrontés lors du choix des configurations de LLM locaux.

📖 Lire la source complète : r/LocalLLaMA

Ad

👀 See Also

Amazon contourne le vote communautaire de Gilroy pour un centre de données IA en utilisant des règles vieilles de 45 ans
News

Amazon contourne le vote communautaire de Gilroy pour un centre de données IA en utilisant des règles vieilles de 45 ans

Amazon a discrètement commencé à construire un centre de données d'IA de 56 acres à Gilroy, en Californie, en évitant l'attention du public grâce à des règles de zonage établies il y a 45 ans. Les résidents ont été exclus de la fenêtre de commentaires.

OpenClawRadar
Anthropic ajoute une fonctionnalité d'importation de mémoire pour passer de ChatGPT/Gemini à Claude
News

Anthropic ajoute une fonctionnalité d'importation de mémoire pour passer de ChatGPT/Gemini à Claude

La nouvelle fonctionnalité d'importation de mémoire d'Anthropic permet aux utilisateurs de transférer leurs préférences, projets, contexte et style de travail depuis ChatGPT, Gemini ou d'autres IA vers Claude en environ deux étapes de copier-coller, éliminant le besoin de réentraîner à partir de zéro.

OpenClawRadar
Mises à jour de l'invite système Claude Code 2.1.72 : Nouveaux modes d'exécution et améliorations de la vérification
News

Mises à jour de l'invite système Claude Code 2.1.72 : Nouveaux modes d'exécution et améliorations de la vérification

La version 2.1.72 de Claude Code introduit de nouveaux prompts système pour le mode Auto (exécution continue de tâches) et le mode Brief (exécution de type Codex), ainsi que des extensions majeures à l'agent spécialiste de Vérification avec des modèles d'échec documentés et des exigences de sortie structurée.

OpenClawRadar
Étude de l'ETH Zurich : Un contexte excessif réduit les performances des agents d'IA en programmation
News

Étude de l'ETH Zurich : Un contexte excessif réduit les performances des agents d'IA en programmation

Une étude de l'ETH Zurich a testé quatre agents de codage sur 138 tâches réelles de GitHub et a constaté que les fichiers de contexte générés par LLM réduisaient les taux de réussite des tâches de 2 à 3 % tout en augmentant les coûts d'inférence de 20 %. Le contexte écrit par l'homme n'a amélioré la réussite que d'environ 4 % avec des augmentations de coûts significatives.

OpenClawRadar