Configuration locale de Mac Studio pour LLM : GLM 5.1, Kimi K2.6, et ce qui fonctionne pour le codage avec Claude Code

✍️ OpenClawRadar📅 Publié: May 7, 2026🔗 Source
Configuration locale de Mac Studio pour LLM : GLM 5.1, Kimi K2.6, et ce qui fonctionne pour le codage avec Claude Code
Ad

Sur r/LocalLLaMA, l'utilisateur ezyz a partagé sa configuration locale de LLM sur Mac Studio en mai 2026, tournant sur un M3 Ultra avec 512 Go de mémoire unifiée. Le post est un bilan quotidien, pas un benchmark rigoureux, mais il regorge d'observations pratiques pour quiconque exécute localement de gros modèles pour coder avec Claude Code.

Modèles actifs actuels et performances

GLM 5.1 est le grand gagnant. Quantifié, il tient dans ~380 Go avec un contexte maximum, laissant de la place pour d'autres tâches. La vitesse de décodage est d'environ 17 t/s, le préremplissage de ~190 t/s. L'auteur lui fait confiance jusqu'à 6/10 en complexité de tâche (10 étant 'codebase legacy brownfield + spécification vague') pour le codage via Claude Code. Il gère des problèmes autonomes et semi-délimités de manière cohérente, avec une aide occasionnelle de Claude API pour la planification ou le nettoyage.

Kimi K2.6 est dans la même catégorie — ni meilleur ni pire de manière évidente — mais plus gros. Même quantifié agressivement, il utilise ~460 Go, laissant peu de place pour d'autres expériences. Il est plus rapide : préremplissage ~220 t/s, décodage ~21 t/s. L'inconvénient est qu'il faut le décharger pour des expériences gourmandes en mémoire.

Minimax 2.7 est impressionnant pour sa taille et sa vitesse, mais l'auteur ne lui donne que 3-4/10 pour le travail de développement. Sa taille est gênante — GLM et Kimi gagnent pour fournir du code utilisable, tandis que les petits modèles gagnent pour les tâches d'assistant comme 'résume cette recherche web'. Il abandonne rapidement le raisonnement pour des requêtes simples.

Gemma 4 31B a déçu : le support MLX est encore désordonné un mois après la sortie. Le 31B dense n'est pas beaucoup plus rapide que les gros MoE, le template de chat officiel a plusieurs bugs non résolus, et les correctifs arrivent encore au compte-gouttes. L'auteur prévoit d'y revenir une fois que le support MTP/draft sera stabilisé.

Qwen 3.6 35B a été remplacé par Qwen 3.5 9B pour les tâches multimodales comme la traduction de captures d'écran — c'est assez bon et assez rapide, et gère les tâches de fond Haiku de Claude Code sans différence notable, tout en économisant ~14 Go de mémoire.

Ad

Support en attente et projets à suivre

Ni Deepseek 4 Flash ni Mimo 2.5 ne sont officiellement arrivés dans llama.cpp ou mlx-lm pour l'instant. L'auteur essaiera les PR quand le temps le permettra. Il suppose que les versions pro des deux seront trop grosses et trop lentes pour le M3 Ultra — les 40 paramètres actifs de GLM sont à peu près sa limite de patience.

Projets suivis avec impatience :

  • Exo et tinygrad pour le clustering Mac + NVIDIA et le préremplissage désagrégé
  • Support Stable Dflash / DDtree / MTP
  • Nouveaux formats de quantification (paroquant, JANGTQ) — voir llama.cpp PR #21038
  • Génération musicale locale — Ace Step 1.5 est 'presque bon' mais les voix ne sont pas encore au point.

📖 Lire la source complète : r/LocalLLaMA

Ad

👀 See Also

Projet James Sexton : Développer un assistant juridique avec OpenClaw et Claude
Use Cases

Projet James Sexton : Développer un assistant juridique avec OpenClaw et Claude

Un développeur crée un assistant juridique utilisant OpenClaw et l'API Claude pour automatiser le traitement des documents lors d'un procès en divorce. Le système surveille les emails, télécharge les PDF, analyse les documents avec Claude, trouve les formulaires de réponse, génère des réponses et imprime les brouillons.

OpenClawRadar
Développeur utilise Claude pour construire un générateur d'annonces audio IA avec backend en Go et intégration ElevenLabs
Use Cases

Développeur utilise Claude pour construire un générateur d'annonces audio IA avec backend en Go et intégration ElevenLabs

Un développeur a créé Prompt Audio Ads, un outil qui génère des publicités audio finalisées à partir de scripts texte en environ 30 secondes en utilisant une voix IA et une musique de fond. Le backend en Go intègre l'API ElevenLabs, le traitement audio ffmpeg et 18 préréglages de genres musicaux.

OpenClawRadar
Utiliser Claude, Gemini et GPT pour des tâches de codage assistées par l'IA
Use Cases

Utiliser Claude, Gemini et GPT pour des tâches de codage assistées par l'IA

Découvrez comment combiner Claude, Gemini et GPT peut améliorer les flux de travail de codage IA en exploitant leurs capacités d'accès uniques pour des tâches spécifiques.

OpenClawRadar
Onglet Docs pour Claude Desktop : Une refonte de l'onglet Code pour les travailleurs du savoir
Use Cases

Onglet Docs pour Claude Desktop : Une refonte de l'onglet Code pour les travailleurs du savoir

Une proposition sur Reddit suggère de réutiliser l'onglet Code de Claude Desktop, avec sa boucle d'agent et son espace de travail git, pour créer un onglet 'Docs' destiné aux équipes conformité, juridique et opérations — en masquant le jargon technique derrière des termes familiers de gestion documentaire.

OpenClawRadar