Donner à Claude un LLM local comme assistant via MCP sur Mac

✍️ OpenClawRadar📅 Publié: May 12, 2026🔗 Source
Donner à Claude un LLM local comme assistant via MCP sur Mac
Ad

Un utilisateur de Reddit a détaillé comment il a donné à Claude l'accès à un LLM local fonctionnant sur un Mac Mini M4 (24 Go de RAM) via une connexion MCP avec Ollama. La configuration utilise Ollama qui sert Qwen 2.5 Coder (14B) en tant qu'assistant nommé « Frank », à qui Claude peut déléguer des tâches selon des règles spécifiques — doit utiliser moins de jetons que Claude lui-même, ne doit pas affecter la qualité, et nécessite une révision finale.

Détails de la configuration

  • Matériel : Mac Mini M4 avec 24 Go de RAM.
  • LLM local : Qwen 2.5 Coder (14B) fonctionnant via Ollama (également testé avec LM Studio).
  • Connexion : MCP (Model Context Protocol) pour lier Claude (CLI ou application de bureau) au modèle local.
  • Instructions : Claude a reçu un fichier Markdown de mémoire (memory.md) avec des directives sur quand et comment utiliser Frank — par exemple, déléguer le traitement de texte, la gestion de gros fichiers CSS/HTML, et utiliser seulement lorsque cela économise des jetons sans dégrader la qualité de sortie.
Ad

Cas d'utilisation pratiques

  • Traitement et transformation de texte — délégué à Frank pour réduire la consommation de jetons de Claude.
  • Gestion de grands fichiers CSS/HTML qui seraient coûteux à traiter directement par Claude.
  • Exécution de tests de performance, de codage et de logique — Claude évaluait les modèles locaux via Frank plutôt que manuellement.

L'utilisateur a noté qu'il fonctionne aux limites de sa RAM/GPU et ne peut pas tester des modèles plus grands (30B+). Il a invité d'autres personnes disposant de matériel plus puissant à essayer des configurations similaires et à partager les résultats.

Cette approche crée effectivement un assistant gratuit pour Claude, déléguant les tâches lourdes en jetons tout en maintenant la qualité grâce à la révision finale de Claude.

📖 Lire la source complète : r/ClaudeAI

Ad

👀 See Also

Coordinateur de Serveur pour le Développement Multi-Agent Empêche les Écrasements
Tools

Coordinateur de Serveur pour le Développement Multi-Agent Empêche les Écrasements

Un développeur a créé un serveur coordinateur Node.js qui gère le verrouillage par plage de lignes, le suivi des décalages de lignes et la messagerie en temps réel entre agents IA travaillant sur la même base de code. Le système empêche les agents de se chevaucher en utilisant un verrouillage HTTP avec détection de conflits.

OpenClawRadar
Serveur de Base de Connaissances Open Source et Orchestrateur Multi-Agents pour une Mémoire IA Persistante
Tools

Serveur de Base de Connaissances Open Source et Orchestrateur Multi-Agents pour une Mémoire IA Persistante

Un développeur a créé un serveur MCP personnalisé sur un VPS privé pour offrir à Claude, Codex et Gemini une mémoire persistante entre les sessions, avec un serveur de base de connaissances qui ingère les coffres Obsidian et un orchestrateur multi-agents appelé Daniel pour la redondance.

OpenClawRadar
Prompt-Master : Compétence Claude pour générer des invites précises d'outils d'IA
Tools

Prompt-Master : Compétence Claude pour générer des invites précises d'outils d'IA

Prompt-Master est une compétence Claude gratuite qui rédige des prompts précis pour divers outils d'IA, notamment Cursor, Claude Code, GPT, Midjourney, Kling et Eleven Labs. L'outil a atteint plus de 600 étoiles sur GitHub et traite plus de 4000 visites.

OpenClawRadar
Unsloth Studio permet une vitesse d'entraînement deux fois plus rapide avec une réduction de 70 % de la VRAM pour le réglage fin d'IA en local.
Tools

Unsloth Studio permet une vitesse d'entraînement deux fois plus rapide avec une réduction de 70 % de la VRAM pour le réglage fin d'IA en local.

Unsloth Studio propose des outils pour entraîner et affiner des modèles de langage sur du matériel local avec un entraînement 2 fois plus rapide et une réduction de 70 % de la VRAM. Il prend en charge l'exportation des modèles au format GGUF pour une utilisation avec Ollama et permet des flux de travail de codage IA entièrement locaux sur du matériel 24 Go comme le RTX 4090.

OpenClawRadar