Donner à Claude un LLM local comme assistant via MCP sur Mac

Un utilisateur de Reddit a détaillé comment il a donné à Claude l'accès à un LLM local fonctionnant sur un Mac Mini M4 (24 Go de RAM) via une connexion MCP avec Ollama. La configuration utilise Ollama qui sert Qwen 2.5 Coder (14B) en tant qu'assistant nommé « Frank », à qui Claude peut déléguer des tâches selon des règles spécifiques — doit utiliser moins de jetons que Claude lui-même, ne doit pas affecter la qualité, et nécessite une révision finale.
Détails de la configuration
- Matériel : Mac Mini M4 avec 24 Go de RAM.
- LLM local : Qwen 2.5 Coder (14B) fonctionnant via Ollama (également testé avec LM Studio).
- Connexion : MCP (Model Context Protocol) pour lier Claude (CLI ou application de bureau) au modèle local.
- Instructions : Claude a reçu un fichier Markdown de mémoire (
memory.md) avec des directives sur quand et comment utiliser Frank — par exemple, déléguer le traitement de texte, la gestion de gros fichiers CSS/HTML, et utiliser seulement lorsque cela économise des jetons sans dégrader la qualité de sortie.
Cas d'utilisation pratiques
- Traitement et transformation de texte — délégué à Frank pour réduire la consommation de jetons de Claude.
- Gestion de grands fichiers CSS/HTML qui seraient coûteux à traiter directement par Claude.
- Exécution de tests de performance, de codage et de logique — Claude évaluait les modèles locaux via Frank plutôt que manuellement.
L'utilisateur a noté qu'il fonctionne aux limites de sa RAM/GPU et ne peut pas tester des modèles plus grands (30B+). Il a invité d'autres personnes disposant de matériel plus puissant à essayer des configurations similaires et à partager les résultats.
Cette approche crée effectivement un assistant gratuit pour Claude, déléguant les tâches lourdes en jetons tout en maintenant la qualité grâce à la révision finale de Claude.
📖 Lire la source complète : r/ClaudeAI
👀 See Also

Serveur MCP Suit les Bogues Connus dans les Outils de Développement pour Améliorer les Recommandations LLM
nanmesh-mcp est un serveur MCP qui explore GitHub Issues, Stack Overflow et Reddit pour suivre les problèmes réels dans 57 outils de développement, fournissant aux LLM des données actuelles sur les bogues avant de faire des recommandations de bibliothèques.

Tessera : Espace de travail GUI open-source pour gérer plusieurs sessions Claude Code
Tessera est une interface graphique open source qui permet d'exécuter plusieurs sessions Claude Code côte à côte avec isolation des worktrees Git, suivi des tâches Kanban, diff en direct et inspection de l'activité des agents.

Outil RAG Local Construit avec Nemotron Nano 9B v2 et Appel d'Outils vLLM
Un développeur a créé un outil de recherche RAG local-first qui fonctionne entièrement sur un seul GPU en utilisant Nemotron Nano 9B v2 Japanese sur vLLM avec des plugins d'analyse personnalisés pour l'appel d'outils. Le système présente un flux en deux étapes d'extraction-exécution avec extraction de mots-clés bilingues et recherche parallèle FTS5/DuckDuckGo.

Présentation d'Aionic Anthology : Un cadre pour structurer les tâches d'IA de Claude
Le cadre Aionic Anthology organise les tâches d'IA de Claude en séparant le contexte en catégories et en ajoutant un système d'évaluation des risques pour améliorer l'exécution des tâches.