Exécution de Claude Code hors ligne sur un M3 Pro avec Qwen3.6 : 4 correctifs qui ont fonctionné

Claude Code se connecte à un modèle local sur un Apple M3 Pro (18 cœurs GPU, 36 GiB de mémoire unifiée, ~150 Go/s de bande passante) exécutant qwen3.6:35b-a3b-coding-nvfp4 — un modèle MoE de 35,1 milliards de paramètres avec ~3 milliards actifs par jeton, quantifié NVFP4, ~21 Go sur disque et ~20 GiB en mémoire résidente. La configuration a permis de traiter un incident Kubernetes de l'investigation à la PR : trouver la cause racine, écrire le correctif, pousser la branche, soumettre la PR via gh — le tout en mode air-gap. Quatre correctifs ont transformé un modèle qui expirait en 10 minutes en un outil qui boucle la boucle. La vitesse est limitée par le matériel ; la capacité ne l'est pas.
Stack et environnement
- Matériel : Apple M3 Pro, 18 cœurs GPU, 36 GiB de mémoire unifiée, ~150 Go/s de bande passante mémoire
- Modèle :
qwen3.6:35b-a3b-coding-nvfp4 - Runtime : Ollama 0.24.0, exécuteur MLX (natif Apple Silicon)
- Client : Claude Code v2.1.84 pointant vers le point de terminaison local Ollama
Variables d'environnement clés (définies dans un plist launchd pour persistance) :
OLLAMA_MLX=1
OLLAMA_CONTEXT_LENGTH=32768
OLLAMA_FLASH_ATTENTION=1
OLLAMA_MULTIUSER_CACHE=1
OLLAMA_KEEP_ALIVE=24h
OLLAMA_NO_CLOUD=1
Étapes de configuration
- Installer Ollama 0.24.0+
ollama pull qwen3.6:35b-a3b-coding-nvfp4(~21 Go, une fois)- Démarrer le serveur avec les variables d'environnement ci-dessus
- Lancer Claude Code :
ANTHROPIC_BASE_URL=http://localhost:11434 MAX_THINKING_TOKENS=0 claude --model qwen3.6:35b-a3b-coding-nvfp4 - Test de validation :
Run kubectl get pods -A and tell me if anything appears unhealthy
Notes de performance
Premier appel d'outil : quelques secondes (réflexion désactivée). Le préremplissage (chargement d'environ 25 000 jetons) prend ~60 s. Les tours suivants sont plus rapides grâce au cache de préfixe (OLLAMA_MULTIUSER_CACHE). Le modèle reste chargé via OLLAMA_KEEP_ALIVE=24h. Une rafale de 404 dans le journal Ollama pendant le préremplissage est normale (correctif n°4).
L'architecture MoE est essentielle : seulement ~3B actifs par jeton, donc le coût d'exécution ressemble à celui d'un modèle dense de 14B tandis que les réponses approchent un 35B. Un modèle dense de 35B ne tient pas dans 36GiB.
📖 Lire la source complète : HN LLM Tools
👀 See Also

Module : Orchestration des connaissances inter-dépôts pour les agents d'IA de codage
Modulus est une application de bureau qui exécute plusieurs agents d'IA de codage avec une mémoire de projet partagée entre les dépôts. Il résout les problèmes de contexte inter-dépôts en permettant aux agents de comprendre les dépendances entre différentes bases de code sans explication manuelle.

Rappel : Mémoire de projet locale pour Claude Code — Aucun token dépensé pour les résumés
Recall offre à Claude Code une mémoire de projet locale et durable via un résumé classique. Pas de clé API, pas de modèle externe — context.md fait ~1-2K tokens, construit hors ligne à partir des hooks de session.

Audit SecureCode : Un auditeur de sécurité de serveur Linux construit avec Claude Code
Un développeur indépendant a créé SecureCode Audit à l'aide de Claude Code — exécutez une commande SSH, obtenez un rapport de sécurité avec 22 vérifications et des correctifs priorisés. Les 30 premiers inscrits reçoivent l'audit complet gratuitement.

La compétence Claude Code combine les approches de DeepMind Aletheia et d'Anthropic harness.
Une compétence Claude Code implémente un pipeline Planificateur → Générateur → Évaluateur → Réviseur qui synthétise l'agent de recherche mathématique Aletheia de DeepMind avec l'architecture de codage multi-agent d'Anthropic, ajoutant une pré-analyse à l'aveugle où l'évaluateur raisonne sur les approches correctes avant de voir le code candidat.