Claude 4.6 Opus raisonnement distillé à 14 Go pour Apple Silicon via la quantification MLX

Un développeur a réussi à quantifier un modèle d'IA local qui apporte les capacités de raisonnement de Claude 4.6 Opus au matériel Apple Silicon, réduisant considérablement son empreinte mémoire tout en maintenant ses performances.
Le modèle et son origine
Le travail se concentre sur Qwen 3.5 27B, plus précisément une version distillée à partir des trajectoires de raisonnement de Claude 4.6 Opus. Le développeur cherchait un modèle capable de "penser" plutôt que de simplement autocompléter du code, décrivant la signature d'Opus comme "réfléchie, analytique, et capable de détecter les failles architecturales subtiles que les autres modèles manquent". Cette version distillée apporte cet échafaudage de "pensée" à une architecture à poids ouvert.
Le processus de quantification
Le modèle original faisait 55,6 Go au format BF16, ce que le développeur a qualifié d'"impossible" pour la plupart des configurations locales car il consomme toute la mémoire disponible. Pour résoudre ce problème, ils ont utilisé MLX pour quantifier le modèle pour Apple Silicon, le convertissant en précision 4 bits. L'objectif était de maintenir le raisonnement haute fidélité d'Opus tout en le rendant suffisamment léger pour un usage quotidien dans la planification technique et la logique complexe.
Résultats et performances
- Empreinte : Réduite de 55 Go à 14 Go
- Vitesse : Environ 16 tokens/seconde sur un M4 Pro
- Raisonnement : Conserve le bloc <think> complet, permettant au modèle de "se parler à lui-même" pour vérifier la logique, simuler des cas limites et s'auto-corriger avant de présenter les réponses finales
Disponibilité et exigences
Le développeur a téléchargé les poids sur Hugging Face. Le modèle nécessite un Mac avec 24 Go de RAM ou plus pour exécuter une logique privée de haut niveau et une planification technique complètement hors ligne.
📖 Lire la source complète : r/LocalLLaMA
👀 See Also

FR: Toolport : Une passerelle locale pour gérer les serveurs MCP une fois pour toutes les applications
Toolport est une application de bureau gratuite et open source qui centralise les configurations des serveurs MCP, stocke les clés API dans le trousseau du système d'exploitation et ajoute des couches de sécurité pour les agents IA.

Google Research présente TurboQuant pour la compression de modèles d'IA.
Google Research a présenté TurboQuant, un algorithme de compression qui réduit la taille des modèles d'IA sans perte de précision. Il traite la surcharge mémoire dans la quantification vectorielle et améliore les performances du cache clé-valeur.

Application de bureau cc+ pour Claude Code : Gestion multi-sessions et orchestration de flotte
cc+ est une application de bureau open source pour Claude Code construite sur le SDK Claude Agent, disponible pour macOS et Linux. Elle offre des onglets multi-sessions, une visualisation en temps réel de l'arborescence des activités, un score de sécurité, l'application de flux de travail et des capacités d'orchestration de flotte.

Backend personnalisé llama.cpp décharge la multiplication matricielle des LLM vers le NPU AMD XDNA2 sur Ryzen AI MAX 385
Un développeur a créé un backend personnalisé pour llama.cpp qui envoie directement les opérations GEMM vers le NPU AMD XDNA2 sur le Ryzen AI MAX 385 (Strix Halo), atteignant 43,7 t/s en décodage avec 0,947 J/tok pour Meta-Llama-3.1-8B-Instruct Q4_K_M. Le chemin de décodage via le NPU économise environ 10W par rapport au Vulkan seul tout en maintenant le débit de décodage.