Claude 4.6 Opus raisonnement distillé à 14 Go pour Apple Silicon via la quantification MLX

Un développeur a réussi à quantifier un modèle d'IA local qui apporte les capacités de raisonnement de Claude 4.6 Opus au matériel Apple Silicon, réduisant considérablement son empreinte mémoire tout en maintenant ses performances.
Le modèle et son origine
Le travail se concentre sur Qwen 3.5 27B, plus précisément une version distillée à partir des trajectoires de raisonnement de Claude 4.6 Opus. Le développeur cherchait un modèle capable de "penser" plutôt que de simplement autocompléter du code, décrivant la signature d'Opus comme "réfléchie, analytique, et capable de détecter les failles architecturales subtiles que les autres modèles manquent". Cette version distillée apporte cet échafaudage de "pensée" à une architecture à poids ouvert.
Le processus de quantification
Le modèle original faisait 55,6 Go au format BF16, ce que le développeur a qualifié d'"impossible" pour la plupart des configurations locales car il consomme toute la mémoire disponible. Pour résoudre ce problème, ils ont utilisé MLX pour quantifier le modèle pour Apple Silicon, le convertissant en précision 4 bits. L'objectif était de maintenir le raisonnement haute fidélité d'Opus tout en le rendant suffisamment léger pour un usage quotidien dans la planification technique et la logique complexe.
Résultats et performances
- Empreinte : Réduite de 55 Go à 14 Go
- Vitesse : Environ 16 tokens/seconde sur un M4 Pro
- Raisonnement : Conserve le bloc <think> complet, permettant au modèle de "se parler à lui-même" pour vérifier la logique, simuler des cas limites et s'auto-corriger avant de présenter les réponses finales
Disponibilité et exigences
Le développeur a téléchargé les poids sur Hugging Face. Le modèle nécessite un Mac avec 24 Go de RAM ou plus pour exécuter une logique privée de haut niveau et une planification technique complètement hors ligne.
📖 Lire la source complète : r/LocalLLaMA
👀 See Also

Engram : couche mémoire open-source pour Claude Code et les clients MCP
Engram est une couche de mémoire open-source qui fonctionne comme un serveur MCP avec n'importe quel client comme Claude Code, Cursor ou Windsurf. Il stocke des souvenirs illimités avec une recherche sémantique vectorielle, atteint 80 % de précision sur le benchmark LOCOMO et utilise environ 800 tokens par requête contre 5 000+ pour les approches basées sur des fichiers.

La nouvelle API de données structurées propose des tarifs d'abonnement pour les agents LLM.
Un développeur a publié une API de données structurées qui normalise les tarifs d'abonnement sur les plateformes de streaming, les services de covoiturage, les applications de rencontre et d'autres plateformes basées sur l'abonnement. L'API fournit des schémas JSON cohérents, des tarifs adaptés à la région lorsque disponibles, et des points de terminaison compatibles MCP pour que les agents LLM puissent les consommer sans avoir à extraire des données.

Bot GitHub auto-hébergé exécute Claude Code avec plus de 40 déclencheurs webhook et outils MCP
Un bot GitHub auto-hébergé exploite le SDK Agent Claude avec toutes les fonctionnalités de Claude Code, prenant en charge plus de 40 déclencheurs webhook, 4 serveurs MCP intégrés et des workflows personnalisés basés sur YAML pour la revue de PR, la correction automatique CI et le tri des issues.

L'API AskFirst ajoute une couche d'approbation humaine pour les agents IA.
AskFirst est une API REST qui permet aux agents IA de faire une pause pour obtenir l'approbation humaine avant d'entreprendre des actions irréversibles. Elle fonctionne avec des modèles locaux, des API hébergées et n'importe quel framework, offrant des notifications par e-mail, des options d'approbation/refus et des journaux d'audit.