Claude 4.6 Opus Raciocínio Destilado para 14GB para Apple Silicon via Quantização MLX

Um desenvolvedor quantizou com sucesso um modelo de IA local que traz as capacidades de raciocínio do Claude 4.6 Opus para o hardware Apple Silicon, reduzindo significativamente sua pegada de memória enquanto mantém o desempenho.
O Modelo e Sua Origem
O trabalho se concentra no Qwen 3.5 27B, especificamente uma versão destilada a partir de trajetórias de raciocínio do Claude 4.6 Opus. O desenvolvedor buscava um modelo que pudesse "pensar" em vez de apenas autocompletar código, descrevendo a assinatura do Opus como "deliberada, analítica e captura as falhas arquitetônicas sutis que outros modelos perdem". Esta versão destilada traz esse andaime de "pensamento" para uma arquitetura de pesos abertos.
O Processo de Quantização
O modelo original tinha 55,6GB no formato BF16, o que o desenvolvedor observou ser "inviável" para a maioria das configurações locais, pois consome todo o pool de memória. Para resolver isso, eles usaram MLX para quantizar o modelo para Apple Silicon, convertendo-o para precisão de 4 bits. O objetivo era manter o raciocínio de alta fidelidade do Opus enquanto o tornava leve o suficiente para uso diário em planejamento técnico e lógica complexa.
Resultados e Desempenho
- Pegada: Reduzida de 55GB para 14GB
- Velocidade: ~16 tokens/segundo em um M4 Pro
- Raciocínio: Mantém o bloco completo de <think>, permitindo que o modelo "fale consigo mesmo" para verificar a lógica, simular casos extremos e autocorrigir-se antes de apresentar respostas finais
Disponibilidade e Requisitos
O desenvolvedor carregou os pesos no Hugging Face. O modelo requer um Mac com 24GB+ de RAM para executar lógica de alto nível e planejamento técnico privados completamente offline.
📖 Leia a fonte completa: r/LocalLLaMA
👀 See Also

Servidor MCP Local Conecta Claude a Aplicativos Mac Sem Nuvem ou Tokens
Local MCP é um servidor MCP nativo para macOS que dá ao Claude Desktop, Cursor, Windsurf e VS Code acesso aos dados do Mail, Calendar, Teams e OneDrive no seu Mac sem processamento na nuvem ou tokens de API.

Team Memory MCP: Memória Compartilhada de Código Aberto para Claude Code com Pontuação de Confiança Bayesiana
Team Memory MCP é uma ferramenta de código aberto que fornece memória compartilhada para equipes no Claude Code com pontuação de confiança bayesiana. Ele usa um modelo Beta-Bernoulli para classificar padrões, inclui decaimento temporal com meia-vida de 90 dias e pode ser adicionado ao Claude Code com um único comando.

CrabMeat v0.1.0: Um Gateway de Agente Centrado em Segurança que Não Confia no LLM com o Limite de Segurança
CrabMeat v0.1.0 é um gateway WebSocket para cargas de trabalho LLM agentivas que impõe segurança no nível arquitetural: indireção de IDs de capacidade, classes de efeito, instruções fixas IRONCLAD_CONTEXT, cadeia de auditoria à prova de adulteração, filtro de vazamento de saída em streaming e sem modo YOLO.

Habilidade do Claude Permite Ajustes Granulares de Personalidade com Variáveis Quantificadas
Uma nova habilidade do Claude permite que desenvolvedores façam ajustes quantificados em 32 grupos de traços de personalidade, abrangendo 120 variáveis definidas pelo Claude, com perfis em nível de grupo mostrando métricas como Verbosidade (60), Agradabilidade (55) e Sarcasmo & Ironia (17). A habilidade persiste entre conversas e inclui um comando de publicação para instruções personalizadas.