Claude 4.6 Opus Razonamiento Destilado a 14GB para Apple Silicon mediante Cuantización MLX

Un desarrollador ha cuantizado exitosamente un modelo de IA local que lleva las capacidades de razonamiento de Claude 4.6 Opus al hardware Apple Silicon, reduciendo significativamente su huella de memoria mientras mantiene el rendimiento.
El Modelo y Su Origen
El trabajo se centra en Qwen 3.5 27B, específicamente una versión destilada de trayectorias de razonamiento de Claude 4.6 Opus. El desarrollador buscaba un modelo que pudiera "pensar" en lugar de solo autocompletar código, describiendo la firma de Opus como "deliberada, analítica, y detecta los sutiles defectos arquitectónicos que otros modelos pasan por alto". Esta versión destilada trae ese andamiaje de "pensamiento" a una arquitectura de pesos abiertos.
El Proceso de Cuantización
El modelo original era de 55.6GB en formato BF16, lo que el desarrollador señaló es un "no comienzo" para la mayoría de configuraciones locales ya que consume todo el grupo de memoria. Para abordar esto, utilizaron MLX para cuantizar el modelo para Apple Silicon, convirtiéndolo a precisión de 4 bits. El objetivo era mantener el razonamiento de alta fidelidad de Opus mientras lo hacían lo suficientemente ligero para uso diario en planificación técnica y lógica compleja.
Resultados y Rendimiento
- Huella: Reducida de 55GB a 14GB
- Velocidad: ~16 tokens/segundo en un M4 Pro
- Razonamiento: Mantiene el bloque completo <think>, permitiendo al modelo "hablar consigo mismo" para verificar lógica, simular casos límite y autocorregirse antes de presentar respuestas finales
Disponibilidad y Requisitos
El desarrollador ha subido los pesos a Hugging Face. El modelo requiere una Mac con 24GB+ de RAM para ejecutar lógica privada de alto nivel y planificación técnica completamente offline.
📖 Read the full source: r/LocalLLaMA
👀 Ver también

Servidor MCP de Código Abierto Convierte a Claude en un Agente Literario Autónomo para Consultar Editoriales
El Agentic Publishing Node es un servidor MCP que permite a Claude cotejar automáticamente manuscritos con listas de deseos de agentes literarios, generar cartas de presentación, formatear según el estándar Shunn y registrar propuestas, todo desde archivos markdown locales.

La brevedad supera al plugin cavernícola en el benchmark de compresión de Claude Code
Un benchmark de 24 prompts muestra que el plugin de compresión 'caveman' de Claude Code produce los mismos conteos de tokens y calidad que simplemente anteponer 'sé breve'. Sin embargo, la forma de salida consistente del plugin y sus reglas de escape de seguridad ofrecen ventajas estructurales.

Problemas de Compromiso: Una Herramienta que Analiza y 'Entierra' Repositorios de GitHub Incompletos
Un desarrollador creó una herramienta llamada Commitment Issues que analiza repositorios de GitHub para determinar si están abandonados, genera un 'certificado de defunción' y extrae el último mensaje de commit como 'últimas palabras'. La herramienta utiliza heurísticas como frecuencia de commits, última actividad y estrellas vs. impulso, y fue prototipada usando Claude.

El Servidor RiserFlow MCP Agrega Capacidades de Comercio Electrónico a OpenClaw
Un servidor MCP de código abierto llamado RiserFlow permite a OpenClaw buscar productos semánticamente, gestionar carritos y realizar pedidos reales que aparecen en los sistemas de administración de tiendas, con soporte actual para Bitrix y un patrón de adaptador para otras plataformas.