Claude 4.6 Opus Razonamiento Destilado a 14GB para Apple Silicon mediante Cuantización MLX

✍️ OpenClawRadar📅 Publicado: 7 de marzo de 2026🔗 Source
Claude 4.6 Opus Razonamiento Destilado a 14GB para Apple Silicon mediante Cuantización MLX
Ad

Un desarrollador ha cuantizado exitosamente un modelo de IA local que lleva las capacidades de razonamiento de Claude 4.6 Opus al hardware Apple Silicon, reduciendo significativamente su huella de memoria mientras mantiene el rendimiento.

El Modelo y Su Origen

El trabajo se centra en Qwen 3.5 27B, específicamente una versión destilada de trayectorias de razonamiento de Claude 4.6 Opus. El desarrollador buscaba un modelo que pudiera "pensar" en lugar de solo autocompletar código, describiendo la firma de Opus como "deliberada, analítica, y detecta los sutiles defectos arquitectónicos que otros modelos pasan por alto". Esta versión destilada trae ese andamiaje de "pensamiento" a una arquitectura de pesos abiertos.

El Proceso de Cuantización

El modelo original era de 55.6GB en formato BF16, lo que el desarrollador señaló es un "no comienzo" para la mayoría de configuraciones locales ya que consume todo el grupo de memoria. Para abordar esto, utilizaron MLX para cuantizar el modelo para Apple Silicon, convirtiéndolo a precisión de 4 bits. El objetivo era mantener el razonamiento de alta fidelidad de Opus mientras lo hacían lo suficientemente ligero para uso diario en planificación técnica y lógica compleja.

Ad

Resultados y Rendimiento

  • Huella: Reducida de 55GB a 14GB
  • Velocidad: ~16 tokens/segundo en un M4 Pro
  • Razonamiento: Mantiene el bloque completo <think>, permitiendo al modelo "hablar consigo mismo" para verificar lógica, simular casos límite y autocorregirse antes de presentar respuestas finales

Disponibilidad y Requisitos

El desarrollador ha subido los pesos a Hugging Face. El modelo requiere una Mac con 24GB+ de RAM para ejecutar lógica privada de alto nivel y planificación técnica completamente offline.

📖 Read the full source: r/LocalLLaMA

Ad

👀 Ver también

Claude Code v2.1.144: Sesiones en segundo plano, alcance de /modelo y tiempo de espera de inicio de 15s
Herramientas

Claude Code v2.1.144: Sesiones en segundo plano, alcance de /modelo y tiempo de espera de inicio de 15s

Claude Code v2.1.144 añade /resume para sesiones en segundo plano, limita /model a la sesión actual, y corrige un bloqueo de 75s al inicio cuando api.anthropic.com es inalcanzable con un tiempo de espera de 15s.

OpenClawRadar
La herramienta de sincronización de documentos/contexto de IA para desarrolladores gana impulso tras una publicación en Reddit.
Herramientas

La herramienta de sincronización de documentos/contexto de IA para desarrolladores gana impulso tras una publicación en Reddit.

Un desarrollador compartió su herramienta de sincronización de documentación y contexto de IA en Reddit, lo que resultó en 1.1K descargas, 60 estrellas en GitHub y 192 clones únicos en dos semanas después de publicarlo el 22 de marzo.

OpenClawRadar
Slides-grab: Editor Visual para Corregir Diapositivas HTML Generadas por Claude Code
Herramientas

Slides-grab: Editor Visual para Corregir Diapositivas HTML Generadas por Claude Code

Slides-grab es una herramienta que te permite arrastrar elementos en diapositivas HTML/CSS generadas por Claude Code, luego envía el XPath y una captura de pantalla resaltada al agente de IA para una edición precisa. Aborda el problema de corregir pequeños problemas de diseño solo mediante indicaciones de texto.

OpenClawRadar
La extensión OpenClaw enruta las solicitudes a través de la CLI de Claude Code en lugar de la API.
Herramientas

La extensión OpenClaw enruta las solicitudes a través de la CLI de Claude Code en lugar de la API.

Una extensión de OpenClaw ejecuta el binario CLI de Claude como un subproceso, enrutando las solicitudes a través de Claude Code CLI en lugar de la API de Anthropic. Esto proporciona la experiencia completa de Claude Code a la tarifa plana de un plan máximo.

OpenClawRadar