Ejecutando Claude Code sin conexión en un M3 Pro con Qwen3.6: 4 soluciones que lo hicieron funcionar

✍️ OpenClawRadar📅 Publicado: 26 de junio de 2026🔗 Source
Ejecutando Claude Code sin conexión en un M3 Pro con Qwen3.6: 4 soluciones que lo hicieron funcionar
Ad

Claude Code se conecta a un modelo local en un Apple M3 Pro (18 núcleos GPU, 36 GiB de memoria unificada, ~150 GB/s de ancho de banda) ejecutando qwen3.6:35b-a3b-coding-nvfp4 — un modelo MoE de 35.1B parámetros con ~3B activos por token, cuantizado NVFP4, ~21 GB en disco y ~20 GiB residentes. La configuración llevó un incidente de Kubernetes desde la investigación hasta el PR: se encontró la causa raíz, se escribió el parche, se subió la rama, se presentó el PR mediante gh — todo sin conexión. Cuatro correcciones convirtieron un modelo que caducaba en 10 minutos en uno que cierra el ciclo. La velocidad está limitada por hardware; la capacidad no.

Stack y Entorno

  • Hardware: Apple M3 Pro, 18 núcleos GPU, 36 GiB de memoria unificada, ~150 GB/s de ancho de banda
  • Modelo: qwen3.6:35b-a3b-coding-nvfp4
  • Runtime: Ollama 0.24.0, ejecutor MLX (nativo Apple Silicon)
  • Cliente: Claude Code v2.1.84 apuntando al endpoint local de Ollama

Variables de entorno clave (configuradas en un plist de launchd para persistencia):

OLLAMA_MLX=1
OLLAMA_CONTEXT_LENGTH=32768
OLLAMA_FLASH_ATTENTION=1
OLLAMA_MULTIUSER_CACHE=1
OLLAMA_KEEP_ALIVE=24h
OLLAMA_NO_CLOUD=1
Ad

Pasos de Configuración

  1. Instalar Ollama 0.24.0+
  2. ollama pull qwen3.6:35b-a3b-coding-nvfp4 (~21 GB una vez)
  3. Iniciar el servidor con las variables de entorno anteriores
  4. Lanzar Claude Code:
    ANTHROPIC_BASE_URL=http://localhost:11434 MAX_THINKING_TOKENS=0 claude --model qwen3.6:35b-a3b-coding-nvfp4
  5. Prueba inicial: Ejecuta kubectl get pods -A y dime si algo parece no saludable

Notas de Rendimiento

Primera llamada a herramienta: segundos (razonamiento desactivado). Precarga (cargar ~25K tokens) tarda ~60s. Las iteraciones siguientes son más rápidas gracias al almacenamiento en caché de prefijos (OLLAMA_MULTIUSER_CACHE). El modelo se mantiene cargado mediante OLLAMA_KEEP_ALIVE=24h. Ráfaga de 404s en el registro de Ollama durante la precarga es normal (solución #4).

La arquitectura MoE es clave: solo ~3B activos por token, por lo que el costo de ejecución se asemeja a un modelo denso de 14B mientras que las respuestas se acercan a las de 35B. Un modelo denso de 35B no cabe en 36 GiB.

📖 Lee la fuente completa: HN LLM Tools

Ad

👀 Ver también

Desarrollador Crea Habilidades Prácticas de Claude para Proyectos Kotlin Multiplataforma
Herramientas

Desarrollador Crea Habilidades Prácticas de Claude para Proyectos Kotlin Multiplataforma

Un desarrollador creó un repositorio público de habilidades de Claude específicamente para el trabajo con Kotlin Multiplatform después de encontrar que las habilidades existentes eran demasiado genéricas, subjetivas o superficiales. Las habilidades cubren revisiones de arquitectura, implementación de características, modularización, interfaz de usuario de Compose Multiplatform, navegación, puentes de plataforma, enlaces profundos, interfaz de usuario adaptable, pruebas y gobernanza de compilación.

OpenClawRadar
Servidor MCP de código abierto agrega memoria de sesión integrada para Claude Desktop.
Herramientas

Servidor MCP de código abierto agrega memoria de sesión integrada para Claude Desktop.

Un desarrollador construyó un servidor MCP en TypeScript con memoria de sesión integrada para preservar el contexto entre sesiones de codificación en Claude Desktop, eliminando la necesidad de infraestructura de memoria separada. El servidor incluye funciones de guardar/cargar sesiones y herramientas adicionales como integración con Brave Search y Google Gemini.

OpenClawRadar
Calibre: Herramienta CLI local genera configuraciones de asistente de codificación IA desde tu repositorio.
Herramientas

Calibre: Herramienta CLI local genera configuraciones de asistente de codificación IA desde tu repositorio.

Caliber es una herramienta CLI local que escanea repositorios en lenguajes como TypeScript, Python, Go y Rust, luego genera archivos de prompt y configuración para asistentes de codificación con IA como Claude Code, Cursor y Codex. Se ejecuta completamente en tu máquina con tus propias claves, tiene 13k instalaciones en npm y es de código abierto bajo la licencia MIT.

OpenClawRadar
TREX: El revisor de código AI de Greptile que ejecuta tu código
Herramientas

TREX: El revisor de código AI de Greptile que ejecuta tu código

TREX es una capa de ejecución de código integrada en la revisión de código con IA de Greptile. Ejecuta el código y muestra capturas de pantalla, registros y trazas para errores en tiempo de ejecución que el análisis estático no detecta.

OpenClawRadar