Ejecutando Claude Code sin conexión en un M3 Pro con Qwen3.6: 4 soluciones que lo hicieron funcionar

✍️ OpenClawRadar📅 Publicado: 26 de junio de 2026🔗 Source
Ejecutando Claude Code sin conexión en un M3 Pro con Qwen3.6: 4 soluciones que lo hicieron funcionar
Ad

Claude Code se conecta a un modelo local en un Apple M3 Pro (18 núcleos GPU, 36 GiB de memoria unificada, ~150 GB/s de ancho de banda) ejecutando qwen3.6:35b-a3b-coding-nvfp4 — un modelo MoE de 35.1B parámetros con ~3B activos por token, cuantizado NVFP4, ~21 GB en disco y ~20 GiB residentes. La configuración llevó un incidente de Kubernetes desde la investigación hasta el PR: se encontró la causa raíz, se escribió el parche, se subió la rama, se presentó el PR mediante gh — todo sin conexión. Cuatro correcciones convirtieron un modelo que caducaba en 10 minutos en uno que cierra el ciclo. La velocidad está limitada por hardware; la capacidad no.

Stack y Entorno

  • Hardware: Apple M3 Pro, 18 núcleos GPU, 36 GiB de memoria unificada, ~150 GB/s de ancho de banda
  • Modelo: qwen3.6:35b-a3b-coding-nvfp4
  • Runtime: Ollama 0.24.0, ejecutor MLX (nativo Apple Silicon)
  • Cliente: Claude Code v2.1.84 apuntando al endpoint local de Ollama

Variables de entorno clave (configuradas en un plist de launchd para persistencia):

OLLAMA_MLX=1
OLLAMA_CONTEXT_LENGTH=32768
OLLAMA_FLASH_ATTENTION=1
OLLAMA_MULTIUSER_CACHE=1
OLLAMA_KEEP_ALIVE=24h
OLLAMA_NO_CLOUD=1
Ad

Pasos de Configuración

  1. Instalar Ollama 0.24.0+
  2. ollama pull qwen3.6:35b-a3b-coding-nvfp4 (~21 GB una vez)
  3. Iniciar el servidor con las variables de entorno anteriores
  4. Lanzar Claude Code:
    ANTHROPIC_BASE_URL=http://localhost:11434 MAX_THINKING_TOKENS=0 claude --model qwen3.6:35b-a3b-coding-nvfp4
  5. Prueba inicial: Ejecuta kubectl get pods -A y dime si algo parece no saludable

Notas de Rendimiento

Primera llamada a herramienta: segundos (razonamiento desactivado). Precarga (cargar ~25K tokens) tarda ~60s. Las iteraciones siguientes son más rápidas gracias al almacenamiento en caché de prefijos (OLLAMA_MULTIUSER_CACHE). El modelo se mantiene cargado mediante OLLAMA_KEEP_ALIVE=24h. Ráfaga de 404s en el registro de Ollama durante la precarga es normal (solución #4).

La arquitectura MoE es clave: solo ~3B activos por token, por lo que el costo de ejecución se asemeja a un modelo denso de 14B mientras que las respuestas se acercan a las de 35B. Un modelo denso de 35B no cabe en 36 GiB.

📖 Lee la fuente completa: HN LLM Tools

Ad

👀 Ver también

Detalles de la API de Herramientas de Claude Code Revelados
Herramientas

Detalles de la API de Herramientas de Claude Code Revelados

Un usuario de Reddit extrajo detalles sobre la API de herramientas de Claude Code, incluyendo operaciones del sistema de archivos, ejecución de bash, búsqueda web y cómo se estructuran las llamadas a herramientas usando bloques similares a XML.

OpenClawRadar
Por qué los cazarrecompensas de IA están perdiendo dinero: Datos de 60 casos
Herramientas

Por qué los cazarrecompensas de IA están perdiendo dinero: Datos de 60 casos

Un desarrollador intentó que Claude ganara dinero con recompensas de código abierto usando un presupuesto de $20 en tokens. Tras escanear más de 80 recompensas en Algora, descubrió que la mayoría están saturadas con 10+ PR abiertos, spam de $1 o reservadas para entrevistas. Valor esperado: $0.

OpenClawRadar
Claude IDE Bridge: Herramienta de código abierto que le da a Claude AI acceso directo a tu editor de código.
Herramientas

Claude IDE Bridge: Herramienta de código abierto que le da a Claude AI acceso directo a tu editor de código.

Claude IDE Bridge es una herramienta de código abierto con licencia MIT que conecta a Claude AI directamente con tu editor de código, permitiéndole ver archivos abiertos, cambios no guardados y errores en vivo, en lugar de a través de fragmentos de código pegados. La herramienta actualmente funciona con VS Code y Windsurf.

OpenClawRadar
Construyendo un sistema multiagente controlado por voz sobre Claude Code
Herramientas

Construyendo un sistema multiagente controlado por voz sobre Claude Code

Un desarrollador creó un bucle de voz con palabra de activación para Claude Code que genera subagentes, paraleliza el trabajo y hace auto-QA de los resultados. Incluye un desglose técnico completo con verificación del hablante y watchdog de PID.

OpenClawRadar