Запуск Claude Code оффлайн на M3 Pro с Qwen3.6: 4 исправления, которые заставили это работать

Claude Code подключается к локальной модели на Apple M3 Pro (18 ядер GPU, 36 ГБ единой памяти, пропускная способность ~150 ГБ/с) с запущенной qwen3.6:35b-a3b-coding-nvfp4 — моделью MoE на 35,1 млрд параметров с ~3 млрд активных на токен, квантованной NVFP4, занимающей ~21 ГБ на диске и ~20 ГБ в оперативной памяти. Такая конфигурация позволила провести инцидент Kubernetes от расследования до PR: найдена первопричина, написан патч, отправлена ветка, создан PR через gh — всё в изолированной среде. Четыре исправления превратили модель, которая зависала через 10 минут, в инструмент, замыкающий цикл. Скорость ограничена железом; возможности — нет.
Стек и окружение
- Железо: Apple M3 Pro, 18 ядер GPU, 36 ГБ единой памяти, ~150 ГБ/с пропускная способность
- Модель:
qwen3.6:35b-a3b-coding-nvfp4 - Среда выполнения: Ollama 0.24.0, раннер MLX (родной для Apple Silicon)
- Клиент: Claude Code v2.1.84, указывающий на локальный эндпоинт Ollama
Ключевые переменные окружения (установлены в launchd plist для сохранения):
OLLAMA_MLX=1
OLLAMA_CONTEXT_LENGTH=32768
OLLAMA_FLASH_ATTENTION=1
OLLAMA_MULTIUSER_CACHE=1
OLLAMA_KEEP_ALIVE=24h
OLLAMA_NO_CLOUD=1
Шаги по настройке
- Установите Ollama 0.24.0+
ollama pull qwen3.6:35b-a3b-coding-nvfp4(~21 ГБ однократно)- Запустите сервер с указанными переменными окружения
- Запустите Claude Code:
ANTHROPIC_BASE_URL=http://localhost:11434 MAX_THINKING_TOKENS=0 claude --model qwen3.6:35b-a3b-coding-nvfp4 - Проверка дымом:
Выполни kubectl get pods -A и скажи, есть ли что-то нездоровое
Замечания по производительности
Первый вызов инструмента: секунды (размышления отключены). Prefill (загрузка ~25K токенов) занимает ~60 с. Последующие шаги быстрее благодаря кэшированию префиксов (OLLAMA_MULTIUSER_CACHE). Модель остаётся загруженной через OLLAMA_KEEP_ALIVE=24h. Всплеск 404 в логе Ollama во время prefill — нормально (исправление #4).
Архитектура MoE — ключевая: только ~3 млрд активных на токен, поэтому стоимость выполнения похожа на плотную модель 14 млрд, а ответы близки к 35 млрд. Плотная 35-миллиардная модель не помещается в 36 ГБ.
📖 Читать полный источник: HN LLM Tools
👀 Смотрите также

Разработчик создает нативную версию tmux для Windows с помощью кода Claude, не зная языка C
Разработчик создал tmux-win — нативный мультиплексор для Windows, используя Claude Code для работы с Win32 API и реализацией conpty, несмотря на незнание языка C. Инструмент поддерживает вертикальное/горизонтальное разделение окон, отсоединяемые сессии и обеспечивает нативную производительность без накладных расходов виртуальной машины.

OpenBridge: Бесплатный открытый удаленный контроль для Claude Code через Slack/Discord
OpenBridge — это бесплатный инструмент с открытым исходным кодом, который позволяет управлять Claude Code из Slack или Discord, организуя проекты как каналы, а обсуждения — как ветки. Он работает локально или на VPS и совместим с существующими подписками Claude Code/Codex без дополнительных плат за API.

TREX: ИИ-ревьюер кода от Greptile, который запускает ваш код
TREX — это уровень выполнения кода, встроенный в AI-ревью кода от Greptile. Он запускает код и показывает скриншоты, логи и трассы для ошибок, которые упускает статический анализ.

Claude-Real-Video: Кадры с учетом сцены и расшифровка для любой LLM
Инструмент с открытым исходным кодом, который извлекает из видео кадры с учетом сцен и аудио транскрипты, удаляя дубликаты. Позволяет любой LLM «смотреть» видео локально, без загрузки. Включает обнаружение смены сцен, дедупликацию скользящим окном и транскрипцию Whisper.