Запуск Claude Code оффлайн на M3 Pro с Qwen3.6: 4 исправления, которые заставили это работать

Claude Code подключается к локальной модели на Apple M3 Pro (18 ядер GPU, 36 ГБ единой памяти, пропускная способность ~150 ГБ/с) с запущенной qwen3.6:35b-a3b-coding-nvfp4 — моделью MoE на 35,1 млрд параметров с ~3 млрд активных на токен, квантованной NVFP4, занимающей ~21 ГБ на диске и ~20 ГБ в оперативной памяти. Такая конфигурация позволила провести инцидент Kubernetes от расследования до PR: найдена первопричина, написан патч, отправлена ветка, создан PR через gh — всё в изолированной среде. Четыре исправления превратили модель, которая зависала через 10 минут, в инструмент, замыкающий цикл. Скорость ограничена железом; возможности — нет.
Стек и окружение
- Железо: Apple M3 Pro, 18 ядер GPU, 36 ГБ единой памяти, ~150 ГБ/с пропускная способность
- Модель:
qwen3.6:35b-a3b-coding-nvfp4 - Среда выполнения: Ollama 0.24.0, раннер MLX (родной для Apple Silicon)
- Клиент: Claude Code v2.1.84, указывающий на локальный эндпоинт Ollama
Ключевые переменные окружения (установлены в launchd plist для сохранения):
OLLAMA_MLX=1
OLLAMA_CONTEXT_LENGTH=32768
OLLAMA_FLASH_ATTENTION=1
OLLAMA_MULTIUSER_CACHE=1
OLLAMA_KEEP_ALIVE=24h
OLLAMA_NO_CLOUD=1
Шаги по настройке
- Установите Ollama 0.24.0+
ollama pull qwen3.6:35b-a3b-coding-nvfp4(~21 ГБ однократно)- Запустите сервер с указанными переменными окружения
- Запустите Claude Code:
ANTHROPIC_BASE_URL=http://localhost:11434 MAX_THINKING_TOKENS=0 claude --model qwen3.6:35b-a3b-coding-nvfp4 - Проверка дымом:
Выполни kubectl get pods -A и скажи, есть ли что-то нездоровое
Замечания по производительности
Первый вызов инструмента: секунды (размышления отключены). Prefill (загрузка ~25K токенов) занимает ~60 с. Последующие шаги быстрее благодаря кэшированию префиксов (OLLAMA_MULTIUSER_CACHE). Модель остаётся загруженной через OLLAMA_KEEP_ALIVE=24h. Всплеск 404 в логе Ollama во время prefill — нормально (исправление #4).
Архитектура MoE — ключевая: только ~3 млрд активных на токен, поэтому стоимость выполнения похожа на плотную модель 14 млрд, а ответы близки к 35 млрд. Плотная 35-миллиардная модель не помещается в 36 ГБ.
📖 Читать полный источник: HN LLM Tools
👀 Смотрите также

Ouroboros 0.26.0-beta объединяет Claude и Codex через сервер MCP.
Ouroboros 0.26.0-beta представляет собой инструмент, который запускает Claude и Codex одновременно, назначая Claude задачу по уточнению намерений пользователя, а Codex — выполнение четко определенных задач через архитектуру MCP-сервера.

Подход Cursor к быстрому поиску с помощью регулярных выражений для ИИ-агентов
Cursor разрабатывает индексированный поиск по регулярным выражениям для решения проблем производительности в больших монорепозиториях, где ripgrep может занимать более 15 секунд, используя инвертированные индексы с n-граммами на основе исследования 1993 года Зобеля, Моффата и Сакса-Дэвиса.

Счётчик Claude: Приложение для Android отслеживает лимиты использования Claude с уведомлениями в реальном времени.
Разработчик создал Claude Counter — бесплатное приложение для Android, которое опрашивает API Claude для отображения текущих лимитов сессии и недельного использования. Приложение показывает индикаторы выполнения, предоставляет расширенные уведомления с оставшимся процентом и предупреждает о сбросе лимитов.

General Bots: Платформа с открытым исходным кодом для AI-агентов, предназначенная для самостоятельного развертывания и автоматизации бизнес-процессов в корпоративной среде.
General Bots — это платформа с открытым исходным кодом, запущенная в 2019 году, которая предоставляет AI-агентов, автоматизацию рабочих процессов, обработку документов и интеграции с поддержкой локальных AI-моделей, предназначенная для организаций, которым требуется полный контроль над своей инфраструктурой.