M3 Pro에서 Qwen3.6으로 Claude Code 오프라인 실행하기: 작동하게 만든 4가지 수정

✍️ OpenClawRadar📅 게시일: June 26, 2026🔗 Source
M3 Pro에서 Qwen3.6으로 Claude Code 오프라인 실행하기: 작동하게 만든 4가지 수정
Ad

Claude Code가 Apple M3 Pro (18 GPU 코어, 36GiB 통합 메모리, ~150 GB/s 대역폭)에서 로컬 모델 qwen3.6:35b-a3b-coding-nvfp4에 연결됩니다. 이 모델은 35.1B 매개변수 MoE 모델로 토큰당 약 3B 활성, NVFP4 양자화, 디스크 약 21GB, 상주 메모리 약 20GiB를 차지합니다. 이 설정으로 쿠버네티스 사고를 조사부터 PR까지 처리했습니다: 근본 원인 찾기, 패치 작성, 브랜치 푸시, gh를 통한 PR 제출 — 모두 완전히 차단된 환경에서 이루어졌습니다. 네 가지 수정을 통해 10분 만에 타임아웃되던 모델이 전체 주기를 완료할 수 있게 되었습니다. 속도는 하드웨어에 의해 제한되지만, 기능은 그렇지 않습니다.

스택 및 환경

  • 하드웨어: Apple M3 Pro, 18 GPU 코어, 36 GiB 통합 메모리, ~150 GB/s 메모리 대역폭
  • 모델: qwen3.6:35b-a3b-coding-nvfp4
  • 런타임: Ollama 0.24.0, MLX 러너 (Apple Silicon 네이티브)
  • 클라이언트: Claude Code v2.1.84, 로컬 Ollama 엔드포인트 연결

주요 환경 변수 (지속성을 위해 launchd plist에 설정):

OLLAMA_MLX=1
OLLAMA_CONTEXT_LENGTH=32768
OLLAMA_FLASH_ATTENTION=1
OLLAMA_MULTIUSER_CACHE=1
OLLAMA_KEEP_ALIVE=24h
OLLAMA_NO_CLOUD=1
Ad

설치 단계

  1. Ollama 0.24.0+ 설치
  2. ollama pull qwen3.6:35b-a3b-coding-nvfp4 (약 21GB, 일회성)
  3. 위 환경 변수로 서버 시작
  4. Claude Code 실행:
    ANTHROPIC_BASE_URL=http://localhost:11434 MAX_THINKING_TOKENS=0 claude --model qwen3.6:35b-a3b-coding-nvfp4
  5. 간단 테스트: kubectl get pods -A 실행 후 비정상적인 것이 있는지 확인

성능 참고

첫 도구 호출: 몇 초 (사고 비활성화). 프리필 (~25K 토큰 로드)에 약 60초 소요. 이후에는 접두사 캐싱 (OLLAMA_MULTIUSER_CACHE)으로 인해 더 빠릅니다. 모델은 OLLAMA_KEEP_ALIVE=24h로 계속 로드됩니다. 프리필 중 Ollama 로그에 404 오류가 발생하는 것은 정상입니다 (수정 #4).

MoE 아키텍처가 핵심입니다: 토큰당 약 3B만 활성화되므로 런타임 비용은 14B 밀집 모델과 비슷하지만 답변 품질은 35B에 가깝습니다. 밀집 35B 모델은 36GiB 메모리에 맞지 않습니다.

📖 전체 원문 읽기: HN LLM Tools

Ad

👀 See Also

mindpm: Claude와 함께하는 지속적인 프로젝트 메모리를 위한 무료 MCP 서버
Tools

mindpm: Claude와 함께하는 지속적인 프로젝트 메모리를 위한 무료 MCP 서버

mindpm은 Claude에게 대화 간에 작업, 결정, 메모 및 세션 요약을 추적할 수 있는 로컬 SQLite 데이터베이스를 제공하는 무료 오픈소스 MCP 서버입니다. 설정은 30초만에 명령어로 완료됩니다: claude mcp add mindpm -e MINDPM_DB_PATH=~/.mindpm/memory.db -- npx -y mindpm

OpenClawRadar
Reseed CLI: 모든 사이트에서 디자인 시스템을 추출하여 Claude Code와 Cursor로
Tools

Reseed CLI: 모든 사이트에서 디자인 시스템을 추출하여 Claude Code와 Cursor로

Reseed는 모든 웹사이트에서 디자인 토큰(색상, 간격, 글자 크기 체계, 모서리 둥글기)을 추출하여 Claude Code와 Cursor가 사용할 수 있는 tailwind.config.ts, design-system.md, 참조 HTML을 생성하는 CLI 도구입니다.

OpenClawRadar
Loom: 복잡한 AI 작업을 위한 로컬 실행 하네스
Tools

Loom: 복잡한 AI 작업을 위한 로컬 실행 하네스

Loom은 복잡한 작업을 관리하기 위해 설계된 오픈소스 로컬 실행 하네스로, 약 50개의 도구, 반복 가능한 워크플로우를 위한 커스텀 패키지 플러그인 시스템, CLI 및 MCP 서버 인터페이스를 제공하는 구조화된 프로세스를 제공합니다.

OpenClawRadar
알리바바의 월 10달러 코딩 플랜은 OpenClaw 사용자에게 여러 AI 모델에 대한 대용량 접근을 제공합니다.
Tools

알리바바의 월 10달러 코딩 플랜은 OpenClaw 사용자에게 여러 AI 모델에 대한 대용량 접근을 제공합니다.

월 10달러에 알리바바 플랜은 Qwen3.5-Plus, Kimi-K2.5, GLM-5, MiniMax-M2.5 모델에 접근할 수 있으며, 5시간당 1,200회, 주당 9,000회, 월 18,000회의 요청 할당량을 제공합니다.

OpenClawRadar