M3 Pro에서 Qwen3.6으로 Claude Code 오프라인 실행하기: 작동하게 만든 4가지 수정

Claude Code가 Apple M3 Pro (18 GPU 코어, 36GiB 통합 메모리, ~150 GB/s 대역폭)에서 로컬 모델 qwen3.6:35b-a3b-coding-nvfp4에 연결됩니다. 이 모델은 35.1B 매개변수 MoE 모델로 토큰당 약 3B 활성, NVFP4 양자화, 디스크 약 21GB, 상주 메모리 약 20GiB를 차지합니다. 이 설정으로 쿠버네티스 사고를 조사부터 PR까지 처리했습니다: 근본 원인 찾기, 패치 작성, 브랜치 푸시, gh를 통한 PR 제출 — 모두 완전히 차단된 환경에서 이루어졌습니다. 네 가지 수정을 통해 10분 만에 타임아웃되던 모델이 전체 주기를 완료할 수 있게 되었습니다. 속도는 하드웨어에 의해 제한되지만, 기능은 그렇지 않습니다.
스택 및 환경
- 하드웨어: Apple M3 Pro, 18 GPU 코어, 36 GiB 통합 메모리, ~150 GB/s 메모리 대역폭
- 모델:
qwen3.6:35b-a3b-coding-nvfp4 - 런타임: Ollama 0.24.0, MLX 러너 (Apple Silicon 네이티브)
- 클라이언트: Claude Code v2.1.84, 로컬 Ollama 엔드포인트 연결
주요 환경 변수 (지속성을 위해 launchd plist에 설정):
OLLAMA_MLX=1
OLLAMA_CONTEXT_LENGTH=32768
OLLAMA_FLASH_ATTENTION=1
OLLAMA_MULTIUSER_CACHE=1
OLLAMA_KEEP_ALIVE=24h
OLLAMA_NO_CLOUD=1
설치 단계
- Ollama 0.24.0+ 설치
ollama pull qwen3.6:35b-a3b-coding-nvfp4(약 21GB, 일회성)- 위 환경 변수로 서버 시작
- Claude Code 실행:
ANTHROPIC_BASE_URL=http://localhost:11434 MAX_THINKING_TOKENS=0 claude --model qwen3.6:35b-a3b-coding-nvfp4 - 간단 테스트:
kubectl get pods -A 실행 후 비정상적인 것이 있는지 확인
성능 참고
첫 도구 호출: 몇 초 (사고 비활성화). 프리필 (~25K 토큰 로드)에 약 60초 소요. 이후에는 접두사 캐싱 (OLLAMA_MULTIUSER_CACHE)으로 인해 더 빠릅니다. 모델은 OLLAMA_KEEP_ALIVE=24h로 계속 로드됩니다. 프리필 중 Ollama 로그에 404 오류가 발생하는 것은 정상입니다 (수정 #4).
MoE 아키텍처가 핵심입니다: 토큰당 약 3B만 활성화되므로 런타임 비용은 14B 밀집 모델과 비슷하지만 답변 품질은 35B에 가깝습니다. 밀집 35B 모델은 36GiB 메모리에 맞지 않습니다.
📖 전체 원문 읽기: HN LLM Tools
👀 See Also

AI 코딩 에이전트의 보안 스캐닝 기능은 배포를 자동으로 점검합니다.
한 개발자가 AI 코딩 에이전트가 배포 후 자동으로 노출된 비밀 정보, 열린 포트, 누락된 보안 헤더, 유출된 소스 코드와 같은 보안 문제를 스캔할 수 있도록 하는 스킬 파일을 만들었습니다. 스캔은 매 배포 후 실행되며 약 30초가 소요됩니다.

탄젠트: 클로드 대화 분기를 위한 크롬 확장 프로그램
Claude 대화에서 위치를 잃지 않고 사이드 스레드를 열 수 있는 무료 오픈소스 확장 프로그램

클로드 코드 자동 모드: 권한 생략보다 안전한 대안
클로드 코드(Claude Code)는 이제 자동 모드를 제공합니다. 이는 클로드가 실행 전에 안전 장치로 동작을 모니터링하며 권한 결정을 내리는 권한 모드입니다. 팀 플랜 사용자를 대상으로 한 연구용 미리 보기로 이용 가능하며, 엔터프라이즈 및 API 출시는 곧 예정되어 있습니다.

클로드 코드 울트라플랜 워크플로우 변경 및 성능 관찰
클로드 코드 울트라플랜은 터미널 실행, 브라우저 검토 인터페이스, 실행 옵션을 갖춘 클라우드 기반 계획 워크플로우를 소개합니다. 테스트 결과 로컬 계획 대비 반복 실행 속도가 약 2배 빠르며, 품질 향상은 혼재된 것으로 나타났습니다.