Mac에서 MCP를 통해 로컬 LLM을 어시스턴트로 클로드에게 제공하기

레딧 사용자가 Mac Mini M4(24GB RAM)에서 로컬 LLM을 실행하며 Claude에 MCP 연결을 통해 Ollama에 접근하는 방법을 상세히 설명했습니다. 이 설정은 Ollama가 Qwen 2.5 Coder(14B)를 'Frank'라는 어시스턴트로 서비스하며, Claude가 특정 규칙(Claude보다 적은 토큰 사용, 품질에 영향 없음, 최종 검토 필요)에 따라 작업을 위임할 수 있게 합니다.
설정 세부사항
- 하드웨어: 24GB RAM의 Mac Mini M4.
- 로컬 LLM: Ollama(LM Studio로도 테스트됨)를 통해 실행되는 Qwen 2.5 Coder(14B).
- 연결: MCP(모델 컨텍스트 프로토콜)를 사용하여 Claude(CLI 또는 데스크톱 앱)와 로컬 모델 연결.
- 지침: Claude에
memory.md라는 메모리 마크다운 파일을 제공하여 Frank를 사용하는 시기와 방법(예: 텍스트 처리, 대용량 CSS/HTML 파일 처리 위임, 출력 품질 저하 없이 토큰 절약 시에만 사용)에 대한 가이드라인을 명시했습니다.
실제 사용 사례
- 텍스트 처리 및 변환 — Claude의 토큰 사용량을 줄이기 위해 Frank에게 오프로드.
- Claude가 직접 처리하기 비용이 많이 드는 대용량 CSS/HTML 파일 처리.
- 성능, 코딩, 로직 테스트 실행 — Claude가 수동으로 평가하는 대신 Frank를 통해 로컬 모델을 평가.
사용자는 현재 RAM/GPU의 한계에서 운영 중이며 더 큰 모델(30B+)은 테스트할 수 없다고 언급했습니다. 더 강력한 하드웨어를 가진 다른 사람들에게 유사한 설정을 시도하고 결과를 공유해 줄 것을 요청했습니다.
이 접근 방식은 Claude의 최종 검토를 통해 품질을 유지하면서 토큰이 많이 필요한 작업을 오프로드하여 Claude를 위한 무료 어시스턴트를 효과적으로 만듭니다.
📖 전체 출처 읽기: r/ClaudeAI
👀 See Also

300달러 노트북으로 Qwen 3.5 35B에서 10.33 t/s 달성: 전체 최적화 분석
개발자가 300달러짜리 Lenovo Ideapad Slim 3i에서 ik_llama.cpp, 코어 고정, MTP 추측 디코딩, BIOS 성능 튜닝을 사용하여 Qwen 3.5 35B Q4_K_S에서 10.33 t/s를 달성했습니다.
수술적 GitHub 추출: 전체 저장소가 아닌 하나의 함수를 가져오는 클로드 기술
surgical-github-extraction이라는 새로운 오픈 소스 Claude Skill은 함수나 패턴 하나만 필요할 때 Claude Code가 전체 저장소를 클론하는 것을 방지합니다. README를 읽고, 1~3개의 원시 소스 파일을 가져온 후, 출처 주석과 함께 가장 작은 유용한 단위를 추출합니다.

Visdiff: Claude의 프론트엔드 코드 생성을 위한 시각적 피드백 루프
Visdiff는 Claude의 프론트엔드 코드 생성에서 발생하는 시각적 정확도 격차를 해결합니다. 렌더링된 출력물을 Figma 디자인과 픽셀 단위로 비교하고, 차이점을 피드백 루프에 반영하여 일치할 때까지 반복합니다.

코딩 에이전트 구축을 위한 8K 컨텍스트: 플래너/실행기 분할, 토큰 예산 및 병렬 실행
8K 토큰 제한에 맞춰 설계된 CLI 코딩 에이전트의 상세 분석: 플래너/실행자 아키텍처, 엄격한 토크 예산, 병렬 작업 실행을 사용합니다.