MCP를 통해 기계적 작업을 DeepSeek V4 Flash에 오프로드하여 Claude 비용 60배 절감

한 Reddit 사용자가 자신의 Claude 사용 내역을 분석한 결과, 대부분이 기계적인 작업에 사용되고 있음을 발견했습니다: 파일 분류, JSON 재포맷, 텍스트에서 필드 추출, 대충 훑어볼 문서 요약 등이었습니다. 이런 작업에 Sonnet이 필요하지 않았습니다. 해결책은 MCP를 통해 사이드 워커로 실행되는 작고 저렴한 모델과 CLAUDE.md에 해당 작업을 수행하지 말라고 지시하는 단일 규칙을 추가하는 것이었습니다.
설정: MCP 도구 + CLAUDE.md 거부 목록
설정은 텍스트를 보내고 텍스트를 받는 단일 MCP 도구를 사용합니다. 기본 모델은 DeepSeek V4 Flash(저렴, 100만 토큰 컨텍스트)입니다. 엔드포인트는 한 줄의 설정으로, OpenAI 호환 공급자(로컬 ollama, vllm, lm studio)와 작동합니다. 저장소는 github.com/arizen-dev/deepseek-mcp (MIT, Python 3.10 이상)입니다.
핵심 요소: CLAUDE.md 규칙은 부정적 프레이밍을 사용합니다 — 허용 목록이 아닌 거부 목록입니다. 사용자는 긍정적 프레이밍("X에는 DeepSeek 사용")이 약 30%의 경우 무시되었다고 보고합니다. 거부 목록 접근 방식은 확실하게 작동합니다.
# CLAUDE.md:
# Claude를 사용하지 마세요:
# - json 포맷팅
# - 필드 추출
# - 파일 분류
# - 검토할 요약
결과: 비용 60배 감소
3주간의 실제 사용 결과: 217개의 기계적 호출이 DeepSeek V4 Flash로 오프로드되어 총 비용 $0.41. 동일한 작업을 Sonnet으로 처리했다면 약 $7이었을 것입니다. 이는 해당 작업만으로 약 17배 차이이며, 사용자는 여전히 Sonnet을 사용하는 더 복잡한 작업을 고려할 때 전체 비용이 60배 감소했다고 말합니다.
사이드 워커 작동 방식
사이드 워커는 감독형 도구로, 에이전트가 아닙니다 — 도구 호출, 파일 접근, 체인 없음. 지연 시간은 3~25초입니다. 출력을 검토합니다. 전체 형태는 텍스트를 보내고, 텍스트를 받고, 검토하고, 계속 진행합니다.
대상
복잡한 작업에는 Sonnet의 추론 능력을 유지하면서 대량의 기계적 작업 비용을 줄이려는 Claude API 또는 Claude Code 사용자.
📖 전체 출처 읽기: r/ClaudeAI
👀 See Also

1000시간의 경험에서 얻은 실용적인 AI 코딩 전략
레딧 게시물은 AI 코딩 에이전트를 효과적으로 사용하기 위한 구체적인 프롬프팅 수준과 워크플로우 전략을 설명하며, AI를 주니어 개발자처럼 대우하고, 단계적 구현, 지시 파일 사용 등을 포함합니다.

CLAUDE.md 헌법: 개인 AI 에이전트 구축 — 파트 II 파일 둘러보기
CEO가 16개 섹션(정체성, 주도적 이니셔티브, 메모리, 마감일, 하드 규칙)으로 구성된 CLAUDE.md 파일을 공개합니다. 50인 규모 회사에서 6주간 구축한 내용입니다.

질문 분류를 위한 Qwen 3:0.6B 미세 조정 – 기준선 대 미세 조정 결과
600M 파라미터 소형 LLM(Qwen 3:0.6B)을 Unsloth로 약 850개의 가정용 질문에 미세 조정. 기본 프롬프트는 10% 정확도였으나, 미세 조정 후 80-90% 이상 달성 예상.
당신의 에이전트는 모델이 아니다: 하네스 대 추론 서비스 설명
AI 에이전트 시스템에서 모델, 추론 서비스, 하네스를 구분하는 빠른 참조 자료입니다. Claude CLI나 Cursor를 사용하시나요? 이 분석을 통해 문제를 더 빨리 해결하고 더 나은 에이전트를 설계할 수 있습니다.