Claude Code 요금 절약: 계획 토큰을 저렴한 모델로 라우팅하기

한 Reddit 사용자가 지난달 Claude Code에서 모델 간 토큰 사용량을 분할하여 초과 요금 약 40달러를 절약했다고 보고했습니다. 핵심은 계획 단계(특히 여러 파일 리팩터링)가 토큰 예산의 최대 80%를 소비할 수 있지만, 대부분의 계획에 가장 비싼 모델이 필요하지 않다는 점입니다.
작동 방식
그들은 초기 '무엇을 변경할지 파악' 작업을 더 저렴한 모델인 Haiku 3.5로 라우팅하는 30줄짜리 래퍼를 작성했습니다. 실제 편집과 의사 결정만 Opus 또는 Sonnet에 남깁니다. 설정에는 어떤 단계를 넘길지 파악하는 시간을 포함해 약 2시간이 걸렸습니다.
결과
마지막 주기에 4개월 만에 처음으로 예산이 남았습니다. 사용자는 일반적인 2일 대기 기간(리셋 창)을 피할 수 있었습니다. 절약액: 초과 요금 약 40달러.
# 래퍼 로직의 의사 코드:
# 1. 계획 프롬프트를 haiku-3.5로 전송
# 2. 파일 및 변경 목록을 반환받음
# 3. 계획 + 지시를 opus/sonnet에 전달하여 실제 편집 수행
주의사항
Haiku의 계획 품질은 아키텍처 결정에서 눈에 띄게 떨어집니다. Opus가 실제 결정을 맡는 리팩터-및-테스트 워크플로우에서는 괜찮습니다. 그린필드 설계('이 앱이 무엇이어야 하는가')의 경우, 사용자는 여전히 Opus가 처음부터 계획하도록 합니다.
사용자는 이 패턴이 'OpenRouter 모델 가격표를 본 사람에게는 아마 당연한 것'이지만, Claude Code 서브에이전트 문서에는 이 정확한 접근 방식에 대한 내용이 부족하다고 언급합니다.
📖 전체 출처 읽기: r/ClaudeAI
👀 See Also

클로드 은밀 모드 지침: 자율적 AI 실행을 위한
레딧 사용자가 클로드가 조용히 자율적으로 작동하도록 강제하는 '스텔스 모드' 지시를 공유했습니다. 이 방법은 작업이 완료될 때까지 대화 출력 없이 완전한 일회성 결과를 제공합니다.

클로드 프롬프트 코드 재검증: L99 선명화, OODA 축소, ARTIFACTS 퇴색, 그리고 사용할 3가지 신규 코드
L99, OODA, ARTIFACTS 프롬프트 코드를 Claude에서 6개월 만에 재테스트한 결과, L99는 Sonnet 4.6/Opus 4.7에서 더 날카로워졌고, OODA는 전략적 프롬프트에서 실패했으며, ARTIFACTS는 코드에 불필요해졌고, 일상적으로 사용할 세 가지 새 코드(/skeptic, /blindspots, /decompose)를 발견했습니다. 최대 2개의 코드만 쌓으세요.

텔레그램 채팅에서 OpenClaw 실행 줄 숨기기: 원클릭 해결 방법
OpenClaw가 Telegram 채팅에 원시 exec 명령을 스팸하는 것을 방지하려면 streaming.preview.toolProgress와 streaming.progress.toolProgress를 false로 설정하세요. 단일 Python 명령으로 구성 백업을 만들고 키를 추가한 후 빠르게 재시작하면 수정됩니다.

클로드 에이전트를 위한 거버넌스 계층: 프로덕션 환경에서의 엄격한 안전 경계와 실시간 추적
한 Claude API 사용자가 에이전트 아래에 가벼운 거버넌스 레이어를 구축하여 하드 안전 경계, 실시간 추적, Telegram을 통한 인간 개입 제어, 자동 체크포인팅을 추가하고, 장기 실행 에이전트 루프에서 발생하는 무음 실패와 폭주하는 토큰 비용 문제를 해결했습니다.