모든 프롬프트에 모든 MCP 서버를 로딩하면 조용히 토큰 예산이 소진된다

r/ClaudeAI의 게시물은 미묘하지만 비용이 많이 드는 문제를 보고합니다. 여러 MCP 서버가 구성된 경우, 기본적으로 모든 프롬프트가 모든 서버를 로드하며, 이는 사소한 질문에도 해당됩니다. 사용자는 5~6개의 서버를 사용하고 있었지만 토큰 사용량을 확인할 때까지 이를 인지하지 못했습니다. 매번 프롬프트가 관련 없는 서버 정의를 로드하는 데 토큰을 낭비하고 있었던 것입니다.
핵심 세부 사항
- 모든 프롬프트가 전체 MCP 서버 세트(5~6개 서버)를 로드했습니다.
- 간단한 프롬프트(예: "지금 몇 시야?")조차 모든 서버 정의를 불러왔습니다.
- 해결책: 프롬프트와 관련된 서버만 선택하는 사용자 정의 라우팅 레이어를 구현했습니다.
- 결과: 토큰 사용량이 크게 줄고 프롬프트 응답 시간이 개선되었습니다.
- 작성자는 "확인하지 않고 이렇게 오래 방치했다는 사실을 믿을 수 없다"고 인정했습니다.
기술적 배경
MCP(Model Context Protocol) 서버는 Claude의 기능(예: 파일 시스템 액세스, 데이터베이스 쿼리, 웹 스크래핑)을 확장하는 도구입니다. 포크된 클라이언트 및 수동 구성을 포함한 많은 설정에서 기본 동작은 각 메시지에 전체 서버 정의 목록을 전송하는 것입니다. 즉, DB 액세스, 파일 I/O, 웹 브라우징 등을 위한 도구가 실제 사용자 입력이 처리되기 전에 모두 컨텍스트 창에 덤프됩니다.
라우팅 레이어는 사용자 메시지(또는 시스템 프롬프트)를 검사하고 설명이나 도구가 의도와 일치하는 MCP 서버만 조건부로 포함할 수 있습니다. 예를 들어, 파일 경로를 언급하는 프롬프트는 파일 도구를 활성화하고, 주식 가격에 대한 질문은 금융 서버만 로드합니다. 이를 통해 관련 없는 서버 메타데이터의 토큰 오버헤드를 피할 수 있습니다.
이 정보가 필요한 사람
특히 토큰 효율성이 중요한 자동화 파이프라인이나 사용자 정의 프론트엔드에서 여러 MCP 서버와 함께 Claude를 실행하는 개발자.
📖 전체 출처 읽기: r/ClaudeAI
👀 See Also

돈을 낭비하고 보안 위험을 초래하는 다섯 가지 일반적인 OpenClaw 설정 실수
50개 이상의 OpenClaw 설정을 검토한 결과, 동일한 다섯 가지 문제가 반복적으로 나타납니다: 대부분의 작업에 Sonnet 대신 Opus를 기본 모델로 사용하는 것, 새 세션을 시작하지 않는 것, 소스 코드를 읽지 않고 스킬을 설치하는 것, 게이트웨이를 네트워크에 노출시키는 것, 첫 번째 에이전트를 수정하기 전에 두 번째 에이전트를 추가하는 것.

Claude Code의 상세 설명 스피너 기능을 비활성화하는 방법
Claude Code에는 기본적으로 동사 스피너가 포함되어 있어 처리 중에 'Seasoning'과 'Crafting' 같은 재미있는 동명사를 표시합니다. 설정.json 파일의 spinnerVerbs 배열에 공백을 넣어 편집하면 이 기능을 비활성화할 수 있습니다.

AI 코딩 에이전트를 위한 Bite vs Nibble 접근법
한 NLP 연구자가 AI 코딩 에이전트 작업을 위한 두 가지 멘탈 모델을 설명합니다: claude.md와 같은 포괄적인 지침 파일을 사용하는 '한입(bite)' 접근법과, 여러 번의 반복을 통한 점진적 개선을 사용하는 '조금씩(nibble)' 접근법입니다.

멀티 모델 라우팅이 OpenClaw API 비용을 50% 절감합니다
한 개발자가 다양한 작업을 다른 모델을 통해 라우팅하여 OpenClaw API 비용을 50% 절감했습니다: 복잡한 추론에는 Claude, 파일 작업 및 테스트 생성에는 DeepSeek, 중간 수준 작업에는 Gemini 또는 GPT를 사용했습니다.