컨텍스트 모드 MCP 서버, 클로드 코드 컨텍스트 사용량 98% 절감

컨텍스트 모드는 Claude Code와 툴 출력 사이에 위치하여 컨텍스트 윈도우 소비를 98% 줄이는 MCP 서버입니다. 200K 컨텍스트 윈도우에 원시 데이터를 덤프하는 대신, 격리된 샌드박스에서 출력을 처리합니다.
작동 방식
샌드박스 시스템은 각 실행 호출마다 격리된 서브프로세스를 생성합니다. 스크립트는 자체 프로세스 경계를 가진 이 서브프로세스에서 실행되며, stdout만 대화 컨텍스트로 들어갑니다. 로그 파일, API 응답, 스냅샷과 같은 원시 데이터는 샌드박스를 벗어나지 않습니다.
10개의 언어 런타임을 사용할 수 있습니다: JavaScript, TypeScript, Python, Shell, Ruby, Go, Rust, PHP, Perl, R. Bun은 3-5배 빠른 JS/TS 실행을 위해 자동 감지됩니다. 인증된 CLI(gh, aws, gcloud, kubectl, docker)는 자격 증명 패스스루를 통해 작동하며, 서브프로세스는 환경 변수와 구성 경로를 상속받아 대화에 노출시키지 않습니다.
지식 베이스 기능
인덱스 툴은 코드 블록을 유지하면서 마크다운 콘텐츠를 제목별로 청킹한 후, SQLite FTS5 가상 테이블에 저장합니다. 검색은 인덱싱 시점에 Porter 스테밍이 적용된 BM25 순위를 사용합니다. 검색을 호출하면 제목 계층 구조와 함께 정확한 코드 블록이 반환됩니다.
fetch_and_index 툴은 이를 URL로 확장합니다: 가져오기, HTML을 마크다운으로 변환, 청킹, 인덱싱. 원본 페이지는 컨텍스트로 들어가지 않습니다.
성능 벤치마크
- Playwright 스냅샷: 56 KB → 299 B
- GitHub 이슈 (20개): 59 KB → 1.1 KB
- 액세스 로그 (500 요청): 45 KB → 155 B
- 분석 CSV (500 행): 85 KB → 222 B
- Git 로그 (153 커밋): 11.6 KB → 107 B
- 리포지토리 연구 (서브에이전트): 986 KB → 62 KB (5회 호출 대 37회)
전체 세션 동안: 315 KB의 원시 출력이 5.4 KB가 됩니다. 속도 저하 전 세션 시간은 ~30분에서 ~3시간으로 증가합니다. 45분 후 남은 컨텍스트: 60% 대신 99%.
설치
두 가지 설치 방법:
- 플러그인 마켓플레이스:
/plugin marketplace add mksglu/claude-context-mode후/plugin install context-mode@claude-context-mode - MCP 전용:
claude mcp add context-mode -- npx -y context-mode
설치 후 Claude Code를 재시작하세요. 컨텍스트 모드는 툴 출력을 자동으로 샌드박스를 통해 라우팅하는 PreToolUse 훅을 포함합니다. 서브에이전트는 batch_execute를 주요 툴로 사용하도록 학습하며, bash 서브에이전트는 MCP 툴에 접근할 수 있도록 범용으로 업그레이드됩니다.
이 툴은 github.com/mksglu/claude-context-mode에서 MIT 라이선스로 오픈 소스입니다.
📖 전체 소스 읽기: HN LLM Tools
👀 See Also

harshal-mcp-proxy 이제 npm에서 사용 가능: 단일 데몬이 12개의 MCP 서버 설정 대체
harshal-mcp-proxy가 이제 54 kB npm 패키지로 제공됩니다. 전역 설치, 데몬 실행으로 12개의 개별 MCP 서버 구성을 6개의 도구로 대체하여 세션당 약 2.7GB RAM과 50K 토큰을 절약합니다.

모바일에서 Claude 코드 CLI를 제어하는 텔레그램 봇
한 개발자가 Claude Code CLI에 연결하는 텔레그램 봇을 만들어서 /commit, /code_review, /simplify 같은 모바일 명령어로 제어할 수 있게 했습니다. 이 봇은 사용자 정의 스킬을 자동으로 찾아내고, 사진/문서/음성 메모를 처리하며, 그룹 채팅 세션도 지원합니다.

Qwen 3.6 27B F16, 팩맨 코딩 테스트 통과했지만 8비트 양자화는 실패 — 템플릿과 MTP 추측 디코딩에 관한 핵심 교훈
한 사용자가 Qwen 3.6 27B F16으로 팩맨 클론을 한 번에 생성 — 세 번 중 두 번의 시도가 거의 완벽한 게임을 만듦. 8비트 양자화는 완전히 실패. 채팅 템플릿 튜닝과 MTP 추측 디코딩 속도 향상에 대한 상세한 노트.

TOON MCP 서버는 OpenClaw에서 도구 결과 토큰을 30-60% 감소시킵니다.
구조화된 JSON 도구 결과를 TOON 형식으로 압축하는 MCP 서버는 데이터베이스 쿼리 및 API 응답과 같은 표 형식 데이터에 대해 토큰 사용량을 30-60% 절감할 수 있어 OpenClaw 세션에서 컨텍스트 윈도우 압축을 지연시키는 데 도움이 됩니다.