토큰 낭비 없이 클로드 채팅 간 맥락 유지하는 2-프롬프트 시스템

한 Reddit 사용자가 프로젝트 중간에 클로드 채팅 길이 제한에 도달하는 문제를 해결하는 실용적인 시스템을 게시했습니다. 이 솔루션은 두 개의 프롬프트를 사용합니다. 하나는 이전 채팅에서 컨텍스트를 추출하고, 다른 하나는 새 채팅을 초기화하는 것입니다.
문제
긴 클로드 대화는 속도가 느려지고 길이 제한에 도달하거나 API 비용이 많이 듭니다. 일반적인 해결 방법(수동 요약, 전체 채팅 복사하여 붙여넣기, 새로 시작)은 중요한 결정을 잃거나 토큰을 낭비하거나 다시 설명해야 합니다.
시스템
프롬프트 1: 컨텍스트 추출 (이전 채팅에 붙여넣기)
클로드에게 전체 대화를 9개 섹션으로 구성된 구조화된 요약으로 압축하도록 지시합니다: 목표, 주요 컨텍스트, 결정 사항, 완료된 작업, 현재 상태, 다음 단계, 미해결 질문/장애물, 중요 데이터/자산, 스타일 및 선호도. 출력은 깨끗한 코드 블록 하나 안에 넣어야 합니다. 대상 길이는 300~600단어이며, 일반적인 내용보다 구체적인 내용을 보존합니다.
프롬프트 2: 채팅 초기화 (새 채팅에 붙여넣기)
추출된 컨텍스트 블록을 붙여넣고 새 채팅에 이를 진실의 원천으로 취급하도록 지시합니다. 클로드에게 이해를 확인하고, 누락된 부분을 표시하고, 다시 시작하지 않고 다음 단계부터 재개하도록 요청합니다.
정확한 프롬프트는 출처에 제공됩니다. 예를 들어, 추출 프롬프트의 출력 구조는 다음 헤더를 사용합니다:
- 목표
- 주요 컨텍스트
- 결정 사항 (이유 포함)
- 완료된 작업
- 현재 상태
- 다음 단계 (즉시 다음 단계는 →로 표시)
- 미해결 질문 / 장애물
- 중요 데이터 / 자산
- 스타일 및 선호도
초기화 프롬프트에는 다음이 포함됩니다: "컨텍스트를 확립된 것으로 취급하십시오. 다시 프레이밍하거나 다시 시작하지 마십시오. 나열된 모든 결정과 선호도를 유지하십시오." 또한 목표, 즉시 다음 조치 및 누락된 부분이 포함된 확인 답변을 요청합니다.
대상
장기 실행 프로젝트를 계속해야 하면서 컨텍스트를 잃거나 중복 설명에 토큰을 낭비하고 싶지 않은 클로드(API 또는 웹) 사용자.
📖 전체 출처 읽기: r/ClaudeAI
👀 See Also

로그 감소기 MCP 서버, 클로드 코드가 로그를 읽을 때 토큰 사용량 절감
Log Reducer는 로그 파일을 서버 측에서 처리하여 Claude Code에 축소된 출력만 전송하는 MCP 서버로, 원시 로그가 컨텍스트 창에 들어가는 것을 방지합니다. 19가지 결정론적 변환을 적용하여 로그를 50-90% 압축하며, 2,000줄의 로그는 세션에서 20,000개 이상의 토큰이 제거되는 것을 의미합니다.

로컬 LLM을 활용한 자율 코드 생성 테스트: 품질 대 속도 벤치마크
개발자가 실제 Go 코드 생성 작업에 로컬 LLM을 테스트하는 도구를 구축하여 컴파일 성공률, 필드 추출 정확도, 처리량을 측정했습니다. 결과는 품질과 속도 측면에서 모델을 비교합니다.

Apfel: macOS에서 Apple의 온디바이스 LLM에 접근하는 무료 CLI 도구
Apfel v0.6.13은 Apple의 내장 LLM을 CLI 도구, OpenAI 호환 서버, 대화형 채팅으로 노출하는 Swift 6.3 바이너리입니다. API 키나 비용 없이 100% 온디바이스에서 실행되며, Apple Silicon Mac의 macOS 26+와 함께 제공되는 4,096 토큰 모델을 사용합니다.

해안: 다중 로컬호스트 환경을 실행하기 위한 컨테이너화된 호스트
Coasts는 Docker-in-Docker 솔루션으로, 복잡한 스크립팅 없이도 여러 로컬호스트 환경을 동시에 실행하고 포트 충돌, 비밀 정보, 볼륨 토폴로지를 처리하는 문제를 해결합니다.