Claude 프롬프트 캐시 진단: 통계 스레드가 98.9% 캐시 읽기 비율 공개

이틀 전, Anthropic은 Claude Console에 프롬프트 캐시 진단 기능을 출시했습니다. 이는 개발자가 요청이 캐시를 놓치는 이유를 파악하고 비용을 절감할 수 있도록 돕는 도구입니다. 한 개발자(u/samuelroy_)가 커뮤니티 스레드에서 자신의 통계를 공유하며, 패턴을 찾고 전반적인 캐시 성능을 개선하는 데 기여하고자 했습니다.
출처의 주요 통계
- 전체 캐시 읽기 비율: 98.9%
- 캐시 미스의 80%는
messages changed때문입니다. - Sonnet의 쓰기 상각비: 3.69배
개발자는 자신의 프로젝트가 메시지를 기록에만 추가하도록 설계되어 있어, messages changed로 인한 높은 미스율이 의외라고 언급했습니다. 가능한 설명은 사용자가 대화를 포크(fork)하여 메시지 체인이 변경되기 때문입니다.
의미
프롬프트 캐싱은 비용과 지연 시간을 줄여줍니다. 읽기 비율이 98.9%로 이미 효율적이지만, 진단 데이터는 불필요한 메시지 변경을 줄이는 것이 개선 영역임을 명확히 보여줍니다. 유사한 패턴이 나타난다면 대화 포크 또는 편집 방식을 감사하여 캐시 적중률을 높일 수 있습니다.
참고로 쓰기 상각비(Sonnet의 경우 3.69배)는 읽기 대비 캐시 항목이 쓰여진 횟수를 나타내며, 값이 낮을수록 좋습니다.
이와 같은 자체 분석은 AI API 비용 최적화의 한 단계 진전입니다. 다른 제공업체들도 이를 따를 것으로 예상됩니다.
📖 전체 출처 읽기: r/ClaudeAI
👀 See Also

Claude-Code v2.1.38 릴리스: 주요 수정 사항 및 개선점
Claude-Code v2.1.38은 VS Code 터미널 회귀 문제, Tab 키 문제, bash 명령어 권한 수정을 해결했습니다. 또한 heredoc 구문 분석과 샌드박스 모드 보안을 개선했습니다.

클로드 코워크 UX 문제: 지속적 입력 상자가 잘못된 연속성 기대를 조성함
사용자가 Claude Cowork에서 지속적인 텍스트 입력 상자가 작업 전환 시 초안 텍스트를 유지하지만 컨텍스트를 재설정하고 첨부 파일을 잃어 연속성에 대한 모순된 신호를 생성하는 UX 문제를 식별했습니다.

오픈클로의 역사: 몰트봇에서 오픈 소스 AI 혁명까지
없음

RTX 4090에서 2K부터 400K 컨텍스트까지 Qwen3.5 모델의 벤치마크 결과
한 개발자가 RTX 4090에서 여러 Qwen3.5 모델 변형을 테스트하며, 2,048에서 400,000 토큰까지의 컨텍스트 창에서 성능을 측정했습니다. 벤치마크에는 첫 토큰까지의 시간 지표가 포함되어 있으며, 일부 모델이 KV 오프로드 테스트를 필요로 하는 문제점을 드러냈습니다.