Prefex: 프롬프트 캐싱과 세션 메모리 자동화를 위한 Claude 코드용 로컬 프록시

✍️ OpenClawRadar📅 게시일: April 15, 2026🔗 Source
Prefex: 프롬프트 캐싱과 세션 메모리 자동화를 위한 Claude 코드용 로컬 프록시
Ad

Prefex는 Claude Code 사용 시 API 비용을 절감하기 위해 설계된 로컬 프록시 도구입니다. 이 도구는 두 가지 특정한 비효율성을 해결합니다: Anthropic의 베타 프롬프트 캐싱 기능은 수동 헤더 주입이 필요하며, Claude Code는 모든 요청에 전체 대화 기록을 전송합니다.

작동 방식

Prefex는 Claude Code와 Anthropic API 사이의 프록시로 사용자의 로컬 머신에서 완전히 실행됩니다. 이 도구는 Anthropic의 프롬프트 캐싱 기능을 활성화하는 데 필요한 특정 헤더를 자동으로 주입하여 반복 입력 토큰에 대한 비용을 90% 절감합니다. 이 헤더가 없으면 CLAUDE.md 및 프로젝트 컨텍스트를 포함한 모든 요청이 정가로 청구됩니다.

이 도구는 또한 세션 메모리를 구현하여 Claude Code가 각 차례마다 전체 대화 기록을 재전송하는 것을 방지합니다. 추가로 더 저렴한 모델로 간단한 쿼리를 라우팅할 수 있는 모델 라우터를 포함하지만, 이 기능은 초기 테스트 기간 동안 활성화되지 않았습니다.

성능 및 설치

정상적인 사용으로 4일간 테스트한 결과:

  • 1,338개 요청 처리
  • Prefex 사용 시 실제 비용 $49.60
  • Prefex 없을 경우 예상 비용 $348
  • 86% 절감 달성 (캐싱만 사용, 모델 라우팅 없음)

개발자는 karpathy/nanoGPT에서 콜드 및 웜 스타트로 5개 질문을 실행하는 벤치마크를 제공하며, 이는 약 $0.03의 비용이 듭니다. 비용 계산은 Anthropic의 실제 청구 필드를 사용합니다.

설치에는 하나의 curl 명령과 settings.json에 한 줄 추가가 필요합니다. 패키지에는 제거 스크립트가 포함되어 있습니다. 이 도구는 외부 서버 없이 로컬에서 작동하며, 원격 측정도 없고 API 키는 직접 Anthropic으로 전송됩니다.

📖 Read the full source: r/ClaudeAI

Ad

👀 See Also

에이전트 브라우저 프로토콜: AI 에이전트용 오픈소스 Chrome 포크, Mind2Web 벤치마크에서 90% 달성
Tools

에이전트 브라우저 프로토콜: AI 에이전트용 오픈소스 Chrome 포크, Mind2Web 벤치마크에서 90% 달성

에이전트 브라우저 프로토콜(ABP)은 각 작업 후 JavaScript와 시간을 정지시켜 웹 브라우징을 AI 에이전트용 멀티모달 채팅으로 변환하는 오픈소스 Chrome 포크입니다. Online Mind2Web 벤치마크에서 90.53%를 달성했으며, 단일 명령어로 Claude Code에 추가할 수 있습니다.

OpenClawRadar
ClawRelay: 자동 장애 조치 기능을 갖춘 macOS 네이티브 OpenAI 호환 LLM 프록시
Tools

ClawRelay: 자동 장애 조치 기능을 갖춘 macOS 네이티브 OpenAI 호환 LLM 프록시

ClawRelay는 macOS 15+에서 OpenAI 호환 HTTP 서버를 실행하며, LLM 제공자 간 자동 장애 조치 기능을 제공합니다. OpenAI, Groq, Nvidia NIMs, Ollama 및 /v1/chat/completions 엔드포인트를 지원하는 모든 서비스를 지원합니다.

OpenClawRadar
Quiver: Claude 코드 스킬 관리 및 동기화를 위한 GUI
Tools

Quiver: Claude 코드 스킬 관리 및 동기화를 위한 GUI

Quiver는 무료 오픈소스 GUI 도구로, Claude Code 스킬 관리를 위한 웹 인터페이스를 제공합니다. 사용자는 로컬 스킬과 마켓플레이스 플러그인을 탐색하고, SKILL.md 파일을 편집하며, Git을 통해 동기화하고, 터미널 사용 없이 스킬을 설치할 수 있습니다.

OpenClawRadar
LLM 위원회 분석, 실용적인 클로드 코드 토큰 최적화 전략 공개
Tools

LLM 위원회 분석, 실용적인 클로드 코드 토큰 최적화 전략 공개

한 개발자가 5가지 페르소나를 활용한 LLM Council 도구로 Claude Code 사용 패턴을 분석한 결과, 기본적으로 설정된 확장 사고 모드가 가장 큰 토큰 소모 요인임을 확인했습니다. 결과적으로 구현된 플레이북은 동일하거나 더 나은 출력 품질을 유지하면서 60-70%의 토큰 절감을 달성했습니다.

OpenClawRadar