Prefex: 프롬프트 캐싱과 세션 메모리 자동화를 위한 Claude 코드용 로컬 프록시

Prefex는 Claude Code 사용 시 API 비용을 절감하기 위해 설계된 로컬 프록시 도구입니다. 이 도구는 두 가지 특정한 비효율성을 해결합니다: Anthropic의 베타 프롬프트 캐싱 기능은 수동 헤더 주입이 필요하며, Claude Code는 모든 요청에 전체 대화 기록을 전송합니다.
작동 방식
Prefex는 Claude Code와 Anthropic API 사이의 프록시로 사용자의 로컬 머신에서 완전히 실행됩니다. 이 도구는 Anthropic의 프롬프트 캐싱 기능을 활성화하는 데 필요한 특정 헤더를 자동으로 주입하여 반복 입력 토큰에 대한 비용을 90% 절감합니다. 이 헤더가 없으면 CLAUDE.md 및 프로젝트 컨텍스트를 포함한 모든 요청이 정가로 청구됩니다.
이 도구는 또한 세션 메모리를 구현하여 Claude Code가 각 차례마다 전체 대화 기록을 재전송하는 것을 방지합니다. 추가로 더 저렴한 모델로 간단한 쿼리를 라우팅할 수 있는 모델 라우터를 포함하지만, 이 기능은 초기 테스트 기간 동안 활성화되지 않았습니다.
성능 및 설치
정상적인 사용으로 4일간 테스트한 결과:
- 1,338개 요청 처리
- Prefex 사용 시 실제 비용 $49.60
- Prefex 없을 경우 예상 비용 $348
- 86% 절감 달성 (캐싱만 사용, 모델 라우팅 없음)
개발자는 karpathy/nanoGPT에서 콜드 및 웜 스타트로 5개 질문을 실행하는 벤치마크를 제공하며, 이는 약 $0.03의 비용이 듭니다. 비용 계산은 Anthropic의 실제 청구 필드를 사용합니다.
설치에는 하나의 curl 명령과 settings.json에 한 줄 추가가 필요합니다. 패키지에는 제거 스크립트가 포함되어 있습니다. 이 도구는 외부 서버 없이 로컬에서 작동하며, 원격 측정도 없고 API 키는 직접 Anthropic으로 전송됩니다.
📖 Read the full source: r/ClaudeAI
👀 See Also

OmniCoder-9B: 425K 에이전트 궤적으로 미세 조정된 90억 파라미터 코딩 에이전트
테슬레이트가 Qwen3.5-9B의 하이브리드 아키텍처를 기반으로 파인튜닝한 90억 파라미터 코딩 에이전트 모델 OmniCoder-9B를 공개했습니다. 이 모델은 Claude Opus 4.6, GPT-5.4, GPT-5.3-Codex, Gemini 3.1 Pro의 425,000개 이상의 정제된 에이전트 코딩 트랙을 학습했습니다.

Discord를 통한 헤드리스 OpenClaw 설정 (Docker 스크립트 사용)
GitHub 저장소에서 OpenClaw를 Discord와 함께 헤드리스 Docker 컨테이너에서 실행하는 스크립트를 제공합니다. TUI/WebUI를 피하며, claw init, start, stop 같은 명령어를 지원하는 관리 스크립트와 OpenAI Responses API, Chromium, 다양한 도구에 대한 사전 구성 지원을 포함합니다.

AMD의 레모네이드: GPU와 NPU용 오픈 소스 로컬 LLM 서버
Lemonade는 GPU와 NPU에서 텍스트, 이미지, 음성 모델을 실행하는 오픈 소스 로컬 AI 서버입니다. OpenAI API와 호환되며, 여러 모델을 동시에 지원하고, 2MB의 네이티브 C++ 백엔드를 갖추고 있습니다.

루쿠즈: 체계적인 테스트와 함께 20만 줄의 C++ 그래프 데이터베이스를 Rust로 이식하기
Rukuzu 프로젝트는 20만 줄의 C++ kuzu 임베디드 그래프 데이터베이스를 Rust로 포팅하는 워크플로우를 설명합니다. Claude Code 커스텀 명령어를 사용해 두 버전을 동시에 유지하고 2,700개 이상의 테스트를 통해 정확성을 검증합니다.