에이전트캐시: 멀티 에이전트 LLM 프리픽스 캐싱을 위한 파이썬 라이브러리

agentcache는 접두사 캐싱을 핵심 기능으로 구현하여 멀티 에이전트 LLM 시스템을 최적화하도록 설계된 Python 라이브러리입니다. 이 라이브러리는 CrewAI, AutoGen, open-multi-agent와 같은 프레임워크가 각 작업자마다 새로운 세션을 생성하여 캐시 적중률이 0%가 되고 프롬프트 비용이 중복되는 일반적인 문제를 해결합니다.
작동 방식
라이브러리는 별도의 세션을 생성하는 대신 포크 기반 접근 방식으로 작동합니다:
- 공유 시스템 프롬프트로 하나의 세션 시작
- 첫 번째 호출 수행 - 제공자가 접두사를 계산하고 캐시
- N개의 작업자가 필요할 때, N개의 새 세션을 생성하는 대신 포크
- 부모 세션: [시스템, 메시지1, 메시지2, ...]
- 포크된 세션: [시스템, 메시지1, 메시지2, ..., 작업자_작업]
- 정확히 동일한 접두사 = 캐시 적중
주요 기능
- 캐시 안전 포크: 작업자 세션 간 동일한 접두사 유지
- 캐시 중단 감지: 스냅샷을 비교하고 캐시 적중률이 떨어질 때 정확히 무엇이 변경되었는지 보고
- 캐시 안전 압축: 장기 실행 세션의 경우, 각 호출 전에 이전 도구 출력을 스캔하고 큰 결과를 결정론적 자리 표시자로 대체하여 캐시 가능한 접두사를 유지하면서 더 작은 컨텍스트 유지
- 매개변수 고정: 포크 전에 캐시 관련 매개변수 고정 (시스템 프롬프트, 모델, 도구, 메시지, 추론 구성)
- 작업 DAG 스케줄링: 하나의 캐시된 세션에서 병렬 작업자 활성화
성능 결과
GPT-4o-mini와의 직접 비교 테스트에서 (코디네이터 + 3 작업자, 동일 작업):
- 텍스트 주입 / 별도 세션: 0% 캐시 적중, 85.7초
- 접두사 포크: 75.8% 캐시 적중, 37.4초
- 작업자당 캐시 적중률은 일반적으로 80-99% 범위
설치 및 사용법
pip를 통해 설치:
pip install "git+https://github.com/masteragentcoder/agentcache.git@main"
라이브러리는 GitHub에서 github.com/masteragentcoder/agentcache에서 사용할 수 있습니다.
📖 Read the full source: r/LocalLLaMA
👀 See Also

obsidian-mcp: 대규모 보관소를 대상으로 한 25개 도구를 가진 그래프 인식 MCP 서버
obsidian-mcp는 25개의 도구(get_note, traverse_graph, query_dataview, move_note, create_notes 포함)를 제공하는 MCP 서버로, Claude에게 Obsidian 볼트에 대한 그래프 인식 접근을 제공하여 5,000개 노트 볼트에서 컨텍스트 창 소진을 방지합니다. MIT 라이선스이며, Claude Desktop, Claude Code, Cursor, Cline, Continue, Zed와 호환됩니다.

Logseq Brain v0.6.0: Claude Code를 위한 지속 메모리 플러그인, 여정 로그 및 섹션 타겟 읽기 추가
Logseq Brain v0.6.0은 모든 작업에 대한 여정 로그, 토큰 절감을 위한 섹션 타겟 읽기, 스킬 파일의 점진적 공개를 추가했습니다.

클로드 코드 스킬 /council은 4개의 AI 모델에 프롬프트를 병렬로 실행합니다
Claude Code 스킬 중 하나인 /council은 어떤 프롬프트든 GPT, Claude, Gemini, Grok에 동시에 전송하여 약 7초 만에 결과를 받고, Gemini를 사용해 다른 모델들의 구체적인 개선점을 식별하여 최상의 응답을 종합합니다.

cowork-session-sync v1.0.0는 Claude Cowork의 세션 연속성을 제공합니다.
cowork-session-sync v1.0.0은 Claude Cowork의 세션 연속성을 유지하기 위한 도구로, 원본 대화 기록을 보관하고 이를 Markdown으로 정제하며, 'catchup-bunny'를 통한 한 문장 부트스트랩으로 전체 컨텍스트를 복원할 수 있도록 합니다.