AVP 프로토콜은 토큰 효율성을 위해 텍스트 대신 KV-캐시를 공유할 수 있도록 LLM 에이전트를 지원합니다

AVP의 기능
AVP(에이전트 벡터 프로토콜)는 다중 에이전트 환경에서 LLM 에이전트들이 텍스트 대신 KV 캐시를 직접 전달할 수 있게 하는 프로토콜입니다. 이를 통해 각 에이전트가 전체 대화 기록을 재처리할 때 발생하는 중복 토큰화와 순방향 패스를 제거합니다.
작동 방식
각 에이전트가 모든 것을 재토큰화하는 기존의 텍스트 기반 방식 대신, AVP는 에이전트 A가 추론 후 키-값 어텐션 상태를 직렬화하고, 에이전트 B가 이를 직접 주입할 수 있게 합니다. 이는 다음을 의미합니다:
- 양측 동일 모델: 오버헤드 없이 직접 KV 캐시 전송
- 동일 계열, 다른 크기(예: Qwen2.5-7B가 1.5B와 통신): 학습된 파라미터나 보정 데이터 없이 어휘 기반 투영 가능
- 다른 계열: JSON으로 폴백
- 전송 방식 독립적: A2A, MCP, gRPC 또는 기존 사용 중인 어떤 방식과도 함께 작동
- 바이너리 와이어 형식: JSON+Base64(텐서 데이터에 33% 오버헤드 발생)가 아님
성능 결과
Qwen2.5, Llama 3.2, DeepSeek-R1-Distill 모델에서 테스트 결과:
- 토큰 절감률 73-78%
- 2-4배 속도 향상
- 세 모델 계열 모두에서 일관된 결과
- 체인 길이가 길어질수록 차이 확대: 4개 에이전트에서 약 2배, 16개 에이전트(예상)에서 약 6배
효율성은 각 단계마다 텍스트 프롬프트 크기가 급증하는 반면(4개 에이전트 GSM8K 체인에서 186 → 545 → 1,073 → 1,397 토큰), 잠재 상태는 이전 컨텍스트가 사전 계산된 KV 캐시로 도착하기 때문에 단계당 약 164-207 토큰으로 일정하게 유지되기 때문입니다.
제한 사항
- 샘플 크기: 모델당 n=20(토큰/속도 주장에는 충분하지만 정확도 주장에는 부족)
- 소형 모델만 테스트 완료(RTX 3070 Ti에서 1.5B-3B), 7B+ 결과는 보류 중
- 최소 1 Gbps 이상 대역폭 필요(3B 모델의 KV 캐시는 샘플당 약 130 MB)
- 자체 호스팅 전용(KV 캐시 접근 필요, OpenAI/Anthropic 등 API와는 작동 안 함)
- 현재 동일 모델만 지원(교차 모델 구현은 존재하지만 벤치마크 미완료)
- 텍스트 대비 잠재 상태가 17-54배 더 많은 VRAM 사용(단계 간 KV 캐시 유지 필요)
시작하기
설치: pip install avp
두 가지 API 수준 제공:
import avp
msg = avp.pack("Hello", model="Qwen/Qwen2.5-7B-Instruct", think_steps=20)
answer = avp.unpack(msg, model="Qwen/Qwen2.5-7B-Instruct")또는 더 많은 제어를 원할 경우:
from avp import HuggingFaceConnector
connector = HuggingFaceConnector.from_pretrained("Qwen/Qwen2.5-1.5B-Instruct")
context = connector.think("이 문제를 분석하세요", steps=20)
answer = connector.generate("해결하세요.", context=context)vLLM 커넥터도 사용 가능: pip install "avp[vllm]"
프로젝트 링크
- SDK: github.com/VectorArc/avp-python (MIT, 377개 테스트, 7개 벤치마크)
- 사양: github.com/VectorArc/avp-spec
- 벤치마크 상세: BENCHMARKS.md
📖 전체 출처 읽기: r/LocalLLaMA
👀 See Also

Argus: 실시간 클로드 코드 관측을 위한 오픈소스 VS Code 확장
Argus는 VS Code 내에서 Claude Code 에이전트의 단계를 실시간으로 시각화하여 타임라인, 종속성 그래프, 비용/루프 탐지를 제공, 토큰 낭비 행동을 디버깅합니다.

Warp 터미널, 에이전틱 개발 환경과 함께 오픈소스로 전환
Warp가 오픈소스로 전환되며, 내장 코딩 에이전트와 Claude Code, Codex, Gemini CLI와 같은 자체 CLI 에이전트를 지원하는 에이전틱 개발 환경으로 리브랜딩되었습니다.

Claude 스킬로 디자인 스튜디오 환경 구현하기
한 디자이너가 두 가지 Claude 스킬을 공유합니다. 하나는 팀원과 디자인 방법을 갖춘 스튜디오를 시뮬레이션하고, 다른 하나는 창의성을 위해 '엄격한 놀이'를 추가합니다.

ProofShot: 브라우저 녹화로 UI 코드를 검증하는 AI 에이전트용 CLI
ProofShot은 AI 코딩 에이전트가 브라우저를 열고 페이지와 상호작용하며 세션을 기록하고 오류를 수집한 다음, 모든 것을 검토용 독립형 HTML 파일로 묶는 CLI 도구입니다. 셸 명령을 통해 모든 AI 에이전트와 작동하며 스킬로 패키징되어 있습니다.