AVP-Protokoll ermöglicht LLM-Agenten den Austausch von KV-Cache anstelle von Text für Token-Effizienz

Was AVP bewirkt
AVP (Agent Vector Protocol) ist ein Protokoll, das LLM-Agenten in Multi-Agenten-Setups ermöglicht, KV-Cache direkt zwischen Agenten weiterzugeben anstatt Text. Dadurch werden redundante Tokenisierung und Vorwärtsdurchläufe vermieden, die auftreten, wenn jeder Agent den gesamten Konversationsverlauf erneut verarbeitet.
Wie es funktioniert
Anstatt des traditionellen textbasierten Ansatzes, bei dem jeder Agent alles erneut tokenisiert, ermöglicht AVP Agent A, seine Key-Value-Aufmerksamkeitszustände nach dem Denkvorgang zu serialisieren, und Agent B injiziert sie direkt. Das bedeutet:
- Gleiches Modell auf beiden Seiten: Direkter KV-Cache-Transfer ohne Overhead
- Gleiche Familie, unterschiedliche Größe (z.B. Qwen2.5-7B spricht mit 1.5B): Vokabularvermittelte Projektion ohne gelernte Parameter oder Kalibrierungsdaten erforderlich
- Unterschiedliche Familien: Fällt auf JSON zurück
- Transportunabhängig: Funktioniert neben A2A, MCP, gRPC oder was auch immer Sie bereits verwenden
- Binäres Übertragungsformat: Nicht JSON+Base64 (was 33% Overhead auf Tensordaten hat)
Leistungsergebnisse
Tests über Qwen2.5-, Llama 3.2- und DeepSeek-R1-Distill-Modelle zeigten:
- Token-Einsparungen von 73-78%
- 2-4-fache Geschwindigkeitssteigerungen
- Diese Ergebnisse blieben über alle drei Modellfamilien hinweg konsistent
- Die Lücke vergrößert sich mit der Kettenlänge: bei 4 Agenten etwa 2-fach, bei 16 Agenten (projiziert) wäre es etwa 6-fach
Die Effizienz kommt daher, dass Textprompt-Größen bei jedem Hop anschwellen (186 → 545 → 1.073 → 1.397 Token in einer 4-Agenten-GSM8K-Kette), während latente Zustände bei etwa 164-207 Token pro Hop flach bleiben, weil vorheriger Kontext als vorberechneter KV-Cache ankommt.
Einschränkungen
- Stichprobengrößen sind n=20 pro Modell (ausreichend für Token-/Geschwindigkeitsaussagen, aber nicht für Genauigkeitsaussagen)
- Nur an kleinen Modellen getestet (1.5B-3B auf einer RTX 3070 Ti) mit ausstehenden Ergebnissen für 7B+
- Benötigt mindestens 1 Gbps+ Bandbreite (KV-Cache für ein 3B-Modell beträgt etwa 130 MB pro Stichprobe)
- Nur selbst gehostet (erfordert KV-Cache-Zugriff, funktioniert nicht mit OpenAI/Anthropic/etc. APIs)
- Derzeit nur gleiches Modell (Cross-Model-Implementierung existiert, aber nicht benchmarked)
- Latente Zustände verwenden 17-54x mehr VRAM als Text, weil KV-Cache über Hops hinweg gehalten wird
Erste Schritte
Installieren mit: pip install avp
Zwei API-Ebenen verfügbar:
import avp
msg = avp.pack("Hello", model="Qwen/Qwen2.5-7B-Instruct", think_steps=20)
answer = avp.unpack(msg, model="Qwen/Qwen2.5-7B-Instruct")Oder mit mehr Kontrolle:
from avp import HuggingFaceConnector
connector = HuggingFaceConnector.from_pretrained("Qwen/Qwen2.5-1.5B-Instruct")
context = connector.think("Analysiere dieses Problem", steps=20)
answer = connector.generate("Löse es.", context=context)vLLM-Connector ebenfalls verfügbar: pip install "avp[vllm]"
Projektlinks
- SDK: github.com/VectorArc/avp-python (MIT, 377 Tests, 7 Benchmarks)
- Spezifikation: github.com/VectorArc/avp-spec
- Benchmark-Details: BENCHMARKS.md
📖 Read the full source: r/LocalLLaMA
👀 Siehe auch

HTML-Artefakte ersetzen Google Docs für technische Dokumentation, aber es fehlt die Kommentarfunktion
Claude-generierte HTML-Artefakte ersetzen Google Docs für lange, technische Inhalte wie Spike-Auswertungen und Architekturnoten, aber die Sandbox-iframe-Natur verhindert Inline-Kommentare und Überprüfungsfunktionen.

Destillerie: Ein Claude-Code-Plugin für beständigen Team-Kontext
Distillery ist ein Plugin für Claude Code, das Teams gemeinsamen, persistenten Kontext über Sitzungen und Personen hinweg bietet. Version 0.2.0 fügt Hybridsuche, Authentifizierungs-Überwachungsprotokollierung und UV-Unterstützung hinzu.

AutoDream: 11-Hook-Speichersystem für Claude Code mit Sicherheitsfunktionen
AutoDream ist ein Open-Source-Tool, das Projektspeicherpersistenz und Befehlsicherheit zu Claude Code hinzufügt. Es verwendet 11 Hooks über 6 Ereignisse hinweg, um Kontext einzuspritzen, gefährliche Befehle zu blockieren und den /compact-Vorgang zu überstehen.

Der SMELT-Compiler reduziert die OpenClaw-Arbeitsbereich-Tokennutzung um bis zu 95 %.
SMELT kompiliert OpenClaw-Arbeitsbereich-Markdown-Dateien in eine kompaktere Laufzeitform und sendet nur relevante Inhalte an KI-Modelle. Benchmarks zeigen Token-Reduktionen von 76,1 % bis 95,5 % bei Abfragen, wodurch die Neuverarbeitung statischer Dateien wie USER.md und SOUR.md bei jeder Nachricht vermieden wird.