AVP-Protokoll ermöglicht LLM-Agenten den Austausch von KV-Cache anstelle von Text für Token-Effizienz

✍️ OpenClawRadar📅 Veröffentlicht: 28. Februar 2026🔗 Source
AVP-Protokoll ermöglicht LLM-Agenten den Austausch von KV-Cache anstelle von Text für Token-Effizienz
Ad

Was AVP bewirkt

AVP (Agent Vector Protocol) ist ein Protokoll, das LLM-Agenten in Multi-Agenten-Setups ermöglicht, KV-Cache direkt zwischen Agenten weiterzugeben anstatt Text. Dadurch werden redundante Tokenisierung und Vorwärtsdurchläufe vermieden, die auftreten, wenn jeder Agent den gesamten Konversationsverlauf erneut verarbeitet.

Wie es funktioniert

Anstatt des traditionellen textbasierten Ansatzes, bei dem jeder Agent alles erneut tokenisiert, ermöglicht AVP Agent A, seine Key-Value-Aufmerksamkeitszustände nach dem Denkvorgang zu serialisieren, und Agent B injiziert sie direkt. Das bedeutet:

  • Gleiches Modell auf beiden Seiten: Direkter KV-Cache-Transfer ohne Overhead
  • Gleiche Familie, unterschiedliche Größe (z.B. Qwen2.5-7B spricht mit 1.5B): Vokabularvermittelte Projektion ohne gelernte Parameter oder Kalibrierungsdaten erforderlich
  • Unterschiedliche Familien: Fällt auf JSON zurück
  • Transportunabhängig: Funktioniert neben A2A, MCP, gRPC oder was auch immer Sie bereits verwenden
  • Binäres Übertragungsformat: Nicht JSON+Base64 (was 33% Overhead auf Tensordaten hat)

Leistungsergebnisse

Tests über Qwen2.5-, Llama 3.2- und DeepSeek-R1-Distill-Modelle zeigten:

  • Token-Einsparungen von 73-78%
  • 2-4-fache Geschwindigkeitssteigerungen
  • Diese Ergebnisse blieben über alle drei Modellfamilien hinweg konsistent
  • Die Lücke vergrößert sich mit der Kettenlänge: bei 4 Agenten etwa 2-fach, bei 16 Agenten (projiziert) wäre es etwa 6-fach

Die Effizienz kommt daher, dass Textprompt-Größen bei jedem Hop anschwellen (186 → 545 → 1.073 → 1.397 Token in einer 4-Agenten-GSM8K-Kette), während latente Zustände bei etwa 164-207 Token pro Hop flach bleiben, weil vorheriger Kontext als vorberechneter KV-Cache ankommt.

Ad

Einschränkungen

  • Stichprobengrößen sind n=20 pro Modell (ausreichend für Token-/Geschwindigkeitsaussagen, aber nicht für Genauigkeitsaussagen)
  • Nur an kleinen Modellen getestet (1.5B-3B auf einer RTX 3070 Ti) mit ausstehenden Ergebnissen für 7B+
  • Benötigt mindestens 1 Gbps+ Bandbreite (KV-Cache für ein 3B-Modell beträgt etwa 130 MB pro Stichprobe)
  • Nur selbst gehostet (erfordert KV-Cache-Zugriff, funktioniert nicht mit OpenAI/Anthropic/etc. APIs)
  • Derzeit nur gleiches Modell (Cross-Model-Implementierung existiert, aber nicht benchmarked)
  • Latente Zustände verwenden 17-54x mehr VRAM als Text, weil KV-Cache über Hops hinweg gehalten wird

Erste Schritte

Installieren mit: pip install avp

Zwei API-Ebenen verfügbar:

import avp
msg = avp.pack("Hello", model="Qwen/Qwen2.5-7B-Instruct", think_steps=20)
answer = avp.unpack(msg, model="Qwen/Qwen2.5-7B-Instruct")

Oder mit mehr Kontrolle:

from avp import HuggingFaceConnector
connector = HuggingFaceConnector.from_pretrained("Qwen/Qwen2.5-1.5B-Instruct")
context = connector.think("Analysiere dieses Problem", steps=20)
answer = connector.generate("Löse es.", context=context)

vLLM-Connector ebenfalls verfügbar: pip install "avp[vllm]"

Projektlinks

  • SDK: github.com/VectorArc/avp-python (MIT, 377 Tests, 7 Benchmarks)
  • Spezifikation: github.com/VectorArc/avp-spec
  • Benchmark-Details: BENCHMARKS.md

📖 Read the full source: r/LocalLLaMA

Ad

👀 Siehe auch

HTML-Artefakte ersetzen Google Docs für technische Dokumentation, aber es fehlt die Kommentarfunktion
Werkzeuge

HTML-Artefakte ersetzen Google Docs für technische Dokumentation, aber es fehlt die Kommentarfunktion

Claude-generierte HTML-Artefakte ersetzen Google Docs für lange, technische Inhalte wie Spike-Auswertungen und Architekturnoten, aber die Sandbox-iframe-Natur verhindert Inline-Kommentare und Überprüfungsfunktionen.

OpenClawRadar
Destillerie: Ein Claude-Code-Plugin für beständigen Team-Kontext
Werkzeuge

Destillerie: Ein Claude-Code-Plugin für beständigen Team-Kontext

Distillery ist ein Plugin für Claude Code, das Teams gemeinsamen, persistenten Kontext über Sitzungen und Personen hinweg bietet. Version 0.2.0 fügt Hybridsuche, Authentifizierungs-Überwachungsprotokollierung und UV-Unterstützung hinzu.

OpenClawRadar
AutoDream: 11-Hook-Speichersystem für Claude Code mit Sicherheitsfunktionen
Werkzeuge

AutoDream: 11-Hook-Speichersystem für Claude Code mit Sicherheitsfunktionen

AutoDream ist ein Open-Source-Tool, das Projektspeicherpersistenz und Befehlsicherheit zu Claude Code hinzufügt. Es verwendet 11 Hooks über 6 Ereignisse hinweg, um Kontext einzuspritzen, gefährliche Befehle zu blockieren und den /compact-Vorgang zu überstehen.

OpenClawRadar
Der SMELT-Compiler reduziert die OpenClaw-Arbeitsbereich-Tokennutzung um bis zu 95 %.
Werkzeuge

Der SMELT-Compiler reduziert die OpenClaw-Arbeitsbereich-Tokennutzung um bis zu 95 %.

SMELT kompiliert OpenClaw-Arbeitsbereich-Markdown-Dateien in eine kompaktere Laufzeitform und sendet nur relevante Inhalte an KI-Modelle. Benchmarks zeigen Token-Reduktionen von 76,1 % bis 95,5 % bei Abfragen, wodurch die Neuverarbeitung statischer Dateien wie USER.md und SOUR.md bei jeder Nachricht vermieden wird.

OpenClawRadar