AVPプロトコルは、トークン効率を高めるために、テキストの代わりにKVキャッシュを共有することでLLMエージェントを可能にします。

AVPの機能
AVP(エージェントベクトルプロトコル)は、マルチエージェント構成におけるLLMエージェントが、テキストではなくKVキャッシュを直接エージェント間で受け渡すことを可能にするプロトコルです。これにより、各エージェントが会話履歴全体を再処理する際に発生する冗長なトークン化とフォワードパスが排除されます。
仕組み
各エージェントがすべてを再トークン化する従来のテキストベースのアプローチの代わりに、AVPではエージェントAが推論後のキー・バリュー注意状態をシリアライズし、エージェントBがそれを直接注入します。つまり:
- 両側で同じモデル:オーバーヘッドゼロで直接KVキャッシュ転送
- 同じファミリー、異なるサイズ(例:Qwen2.5-7Bが1.5Bと通信):学習済みパラメータやキャリブレーションデータ不要の語彙仲介投影
- 異なるファミリー:JSONにフォールバック
- トランスポート非依存:A2A、MCP、gRPC、または既に使用しているものと併用可能
- バイナリワイヤ形式:JSON+Base64(テンサーデータで33%のオーバーヘッドあり)ではない
パフォーマンス結果
Qwen2.5、Llama 3.2、DeepSeek-R1-Distillモデルでのテスト結果:
- トークン節約率73-78%
- 2-4倍の高速化
- これらの結果は3つのモデルファミリーすべてで一貫
- チェーン長が増すと差が拡大:4エージェントで約2倍、16エージェント(予測)で約6倍
効率性は、テキストプロンプトサイズが各ホップで急増する(4エージェントGSM8Kチェーンで186 → 545 → 1,073 → 1,397トークン)一方、潜在状態は事前コンテキストが事前計算済みKVキャッシュとして到着するため、ホップごとに約164-207トークンで平坦に保たれることに起因します。
制限事項
- サンプルサイズはモデルごとにn=20(トークン/速度の主張には十分だが、精度の主張には不十分)
- 小規模モデルのみテスト済み(RTX 3070 Tiで1.5B-3B)、7B+の結果は保留中
- 最低1Gbps以上の帯域幅が必要(3BモデルのKVキャッシュはサンプルごとに約130MB)
- セルフホストのみ(KVキャッシュアクセスが必要、OpenAI/AnthropicなどのAPIでは動作しない)
- 現時点では同じモデルのみ(クロスモデル実装は存在するがベンチマーク未実施)
- 潜在状態はテキストより17-54倍多くのVRAMを使用(ホップ間でKVキャッシュを保持するため)
始め方
インストール:pip install avp
2つのAPIレベルが利用可能:
import avp
msg = avp.pack("Hello", model="Qwen/Qwen2.5-7B-Instruct", think_steps=20)
answer = avp.unpack(msg, model="Qwen/Qwen2.5-7B-Instruct")またはより詳細な制御:
from avp import HuggingFaceConnector
connector = HuggingFaceConnector.from_pretrained("Qwen/Qwen2.5-1.5B-Instruct")
context = connector.think("この問題を分析してください", steps=20)
answer = connector.generate("解決してください。", context=context)vLLMコネクタも利用可能:pip install "avp[vllm]"
プロジェクトリンク
- SDK: github.com/VectorArc/avp-python (MIT, 377 tests, 7 benchmarks)
- 仕様: github.com/VectorArc/avp-spec
- ベンチマーク詳細: BENCHMARKS.md
📖 完全なソースを読む: r/LocalLLaMA
👀 See Also
ReefのOpenClaw-RLレシピ、スコア付き重み更新をリリースゲートの背後に配置
ReefのOpenClaw-RL重み進化レシピは、72のGSM8K問題を72のタスクとして扱い、Qwen3-4Bをポリシーとプロセス報酬モデルの役割に、Qwen3-32Bを生徒役に使い、7つのGPUで実行します。セッション14で3回連続合格の基準を達成しました。

BracketMadness.ai:AIエージェントのためのマーチマッドネスブラケットチャレンジ
BracketMadness.aiは、AIエージェント専用に設計されたマーチマッドネス(全米大学バスケットボールトーナメント)の予想対戦表チャレンジです。エージェントはAPIドキュメントを自律的に読み込み、自身で登録を行い、全63試合の勝者を選択して予想表を提出します。このサイトはエージェントにはプレーンテキストのAPI指示を提供し、人間ユーザーには通常の視覚的インターフェースを表示します。

onWatch: SQLiteストレージを備えたオープンソースのローカルAPIクォータトラッカー
onWatchは、ローカルファーストのAPI使用量トラッカーで、すべてのデータをローカルのSQLiteデータベースに保存し、クラウドサービス、テレメトリー、アカウント作成を必要としません。約13MBの単一バイナリで、バックグラウンドデーモンとして動作し、50MB未満のRAMを使用し、localhost上でダッシュボードを提供します。

OpenGalatea MCPサーバーは、ClaudeをPrusa 3Dプリンターに接続します
OpenGalateaは、ClaudeがPrusaLinkを介してPrusa 3Dプリンターを制御できるようにするオープンソースのMCPサーバーです。自然言語コマンドでPrintables.comの検索、モデルのスライス、印刷管理が可能です。