AVPプロトコルは、トークン効率を高めるために、テキストの代わりにKVキャッシュを共有することでLLMエージェントを可能にします。

✍️ OpenClawRadar📅 公開日: February 28, 2026🔗 Source
AVPプロトコルは、トークン効率を高めるために、テキストの代わりにKVキャッシュを共有することでLLMエージェントを可能にします。
Ad

AVPの機能

AVP(エージェントベクトルプロトコル)は、マルチエージェント構成におけるLLMエージェントが、テキストではなくKVキャッシュを直接エージェント間で受け渡すことを可能にするプロトコルです。これにより、各エージェントが会話履歴全体を再処理する際に発生する冗長なトークン化とフォワードパスが排除されます。

仕組み

各エージェントがすべてを再トークン化する従来のテキストベースのアプローチの代わりに、AVPではエージェントAが推論後のキー・バリュー注意状態をシリアライズし、エージェントBがそれを直接注入します。つまり:

  • 両側で同じモデル:オーバーヘッドゼロで直接KVキャッシュ転送
  • 同じファミリー、異なるサイズ(例:Qwen2.5-7Bが1.5Bと通信):学習済みパラメータやキャリブレーションデータ不要の語彙仲介投影
  • 異なるファミリー:JSONにフォールバック
  • トランスポート非依存:A2A、MCP、gRPC、または既に使用しているものと併用可能
  • バイナリワイヤ形式:JSON+Base64(テンサーデータで33%のオーバーヘッドあり)ではない

パフォーマンス結果

Qwen2.5、Llama 3.2、DeepSeek-R1-Distillモデルでのテスト結果:

  • トークン節約率73-78%
  • 2-4倍の高速化
  • これらの結果は3つのモデルファミリーすべてで一貫
  • チェーン長が増すと差が拡大:4エージェントで約2倍、16エージェント(予測)で約6倍

効率性は、テキストプロンプトサイズが各ホップで急増する(4エージェントGSM8Kチェーンで186 → 545 → 1,073 → 1,397トークン)一方、潜在状態は事前コンテキストが事前計算済みKVキャッシュとして到着するため、ホップごとに約164-207トークンで平坦に保たれることに起因します。

制限事項

  • サンプルサイズはモデルごとにn=20(トークン/速度の主張には十分だが、精度の主張には不十分)
  • 小規模モデルのみテスト済み(RTX 3070 Tiで1.5B-3B)、7B+の結果は保留中
  • 最低1Gbps以上の帯域幅が必要(3BモデルのKVキャッシュはサンプルごとに約130MB)
  • セルフホストのみ(KVキャッシュアクセスが必要、OpenAI/AnthropicなどのAPIでは動作しない)
  • 現時点では同じモデルのみ(クロスモデル実装は存在するがベンチマーク未実施)
  • 潜在状態はテキストより17-54倍多くのVRAMを使用(ホップ間でKVキャッシュを保持するため)
Ad

始め方

インストール:pip install avp

2つのAPIレベルが利用可能:

import avp
msg = avp.pack("Hello", model="Qwen/Qwen2.5-7B-Instruct", think_steps=20)
answer = avp.unpack(msg, model="Qwen/Qwen2.5-7B-Instruct")

またはより詳細な制御:

from avp import HuggingFaceConnector
connector = HuggingFaceConnector.from_pretrained("Qwen/Qwen2.5-1.5B-Instruct")
context = connector.think("この問題を分析してください", steps=20)
answer = connector.generate("解決してください。", context=context)

vLLMコネクタも利用可能:pip install "avp[vllm]"

プロジェクトリンク

  • SDK: github.com/VectorArc/avp-python (MIT, 377 tests, 7 benchmarks)
  • 仕様: github.com/VectorArc/avp-spec
  • ベンチマーク詳細: BENCHMARKS.md

📖 完全なソースを読む: r/LocalLLaMA

Ad

👀 See Also

🦀
Tools

ReefのOpenClaw-RLレシピ、スコア付き重み更新をリリースゲートの背後に配置

ReefのOpenClaw-RL重み進化レシピは、72のGSM8K問題を72のタスクとして扱い、Qwen3-4Bをポリシーとプロセス報酬モデルの役割に、Qwen3-32Bを生徒役に使い、7つのGPUで実行します。セッション14で3回連続合格の基準を達成しました。

OpenClawRadar
BracketMadness.ai:AIエージェントのためのマーチマッドネスブラケットチャレンジ
Tools

BracketMadness.ai:AIエージェントのためのマーチマッドネスブラケットチャレンジ

BracketMadness.aiは、AIエージェント専用に設計されたマーチマッドネス(全米大学バスケットボールトーナメント)の予想対戦表チャレンジです。エージェントはAPIドキュメントを自律的に読み込み、自身で登録を行い、全63試合の勝者を選択して予想表を提出します。このサイトはエージェントにはプレーンテキストのAPI指示を提供し、人間ユーザーには通常の視覚的インターフェースを表示します。

OpenClawRadar
onWatch: SQLiteストレージを備えたオープンソースのローカルAPIクォータトラッカー
Tools

onWatch: SQLiteストレージを備えたオープンソースのローカルAPIクォータトラッカー

onWatchは、ローカルファーストのAPI使用量トラッカーで、すべてのデータをローカルのSQLiteデータベースに保存し、クラウドサービス、テレメトリー、アカウント作成を必要としません。約13MBの単一バイナリで、バックグラウンドデーモンとして動作し、50MB未満のRAMを使用し、localhost上でダッシュボードを提供します。

OpenClawRadar
OpenGalatea MCPサーバーは、ClaudeをPrusa 3Dプリンターに接続します
Tools

OpenGalatea MCPサーバーは、ClaudeをPrusa 3Dプリンターに接続します

OpenGalateaは、ClaudeがPrusaLinkを介してPrusa 3Dプリンターを制御できるようにするオープンソースのMCPサーバーです。自然言語コマンドでPrintables.comの検索、モデルのスライス、印刷管理が可能です。

OpenClawRadar