agentcache: マルチエージェントLLMプレフィックスキャッシュのためのPythonライブラリ

agentcacheは、接頭辞キャッシュを中核機能として実装することで、マルチエージェントLLMシステムを最適化するために設計されたPythonライブラリです。このライブラリは、CrewAI、AutoGen、open-multi-agentなどのフレームワークが各ワーカーに対して新しいセッションを作成し、キャッシュヒットがゼロでプロンプトコストが重複するという一般的な問題に対処します。
仕組み
このライブラリは、別々のセッションを作成する代わりに、フォークベースのアプローチで動作します:
- 共有システムプロンプトで1つのセッションを開始
- 最初の呼び出しを行う - プロバイダーが接頭辞を計算してキャッシュ
- N個のワーカーが必要な場合、N個の新しいセッションを作成する代わりにフォーク
- 親セッション:[システム、メッセージ1、メッセージ2、...]
- フォークされたセッション:[システム、メッセージ1、メッセージ2、...、ワーカータスク]
- 完全に同じ接頭辞 = キャッシュヒット
主な機能
- キャッシュセーフなフォーク:ワーカーセッション間で同一の接頭辞を維持
- キャッシュブレーク検出:スナップショットを差分比較し、キャッシュヒット率が低下したときに正確に何が変更されたかを報告
- キャッシュセーフな圧縮:長時間実行されるセッションでは、各呼び出し前に古いツール出力をスキャンし、大きな結果を決定論的なプレースホルダーに置き換えて、より小さなコンテキストを維持しながらキャッシュ可能な接頭辞を保存
- パラメータ凍結:フォーク前にキャッシュ関連パラメータを凍結(システムプロンプト、モデル、ツール、メッセージ、推論設定)
- タスクDAGスケジューリング:1つのキャッシュされたセッションから並列ワーカーを可能にする
パフォーマンス結果
GPT-4o-miniでの直接比較テスト(コーディネーター + 3ワーカー、同じタスク):
- テキストインジェクション / 別々のセッション:0%キャッシュヒット、85.7秒
- 接頭辞フォーク:75.8%キャッシュヒット、37.4秒
- ワーカーごとのキャッシュヒット率は通常80-99%の範囲
インストールと使用方法
pipでインストール:
pip install "git+https://github.com/masteragentcoder/agentcache.git@main"
このライブラリはGitHubのgithub.com/masteragentcoder/agentcacheで利用可能です。
📖 Read the full source: r/LocalLLaMA
👀 See Also

スカイネット:クロードコードエージェント向けマルチエージェント協働ネットワーク
Skynetは、複数のClaude Codeエージェントと人間の間で役割ベースのコラボレーションを可能にするオープンソースネットワークです。npxを使用してスキルとしてインストールされ、自然言語コマンドで管理されます。

MoltPoker.xyz:AIエージェント向けプレイマネー・テキサスホールデム
MoltPoker.xyzは、WebSocket接続を使用してAIエージェント同士がノーリミット・テキサスホールデムをプレイできるプラットフォームです。リプレイ可能なハンドや、ライブゲーム中のエージェントの推論が可視化されています。

蒸留されたQwen 3.5 27Bモデルは、Cursor AIコーディングエージェントで高いパフォーマンスを示しています
ユーザーが報告したところによると、Qwen 27Bのopus 4.6蒸留バージョンは、Cursorを駆動するモデルとして効果的に機能し、Gemini 3 Flashに匹敵するパフォーマンスを示しています。設定には、Cursorを使用してngrokトンネルとlocalllamaを構成するのに約10分かかりました。

FFF - Fast File Finderは、ripgrepに比べて100倍の速度優位性を主張しています。
FFF(Fast File Finder)は、Webベースのファイル検索ツールであり、ripgrepよりも100倍高速であると主張し、正規表現ベースの検索手法の次世代の代替手段として位置付けられています。このツールはJavaScriptを必要とし、最近Hacker Newsで36ポイントと17コメントで議論されました。