エージェントフレームワークは、静的ファイルを再送信するたびにセッションごとに35万以上のトークンを浪費しています。

トークン浪費ベンチマーク結果
ローカルQwen 3.5 122Bセットアップでの測定により、エージェントフレームワークが静的ファイルを繰り返し再送信することで、セッションごとに35万トークン以上を浪費していることが明らかになりました。ソースではこれらの数値を「非現実的」と表現しています。
最適化アプローチ
クエリコンテキストを1,373トークンからわずか73トークンに削減するコンパイル時アプローチが発見されました。これは、この特定のコンテキストにおけるトークン使用量の95%削減を意味します。
ベンチマークではまた、単純なJSON変換が問題を30%悪化させ、ベースライン測定値を超えるトークン浪費を引き起こすことも判明しました。
技術的コンテキスト
エージェントフレームワークには通常、システムプロンプト、ツール定義、およびセッション内の複数のインタラクションを通じて静的に維持されるその他の設定データが含まれています。このデータがすべてのクエリで再送信されると、モデルに新しい情報を提供することなくトークンを消費します。これは、トークン処理がパフォーマンスとコストの両方に直接影響するQwen 3.5 122Bのような大規模モデルでは特にコストがかかります。
コンパイル時アプローチでは、静的要素を再送信するのではなく参照できるように前処理を行う可能性が高く、これは現代のWebアプリケーションが静的アセットをキャッシュする方法と似ています。AIコーディングエージェントを扱う開発者にとって、このオーバーヘッドを削減することで応答時間を大幅に改善し、運用コストを削減できます。
📖 Read the full source: r/LocalLLaMA
👀 See Also

SuperContext:AIコーディングエージェントのための永続メモリフレームワーク
SuperContextは、大規模な指示文書の代わりに構造化されたターゲットファイルを通じて、ClaudeなどのAIコーディングツールに永続的なメモリを提供するオープンソースフレームワークです。手動セットアップなしで約10分でシステムを構築する実行可能なプロンプトが含まれています。

ファントム:クロードのエージェントSDKで構築された持続型AIエージェント
Phantomは、ClaudeのAgent SDK(Opus 4.6)を永続的なベクターメモリ、自己進化エンジン、MCPサーバーインターフェースでラップしたオープンソースのBun/TypeScriptプロセスです。独自のVMまたはDocker Compose上で継続的に動作し、Slackを介して通信します。

Krasis LLMランタイム、Llama.cppと比較して8.9倍のプリフィル速度と4.7倍のデコード速度向上を実現
Krasis LLMランタイムは、現在プレフィルとデコードの両方をGPU上で完全に実行し、それぞれに異なる最適化戦略を適用しています。これにより、単一の5090 GPUでQwen3.5-122Bを実行した場合、llama.cppと比較してプレフィル速度が8.9倍、デコード速度が4.7倍高速になりました。

克劳德设计与华数设计:HTML布局与速率限制的直面交锋
Claude DesignはHTMLプロトタイプを高速に作成できますが、すぐにレート制限に達します。オープンソースのClaude CodeスキルであるHuashu-Designは、通常のサブスクリプションで動作し、個別のレート制限はありませんが、5分に対して20分かかります。