エージェントフレームワークは、静的ファイルを再送信するたびにセッションごとに35万以上のトークンを浪費しています。

トークン浪費ベンチマーク結果
ローカルQwen 3.5 122Bセットアップでの測定により、エージェントフレームワークが静的ファイルを繰り返し再送信することで、セッションごとに35万トークン以上を浪費していることが明らかになりました。ソースではこれらの数値を「非現実的」と表現しています。
最適化アプローチ
クエリコンテキストを1,373トークンからわずか73トークンに削減するコンパイル時アプローチが発見されました。これは、この特定のコンテキストにおけるトークン使用量の95%削減を意味します。
ベンチマークではまた、単純なJSON変換が問題を30%悪化させ、ベースライン測定値を超えるトークン浪費を引き起こすことも判明しました。
技術的コンテキスト
エージェントフレームワークには通常、システムプロンプト、ツール定義、およびセッション内の複数のインタラクションを通じて静的に維持されるその他の設定データが含まれています。このデータがすべてのクエリで再送信されると、モデルに新しい情報を提供することなくトークンを消費します。これは、トークン処理がパフォーマンスとコストの両方に直接影響するQwen 3.5 122Bのような大規模モデルでは特にコストがかかります。
コンパイル時アプローチでは、静的要素を再送信するのではなく参照できるように前処理を行う可能性が高く、これは現代のWebアプリケーションが静的アセットをキャッシュする方法と似ています。AIコーディングエージェントを扱う開発者にとって、このオーバーヘッドを削減することで応答時間を大幅に改善し、運用コストを削減できます。
📖 Read the full source: r/LocalLLaMA
👀 See Also

オープンソースのLLMエージェント用メモリシステムが高いベンチマークスコアを達成
Claude CodeとOpenClaw向けの永続メモリシステムは、LLMエージェントにセッション間での実際のコンテキスト連続性を提供し、LoCoMoベンチマークで90.8%、LongMemEvalで89.1%のスコアを達成しました。アダプタベースのアーキテクチャは、あらゆるエージェントフレームワークで動作します。

llama.cpp上Qwen 3.6 27B通过MTP投机解码实现2.5倍速度提升
Redditユーザーがカスタムllama.cpp PRを使用したMTP投機的復号により、Qwen 3.6 27Bで2.5倍高速な推論を報告。Mac M2 Max 96GBで28 tok/sを達成。プリコンバート済みGGUF量子化モデルと修正済みチャットテンプレートを含む。

OpenHelm:Claudeコードタスクを自動化するmacOSアプリ
OpenHelmは、スケジュールに基づいてジョブを実行し、失敗を自動的に再試行し、作業をチャンクに分割してセッション制限を回避することで、反復的なClaudeコーディングタスクを自動化する無料のローカルmacOSアプリケーションです。LLM呼び出しには既存のClaudeサブスクリプションを使用します。

Ante: オフラインで動作するシングルバイナリコーディングエージェント
Ante は自己完結型のRustバイナリで、Claude CodeやCodexのように動作しますが、ランタイム依存関係がゼロで、完全なオフラインサポートを備えています。DeepSeek V4 Flashを使用してTerminal-Bench 2.1で82.7%を達成しています。