Apple Siliconにおける長い会話のためのKVキャッシュ再利用により、200倍の高速化を実現

✍️ OpenClawRadar📅 公開日: March 15, 2026🔗 Source
Apple Siliconにおける長い会話のためのKVキャッシュ再利用により、200倍の高速化を実現
Ad

概要

ある開発者が、Apple Silicon上でMLXフレームワークを使用したローカルLLM推論のためのセッションベースKV(キー・バリュー)キャッシュ再利用の実験結果を共有しました。目標は、各ターンでコンテキスト全体を再処理する必要をなくすことで、長い会話(10万トークン以上)を実用的にすることでした。

主な発見とベンチマーク

基本的なアプローチは、会話のターン間でKVキャッシュをメモリに保持し、新しいトークンのみを処理することでした。このシンプルなアイデアが劇的な性能向上をもたらしました:

  • 10万コンテキストでの200倍のTTFT改善: キャッシュなし:126秒。キャッシュあり:0.5秒。これは処理されるトークン数の99.9%削減を意味します。
  • 実世界のセッション数値: M3 Ultra 512GB Mac StudioでのQwen3.5-397Bモデルを使用した266メッセージのOpenClawエージェントセッションでのテスト結果:
    • キャッシュヒット率:93.8%
    • キャッシュヒット時のTTFT(<500新規トークン):1.0-1.3秒
    • 完全なキャッシュミス時のTTFT(124Kトークン):528秒(8.8分)
Ad

うまくいかなかったこと

開発者は、失敗したか性能を低下させたいくつかの最適化の試みをテストしました:

  • 思考トークンのトリミング: モデルの内部推論トークンをキャッシュから削除してスペースを節約しようと試みましたが、病的な動作を引き起こしました。応答は31%長くなり、品質が低下しました。これはモデルがターン間で過去の推論を参照するためです。
  • KVキャッシュのローテーション(8192トークン): これは最高のトークン毎秒(TPS)レートを提供しましたが、モデルが以前のコンテキストを失う原因となり、想起能力が大幅に低下しました(8項目中4項目)。
  • KV 8ビット量子化: これによりTPSが16.5%低下しました。計算オーバーヘッドがメモリ帯域幅の節約を上回ったためです。

実装とハードウェア

この実装は、MITライセンスの下でGitHubで公開されているオープンソースの個人プロジェクト「SoloHeaven」の一部です: https://github.com/joongom/mlx-soloheaven。READMEには完全なベンチマークテーブルが含まれています。

テストは、512GB RAMと4TBストレージを搭載したMac Studio M3 Ultraで実施され、MLX用に変換された以下のモデルが使用されました:

  • Qwen3.5-122B-A10B-bf16
  • Qwen3.5-397B-A17B-MLX-8bit

📖 Read the full source: r/LocalLLaMA

Ad

👀 See Also

SWE-CI:新たなベンチマークがCIを通じた長期コードメンテナンスにおけるAIエージェントをテスト
Tools

SWE-CI:新たなベンチマークがCIを通じた長期コードメンテナンスにおけるAIエージェントをテスト

SWE-CIは、LLM駆動エージェントが継続的インテグレーションサイクルを通じてコードベースを維持する能力を評価するリポジトリレベルのベンチマークです。静的バグ修正から長期にわたる保守性へと焦点を移し、100の実世界タスクにわたって評価します。

OpenClawRadar
Claude Code vs OpenCode:開発者が発見した主要な技術的相違点
Tools

Claude Code vs OpenCode:開発者が発見した主要な技術的相違点

ある開発者がClaude CodeとOpenCodeをコンテキスト、メモリ、ツール使用、サブエージェント、権限、安全性、モデルの柔軟性について比較し、本番リポジトリではClaude Codeが依然として優れていると結論づけています。

OpenClawRadar
cstat: Claude Code用のネイティブRustステータスライン、2msのパフォーマンスを実現
Tools

cstat: Claude Code用のネイティブRustステータスライン、2msのパフォーマンスを実現

cstatはネイティブのRustバイナリで、24回のサブプロセス起動を排除することで、claude-hudの62msステータスラインを2ms実装に置き換えます。モデル情報、レート制限、gitステータス、コンテキストウィンドウ使用量、アクティブツール、サブエージェント、タスク進捗を表示します。

OpenClawRadar
AIエージェントにおけるリアルタイム検索データのための4つのClawHubスキル
Tools

AIエージェントにおけるリアルタイム検索データのための4つのClawHubスキル

ClawHubの4つのスキルは、AIエージェントに構造化された検索機能を提供します:Google(ウェブ、ニュース、画像、マップ)、Amazon(12のマーケットプレイスにわたる商品検索)、Walmart(配送フィルター付き商品検索)、YouTube(トランスクリプト付き動画検索)。1つのAPIキーでclawhub installコマンドからインストールできます。

OpenClawRadar