クロード用永続メモリ:MCPによるローカルスタック、39msの検索、82%のトークン削減

✍️ OpenClawRadar📅 公開日: May 8, 2026🔗 Source
クロード用永続メモリ:MCPによるローカルスタック、39msの検索、82%のトークン削減
Ad

RedditユーザーがClaude用のローカル永続メモリレイヤーを構築し、セッション間のゼロコンテキスト問題を解決しました。スタックは完全にローカルで動作し(クラウド不要、APIキー不要)、MCPを介して統合されます。主要なアーキテクチャ:4つのレイヤー(L0: SQLiteの追記専用イベントログ、L1: 遅延された構造化事実、L2/L3: Wiki形式の散文、L4: 要約+決定事項+未解決スレッドを含む結晶化セッションノード)、ベクター検索用のQdrant Docker、GPU上のQwen3-Embedding-4BとCPU上のQwen3.5-2B-Q4_K_Mによる埋め込みとチャット用のllama.cpp、および7つのツール(retrieve、crystallize_session、list_sessions、get_l4_node、index_status、reindex、shutdown_models)を公開するFastMCPサーバー。

数値

  • grep+Readベースラインと比較したトークン削減率:平均82.7%、中央値86.2%。
  • 検索F1:0.50 vs ベースライン0.20。
  • 埋め込みコールドスタート約4秒、ホットパスp95 39ms(バグ修正前は2241ms)。
  • L4セッション検索評価:平均スコア0.920(閾値0.6)。
  • 104個のマークダウンファイルから738チャンクをインデックス登録。
Ad

主な学び:Windowsでの接続再利用

4070 Ti Super上のGPU常駐埋め込みでも、ホットパス検索がp95で2241msに停滞していました。原因は、httpx.post()呼び出しのたびに新しいTCP接続が開かれ、Windowsのlocalhostハンドシェイクに約2秒かかることでした。持続的なhttpx.Client(キープアライブ)に切り替えることで、p95が39msに低下——57倍の高速化。

その他の驚き

  • Qwen3思考モード: llama-serverで--jinjaを使用する際に、chat_template_kwargs: {enable_thinking: false}でenable_thinkingを無効にしないと、モデルが全トークンバジェットを思考ブロックに使い、空のコンテンツを出力します。
  • MCP登録: Claude Desktopのエージェントモード(Cowork)は、~/.claude.jsonではなくプラグイン設定ファイルを読み取ります。LKSサービスは、適切なCowork .pluginバンドルとしてパッケージ化する必要があります。

対象ユーザー

Claudeを多用し、クラウド依存なしにコスト効率が高くプライベートなローカルメモリレイヤーでセッション間のコンテキストを維持したい開発者。

📖 全文を読む: r/ClaudeAI

Ad

👀 See Also

Strale.ioは、サインアップなしでAIエージェント向けに無料のIBANおよびメール検証APIを提供しています。
Tools

Strale.ioは、サインアップなしでAIエージェント向けに無料のIBANおよびメール検証APIを提供しています。

Strale.ioは、IBAN検証、メール検証、DNSルックアップ、URLからマークダウンへの変換、JSON修復を含む5つの機能を備えた無料APIを提供しています。サインアップやAPIキーは不要で、ClaudeやCursorとの統合のためのMCPサーバーも含まれています。

OpenClawRadar
Claude TimeTrack: macOSメニューバーアプリで、Claude CodeのJSONLファイルを読み取り、プロジェクトごとの開発時間を自動追跡
Tools

Claude TimeTrack: macOSメニューバーアプリで、Claude CodeのJSONLファイルを読み取り、プロジェクトごとの開発時間を自動追跡

オープンソースのmacOSメニューバーアプリ。Claude CodeのセッションJSONLファイルとgit履歴を解析し、プロジェクトごとの作業時間を自動追跡。手動タイマーは不要。

OpenClawRadar
Utilyze: カーネルアクティビティだけでなく実際の計算スループットを測定するオープンソースGPUモニタ
Tools

Utilyze: カーネルアクティビティだけでなく実際の計算スループットを測定するオープンソースGPUモニタ

Utilyzeはハードウェアパフォーマンスカウンターをサンプリングして、理論限界に対する計算およびメモリスループットを報告します。これにより、100%利用率を示すダッシュボードが実際には1〜10%のスループットしかないことを明らかにします。

OpenClawRadar
Forge: ClaudeベースのIDE、自動検証とプロジェクトDNAを搭載
Tools

Forge: ClaudeベースのIDE、自動検証とプロジェクトDNAを搭載

Forgeは、コードを表示する前に自動的に型チェック、テスト、カバレッジチェック、インポート検証を実行する、VS Code上に構築されたClaudeベースのIDEです。検証が失敗した場合の自己修復ループを含み、コードベースのパターンからプロジェクトDNAを構築します。

OpenClawRadar