クロード用永続メモリ:MCPによるローカルスタック、39msの検索、82%のトークン削減

RedditユーザーがClaude用のローカル永続メモリレイヤーを構築し、セッション間のゼロコンテキスト問題を解決しました。スタックは完全にローカルで動作し(クラウド不要、APIキー不要)、MCPを介して統合されます。主要なアーキテクチャ:4つのレイヤー(L0: SQLiteの追記専用イベントログ、L1: 遅延された構造化事実、L2/L3: Wiki形式の散文、L4: 要約+決定事項+未解決スレッドを含む結晶化セッションノード)、ベクター検索用のQdrant Docker、GPU上のQwen3-Embedding-4BとCPU上のQwen3.5-2B-Q4_K_Mによる埋め込みとチャット用のllama.cpp、および7つのツール(retrieve、crystallize_session、list_sessions、get_l4_node、index_status、reindex、shutdown_models)を公開するFastMCPサーバー。
数値
- grep+Readベースラインと比較したトークン削減率:平均82.7%、中央値86.2%。
- 検索F1:0.50 vs ベースライン0.20。
- 埋め込みコールドスタート約4秒、ホットパスp95 39ms(バグ修正前は2241ms)。
- L4セッション検索評価:平均スコア0.920(閾値0.6)。
- 104個のマークダウンファイルから738チャンクをインデックス登録。
主な学び:Windowsでの接続再利用
4070 Ti Super上のGPU常駐埋め込みでも、ホットパス検索がp95で2241msに停滞していました。原因は、httpx.post()呼び出しのたびに新しいTCP接続が開かれ、Windowsのlocalhostハンドシェイクに約2秒かかることでした。持続的なhttpx.Client(キープアライブ)に切り替えることで、p95が39msに低下——57倍の高速化。
その他の驚き
- Qwen3思考モード: llama-serverで
--jinjaを使用する際に、chat_template_kwargs: {enable_thinking: false}でenable_thinkingを無効にしないと、モデルが全トークンバジェットを思考ブロックに使い、空のコンテンツを出力します。 - MCP登録: Claude Desktopのエージェントモード(Cowork)は、
~/.claude.jsonではなくプラグイン設定ファイルを読み取ります。LKSサービスは、適切なCowork .pluginバンドルとしてパッケージ化する必要があります。
対象ユーザー
Claudeを多用し、クラウド依存なしにコスト効率が高くプライベートなローカルメモリレイヤーでセッション間のコンテキストを維持したい開発者。
📖 全文を読む: r/ClaudeAI
👀 See Also

Strale.ioは、サインアップなしでAIエージェント向けに無料のIBANおよびメール検証APIを提供しています。
Strale.ioは、IBAN検証、メール検証、DNSルックアップ、URLからマークダウンへの変換、JSON修復を含む5つの機能を備えた無料APIを提供しています。サインアップやAPIキーは不要で、ClaudeやCursorとの統合のためのMCPサーバーも含まれています。

Claude TimeTrack: macOSメニューバーアプリで、Claude CodeのJSONLファイルを読み取り、プロジェクトごとの開発時間を自動追跡
オープンソースのmacOSメニューバーアプリ。Claude CodeのセッションJSONLファイルとgit履歴を解析し、プロジェクトごとの作業時間を自動追跡。手動タイマーは不要。

Utilyze: カーネルアクティビティだけでなく実際の計算スループットを測定するオープンソースGPUモニタ
Utilyzeはハードウェアパフォーマンスカウンターをサンプリングして、理論限界に対する計算およびメモリスループットを報告します。これにより、100%利用率を示すダッシュボードが実際には1〜10%のスループットしかないことを明らかにします。

Forge: ClaudeベースのIDE、自動検証とプロジェクトDNAを搭載
Forgeは、コードを表示する前に自動的に型チェック、テスト、カバレッジチェック、インポート検証を実行する、VS Code上に構築されたClaudeベースのIDEです。検証が失敗した場合の自己修復ループを含み、コードベースのパターンからプロジェクトDNAを構築します。