生物に着想を得たメモリシステムをローカルLLM向けに実装:長期増強と選択的忘却の実装

ローカルLLMのための生物学的に着想を得た記憶アーキテクチャ
開発者が、ローカルLLMのクリーンなコンテキストを維持するために、人間の記憶メカニズムを模倣したローカルMCPサーバーを作成しました。このシステムは、静的なRAGパイプラインの代わりに、Python/TypeScriptで3つの生物学的に着想を得た層を実装しています。
中核となる記憶メカニズム
- 強化(長期増強): トピックがクエリされるたびに、その
access_countが増加し、頻繁にアクセスされる記憶が強化されます。 - 選択的忘却: 使用されない接続は時間とともに減衰し、システムは弱いアトムを自動的にアーカイブしてコンテキストの汚染を防ぎます。
- 統合: 週次の「睡眠」サイクルでは、軽量なSLMを使用して最近のログを中核となる知識アトムに蒸留します。
技術的な実装の詳細
- ハイブリッド検索: セマンティック検索のための
sqlite-vecと、埋め込みが失敗した場合でもタイムアウトを防ぐテキストフォールバックを組み合わせています。 - ノンブロッキングMCP: 同期データベースと埋め込み操作を
asyncioエグゼキューターでラップし、LM Studioの応答性を維持します。 - アイデンティティ層: セッション間で状態とペルソナを維持するために、永続的な「Soul」ファイル(
soul.md)を使用します。 - アクセスベースの強化:
access_countメカニズムにより、モデルは静的な事実を取得するだけでなく、インタラクションパターンに基づいて進化することが可能になります。
開発の背景と検証
このプロジェクトは、ローカルAIのための標準的なRAG実装におけるコンテキスト制限に対処するために開発されました。開発者は、ローカルLLM(Geminiを実行)にコードベースを分析させることでアーキテクチャを検証し、3つの革新点を明らかにしました:アクセスベースの強化と減衰を使用した真の認知エージェント、フォールバックを備えた堅牢なハイブリッド検索、応答性のためのノンブロッキングアーキテクチャです。
目標は、睡眠中の人間の記憶と同様に、重要なことを記憶し、ノイズを忘れるシステムを作ることです。開発者は、生物学的に着想を得た記憶アーキテクチャが、クラウド依存やブラックボックスなしで、ローカルでコンテキスト制限を解決できるかどうかを探求しています。
📖 Read the full source: r/LocalLLaMA
👀 See Also
Almanac: 自己更新型の企業Wikiを持つAIエージェント
Almanac(YC S26)は、常時稼働するAIエージェントで、企業のツールをWikiにまとめ、プロアクティブなタスク完了と長期的なフォローアップを可能にします。独自のコンピューター上で動作し、GmailやSlackなどに接続し、現在7日間のトライアルで利用可能です。

ローカルMCPメモリシステムとAI会話のための統合
ある開発者が、AIクライアント向けの永続的なローカルメモリを提供するMCPサーバーを構築しました。Qwen 2.5-7Bを使用して、6時間ごとの会話を構造化された知識ドキュメントに統合します。このシステムは完全にユーザーのハードウェア上で動作し、意味的重複排除、適応的スコアリング、FAISSベクトル検索を備えています。
針:完全不需要前馈网络构建的2600万参数工具调用模型
Needleは、MLPを持たない2600万パラメータの関数呼び出しモデルで、コンシューマデバイス上で6000トークン/秒のプリフィルと1200トークン/秒のデコードを実現します。単発のツール呼び出しにおいて、FunctionGemma-270M、Qwen-0.6B、Granite-350M、LFM2.5-350Mを上回ります。

ヘドル:Claude Desktop MCP接続のための信頼性強制と監査ログ記録
Heddleは、Claude DesktopのMCP接続に信頼階層、アクセス制御、監査ログを追加するオープンソースツールで、6つのスターターパックを含む単一インターフェースを通じて複数サービスの安全な管理を可能にします。