エングラムメモリSDK:ローカルモデル搭載AIエージェント向けグラフベースメモリ

ローカルAIモデル向けグラフメモリSDK
Engram Memory SDKは、LiteLLM統合を介してローカルモデルと連携するAIエージェント向けに設計されたオープンソースのグラフメモリシステムです。コアアーキテクチャは取り込みと呼び出しを分離しており、エンティティと関係性を抽出するためのLLMは取り込み時に1回のみ必要です。一方、想起は純粋なベクトル検索、グラフトラバーサル、スコアリングによって動作し、追加のLLM呼び出しを必要としません。
技術詳細
このSDKは非同期Pythonで構築され、バックエンドデータベースとしてNeo4jを使用しています。ソースによると、取り込み操作あたり平均〜735トークンを処理し、95msの想起レイテンシを達成しています。システムには、バックグラウンドで実行される減衰とクラスタリングを備えた自己再構築メモリ機能が含まれています。
セットアップとインストール
インストールは簡単です:
pip install engram-memory-sdk設定には、以下の変数を含む.envファイルが必要です:
LLM_MODEL=ollama/llama3 # またはLiteLLMがサポートする任意のローカルモデル
NEO4J_URI=bolt://localhost:7687このシステムは、Ollama、vLLM、text-generation-webuiを介したローカルデプロイメントを含む、LiteLLMを介したあらゆるモデルをサポートしています。主な利点はコスト効率です:小さなローカルモデルで抽出を処理するため、継続的な想起操作はLLMトークンを消費しないため、文字通り$0のコストで実行できます。
📖 Read the full source: r/LocalLLaMA
👀 See Also

Argus: Claude Code セッションのコストと動作をデバッグするVS Code拡張機能
Claude Codeセッションのコストが、リトライループ、ファイルの重複読み取り、コンパクション前のコンテキスト詰め込みなど、明確な理由なく急上昇することがあります。~/.claude/projects/のJSONLファイルにはすべてのデータが含まれていますが、生のままでは確認が困難です。ある開発者がArgusというVS Code拡張機能を構築しました。これは、これらのトランスクリプトを解析し、セッションを詳細なメトリクス付きのタイムラインとして表示します。

antirezのDS4:Mac MetalとDGXでDeepSeek V4 Flashを100万コンテクストで実行
Redisの作者Salvatore Sanfilippoが、Mac MetalハードウェアとDGX上で1MコンテキストウィンドウのDeepSeek V4 Flashを実行するプロジェクトDS4を公開しました。エージェンティックコーディングツール向けのOpenAI/Anthropicエンドポイントも備えています。

DeepSeek V4 FlashがオンプレミスのローカルLLMにOpusに迫る品質を提供
Redditユーザーが、DeepSeek 4 Flashが機密データを扱うローカルAIエージェントでOpusに迫るパフォーマンスを達成し、AWSなしでのオンプレミス展開を可能にしたと報告。NVIDIA GPUでローカル実行中だが、100万トークンでまだ遅い。

AIコーディングエージェントが20ターン後に粗悪なコードを出力する理由:コンテキスト盲目
APIログの詳細な監査により、CursorとClaude Codeは賢くなっているわけではなく、ノイズで膨れ上がったコンテキストウィンドウに窒息し、アーキテクチャを破壊していることが明らかになった。