Локальная система памяти MCP с консолидацией для AI-диалогов

Что это такое
Разработчик создал локальную систему памяти для AI-диалогов, которая консолидирует и синтезирует информацию, а не просто хранит её. Построенная как MCP-сервер, она работает с совместимыми клиентами, такими как Claude Desktop и Claude Code, функционируя на 100% локально без передачи данных за пределы вашего оборудования.
Как это работает
Ключевое отличие от стандартных RAG-систем — процесс консолидации. Каждые 6 часов локальная LLM (Qwen 2.5-7B, работающая в LM Studio) группирует недавние воспоминания по темам и объединяет их в структурированные документы знаний. Она извлекает факты, решения и предпочтения, объединяя их с существующими знаниями и версионируя всё.
Технологический стек
- Эмбеддинги: nomic-embed-text-v1.5 через LM Studio
- Векторный поиск: FAISS (семантический + ключевые слова гибрид)
- LLM для консолидации: Qwen 2.5-7B (Q4) через LM Studio
- Хранилище: SQLite для эпизодов, FAISS для векторов
- Протокол: MCP — работает со всем, что его поддерживает
- Конфигурация: TOML
Возможности
- Семантическое дедуплицирование с порогом косинусного сходства 0.95
- Адаптивная оценка удивления — часто используемые воспоминания усиливаются, устаревшие ослабевают
- Атомарная запись с tempfile + os.replace для защиты от сбоев
- Удаление в FAISS на основе tombstone — O(1) вместо перестроения всего индекса
- Плавная деградация — если LM Studio отключается, хранилище продолжает работать, консолидация приостанавливается
- 88 пройденных тестов
Инструменты MCP
memory_store— сохранить эпизод с типом, тегами, оценкой удивленияmemory_recall— семантический поиск по эпизодам + консолидированным знаниямmemory_forget— пометить эпизод для удаленияmemory_correct— обновить документ знанийmemory_export— полная JSON-резервная копияmemory_status— проверка состояния
Почему выбран MCP
Модели часто заменяются, но накопленные знания не должны исчезать вместе с ними. MCP делает память переносимой — одно хранилище, множество интерфейсов. Слой памяти становится ценнее любой отдельной модели.
Практические результаты
После примерно недели использования система создала документы знаний о компьютерном оборудовании, настройке VR, предпочтениях в программировании и архитектуре проектов — всё синтезировано из обычных диалогов. При начале новых чатов AI уже знает контекст пользователя без повторных объяснений.
Требования
- Python 3.11+
- LM Studio с загруженными Qwen 2.5-7B и nomic-embed-text-v1.5
- Любой MCP-клиент
📖 Read the full source: r/LocalLLaMA
👀 Смотрите также

Сервер навыков OpenClaw для анализа и торговли на индийском рынке
Открытый торговый терминал для индийских рынков был интегрирован в качестве сервера навыков OpenClaw, что позволяет агентам получать рыночные данные и проводить многогентный анализ через HTTP. Система предоставляет структурированные торговые планы с ценами входа, стоп-лоссами и целями для трех профилей риска.

Расширение Super Claude для браузера делает интерфейс Claude.ai полностью настраиваемым.
Разработчик создал расширение для браузера, которое позволяет пользователям настраивать каждый аспект интерфейса Claude.ai — цвета, шрифты, макет, а также отслеживание использования и подсчёт токенов. Расширение работает в Chrome и Firefox и было разработано с помощью самого Claude.

Локально-ориентированный ИИ-помощник для подготовки налогов с шифрованием персональных данных, созданный на основе MCP.
Разработчик создал расширение для подачи налоговой декларации для Crow, которое шифрует все персональные данные с помощью AES-256-GCM и работает с любым MCP-совместимым клиентом, включая Claude, ChatGPT, Gemini или локальные модели через Ollama. Система выполняет расчёты для форм 1040, Приложения 1, HSA (8889), образовательных кредитов (8863), самозанятости (Приложение C/SE) и прироста капитала (Приложение D) локально.

Krasis: гибридная среда выполнения для больших моделей MoE на CPU/GPU демонстрирует скорость предзаполнения 3,324 ток/с на RTX 5080
Krasis — это гибридная среда выполнения CPU/GPU, предназначенная для работы с большими моделями типа Mixture-of-Experts (MoE). Она обрабатывает предварительное заполнение на GPU, а декодирование — на CPU, достигая скорости 3324 токена/с на RTX 5080 с моделью Qwen3-Coder-Next 80B Q4. Для работы требуется примерно в 2,5 раза больше оперативной памяти, чем размер модели, что позволяет запускать модели, слишком большие для видеопамяти.