Постоянная память для Claude: локальный стек с MCP, 39 мс на поиск, снижение токенов на 82%

✍️ OpenClawRadar📅 Опубликовано: 8 мая 2026 г.🔗 Source
Постоянная память для Claude: локальный стек с MCP, 39 мс на поиск, снижение токенов на 82%
Ad

Пользователь Reddit создал локальный уровень постоянной памяти для Claude, решающий проблему нулевого контекста между сессиями. Стек полностью локальный (без облака, без ключей API) и интегрируется через MCP. Ключевая архитектура: четыре уровня (L0 — только добавление событий в SQLite, L1 — отложенные факты, L2/L3 — вики-текст, L4 — кристаллизованные узлы сессий с резюме + решения + открытые темы), Qdrant в Docker для векторного поиска, llama.cpp с Qwen3-Embedding-4B на GPU и Qwen3.5-2B-Q4_K_M на CPU для эмбеддинга и чата, а также сервер FastMCP, предоставляющий 7 инструментов (retrieve, crystallize_session, list_sessions, get_l4_node, index_status, reindex, shutdown_models).

Числа

  • Сокращение токенов по сравнению с базой grep+Read: среднее 82,7%, медиана 86,2%.
  • F1 извлечения: 0,50 против 0,20 базовой.
  • Холодный старт эмбеддинга ~4 с; p95 горячего пути 39 мс (было 2241 мс до исправления ошибки).
  • Оценка извлечения сессий L4: средний балл 0,920 (порог 0,6).
  • 738 чанков проиндексировано в 104 файлах Markdown.
Ad

Ключевой урок: повторное использование соединения в Windows

Горячий путь извлечения застревал на p95 2241 мс, даже при эмбеддинге на GPU 4070 Ti Super. Причина: каждый httpx.post() открывал новое TCP-соединение, и рукопожатия localhost в Windows занимали ~2 секунды. Переключение на постоянный httpx.Client с keep-alive снизило p95 до 39 мс — ускорение в 57 раз.

Другие сюрпризы

  • Режим размышлений Qwen3: если enable_thinking не отключен через chat_template_kwargs: {enable_thinking: false} с --jinja на llama-server, модель тратит весь бюджет токенов на блоки размышлений и выводит пустое содержимое.
  • Регистрация MCP: Агентный режим Claude Desktop (Cowork) читает файл конфигурации плагина, а не ~/.claude.json. Сервис LKS должен быть упакован как правильный пакет .plugin для Cowork.

Для кого это

Для разработчиков, которые активно используют Claude и хотят экономичный, приватный, локальный слой памяти, поддерживающий контекст между сессиями без облачных зависимостей.

📖 Read the full source: r/ClaudeAI

Ad

👀 Смотрите также

Открытый инструментарий Ralph Loop для Claude Code: Агенты Пикл Рик и Мистер Мисикс
Инструменты

Открытый инструментарий Ralph Loop для Claude Code: Агенты Пикл Рик и Мистер Мисикс

Расширение с открытым исходным кодом для Claude Code реализует технику Ralph Loop с двумя автономными агентами: Pickle Rick для разработки на основе PRD и Mr. Meeseeks для проверки кода. Оба используют tmux с живыми панелями мониторинга и уведомлениями macOS.

OpenClawRadar
GlycemicGPT: Самостоятельно развернутый ИИ-монитор диабета с BYOAI и Plugin SDK
Инструменты

GlycemicGPT: Самостоятельно развернутый ИИ-монитор диабета с BYOAI и Plugin SDK

GlycemicGPT — это открытая платформа для самостоятельного размещения, которая подключает Dexcom G7 и помпы Tandem к уровню анализа ИИ. Она предоставляет ежедневные сводки, анализ приема пищи, чат для бесед и настраиваемые оповещения, работающие на вашем собственном оборудовании.

OpenClawRadar
Инструмент Claude-context-lint анализирует избыточное использование токенов в проектах Claude Code.
Инструменты

Инструмент Claude-context-lint анализирует избыточное использование токенов в проектах Claude Code.

Новый инструмент claude-context-lint анализирует проекты Claude Code, чтобы показать, сколько контекстного окна потребляется файлами CLAUDE.md, навыками, серверами MCP и системными промптами до ввода пользователя. Инструмент предоставляет конкретные рекомендации по сокращению использования токенов.

OpenClawRadar
Плагин OpenClaw Memos решает проблемы передачи памяти в AI-агентах для программирования.
Инструменты

Плагин OpenClaw Memos решает проблемы передачи памяти в AI-агентах для программирования.

Пользователь Reddit рассказывает, как утечка кода Claude выявила проблемы с передачей памяти в AI-агентах для программирования, где раздутые транскрипты вызывают сложности при смене моделей. Они внедрили плагин memos в OpenClaw со стратегией выборочного восстановления, чтобы сжимать недавнюю работу и отбрасывать устаревшие вызовы инструментов.

OpenClawRadar