Постоянная память для Claude: локальный стек с MCP, 39 мс на поиск, снижение токенов на 82%

Пользователь Reddit создал локальный уровень постоянной памяти для Claude, решающий проблему нулевого контекста между сессиями. Стек полностью локальный (без облака, без ключей API) и интегрируется через MCP. Ключевая архитектура: четыре уровня (L0 — только добавление событий в SQLite, L1 — отложенные факты, L2/L3 — вики-текст, L4 — кристаллизованные узлы сессий с резюме + решения + открытые темы), Qdrant в Docker для векторного поиска, llama.cpp с Qwen3-Embedding-4B на GPU и Qwen3.5-2B-Q4_K_M на CPU для эмбеддинга и чата, а также сервер FastMCP, предоставляющий 7 инструментов (retrieve, crystallize_session, list_sessions, get_l4_node, index_status, reindex, shutdown_models).
Числа
- Сокращение токенов по сравнению с базой grep+Read: среднее 82,7%, медиана 86,2%.
- F1 извлечения: 0,50 против 0,20 базовой.
- Холодный старт эмбеддинга ~4 с; p95 горячего пути 39 мс (было 2241 мс до исправления ошибки).
- Оценка извлечения сессий L4: средний балл 0,920 (порог 0,6).
- 738 чанков проиндексировано в 104 файлах Markdown.
Ключевой урок: повторное использование соединения в Windows
Горячий путь извлечения застревал на p95 2241 мс, даже при эмбеддинге на GPU 4070 Ti Super. Причина: каждый httpx.post() открывал новое TCP-соединение, и рукопожатия localhost в Windows занимали ~2 секунды. Переключение на постоянный httpx.Client с keep-alive снизило p95 до 39 мс — ускорение в 57 раз.
Другие сюрпризы
- Режим размышлений Qwen3: если
enable_thinkingне отключен черезchat_template_kwargs: {enable_thinking: false}с--jinjaна llama-server, модель тратит весь бюджет токенов на блоки размышлений и выводит пустое содержимое. - Регистрация MCP: Агентный режим Claude Desktop (Cowork) читает файл конфигурации плагина, а не
~/.claude.json. Сервис LKS должен быть упакован как правильный пакет .plugin для Cowork.
Для кого это
Для разработчиков, которые активно используют Claude и хотят экономичный, приватный, локальный слой памяти, поддерживающий контекст между сессиями без облачных зависимостей.
📖 Read the full source: r/ClaudeAI
👀 Смотрите также

Использование инструментария Obliteratus для удаления весов отказа из моделей искусственного интеллекта.
Пользователь Reddit использовал инструментарий Obliteratus для хирургического удаления конкретных весов, отвечающих за поведение отказа в моделях ИИ, продемонстрировав на модели Qwen 1.5B от Alibaba, что это может раскрыть происхождение обучения без переобучения.

Два навыка Claude Code для управления конфигурацией CLAUDE.md
Разработчик создал два навыка Claude Code для работы с конфигурацией CLAUDE.md: /cc-init создаёт лаконичные конфиги для новых проектов, а /cc-optimize анализирует существующие проекты на наличие избыточности и проблем. Оба инструмента направлены на снижение контекстной нагрузки и улучшение следования инструкциям.

主动式上下文旋转检测在Claude Code中的应用:来自r/ClaudeAI的功能建议
Предложение функции Reddit предлагает, чтобы Claude Code активно обнаруживал гниение контекста и предлагал структурированную передачу задачи с областью видимости, создавая файл передачи и автоматически запуская новый сеанс.

Kontext CLI: Брокер учетных данных для AI-агентов программирования
Kontext CLI — это брокер учетных данных на основе Go, который предоставляет AI-агентам для программирования кратковременные токены доступа вместо долгоживущих API-ключей. Он использует обмен токенами по RFC 8693, передает аудит-логи для каждого вызова инструмента и уже работает с Claude Code.