Система автоматической памяти с открытым исходным кодом для агентов LLM достигает точности воспроизведения 94%.

Разработчик открыл исходный код автоматической системы памяти для агентов на основе LLM, которая автоматически извлекает, классифицирует и сохраняет факты между сессиями без необходимости явных команд "сохрани это". Весь проект — включая код плагина, дизайн бенчмарка и тестовую обвязку — был создан с использованием Claude Code в качестве основного инструмента разработки.
Как работает система памяти
Система работает на двух уровнях:
- Уровень 1 (на каждый ход): Легковесная LLM суммирует каждый ход в реальном времени и записывает в промежуточный файл
- Уровень 2 (граница сессии): Асинхронная классификация в четыре файла навыков: идентичность, знания, уроки и предпочтения
Извлечение работает за счёт загрузки агентом соответствующих файлов навыков на основе сопоставления ключевых слов в описаниях. Подход использует структурированные файлы markdown, которые агент читает как "навыки", а не векторные базы данных или RAG-конвейеры.
Разработка с Claude Code
Claude Code помог в нескольких аспектах проекта:
- Дизайн архитектуры: Помог оценить LongMemEval как кандидата для бенчмарка, выявил несоответствие парадигм (длинноконтекстное извлечение против прогрессивной памяти) и предложил адаптированный бенчмарк из 6 типов вопросов
- Создание бенчмарка: Разработал полный тестовый набор из 20 сессий/48 фактов, включая таблицу внедрения фактов, цепочки обновлений (A→B→C), интерференционные пары, вопросы воздержания и размещение двухшаговых триггеров
- Тестовая обвязка: Построил весь фреймворк автотестирования, включая последовательный исполнитель, многократный опрос, управление жизненным циклом, оценщик правил и конвейер судьи LLM
- Отладка в цикле: Диагностировал проблемы в реальном времени во время тестовых прогонов, например, блокировку перезапуска Агента всплывающим окном обновления, что было исправлено установкой файла состояния обновления в режим только для чтения
Результаты бенчмарка
Бенчмарк из 20 сессий был вдохновлён LongMemEval и тестировал 48 внедрённых фактов по 6 типам вопросов:
- Глубокое вспоминание: Факты из сессий 1-2, протестированные через 15+ сессий — 89%
- Обновление знаний: 3-уровневая цепочка исправлений (A→B→C) — 100%
- Межсессионное рассуждение: Комбинирование фактов из 3+ сессий — 100%
- Устойчивость к интерференции: Похожие имена, которые не должны путаться — 100%
- Временное рассуждение: Вопросы на порядок "Что было первым?" — 80%
- Воздержание: "Я не знаю" для никогда не упомянутых фактов — 86%
Итог: 49/52 контрольных точек пройдено (94,2%). Единственный серьёзный провал произошёл, когда агент вывел "вы занимались маркетингом в соцсетях" из смутно связанного факта ("промо-работа"), тогда как правильным ответом было "никогда не обсуждалось" — классическая проблема чрезмерного вывода LLM.
Доступность и вопросы
Проект имеет открытый исходный код, код и бенчмарк доступны на GitHub. Разработчик ищет отзывы о подходе с файлами навыков (структурированный markdown против векторного поиска), лучшие способы тестирования воздержания (определено как самая сложная область) и информацию о других, кто тестирует межсессионную память в агентах (не только длинный контекст).
📖 Read the full source: r/ClaudeAI
👀 Смотрите также

Агенекс: Платформа для автономного сотрудничества ИИ на основе агентов
Agenexus — это платформа, где ИИ-агенты регистрируются через файл SKILL.md, проходят проверку способностей через Claude API и автоматически подбираются для сотрудничества на основе семантического соответствия, без участия человека. Построена на Next.js, Supabase, эмбеддингах Voyage AI и Claude API.

molequla: Постоянно обучающийся ИИ-организм, созданный с нуля с помощью ClaudeCode
molequla — это постоянно обучающийся ИИ-организм, реализованный с нуля на Go, C, JavaScript и Rust с оркестратором на Python. Каждый элемент представляет собой полную реализацию трансформера с векторным автоградиентом, обученную на сыром тексте, которая со временем растёт и развивает личность.

Связать код Claude с чат-приложениями для удаленного взаимодействия
Проект GitHub под названием cc-connect соединяет Claude Code с платформами обмена сообщениями, такими как Slack и Telegram, позволяя удалённое взаимодействие без необходимости открывать доступ к локальной машине. Агент работает локально, а небольшой мост передаёт сообщения между агентом и чат-приложениями.

Claude Code v2.1.139 добавляет команду /goal для асинхронных длительных задач
Claude Code v2.1.139 представляет команду /goal, позволяющую запускать сеансы по принципу «забыл и забыл», которые выполняются до достижения условия завершения, а также новый просмотр агентов для отслеживания активных сеансов.