Тесты MemAware Benchmark проверяют память ИИ за пределами поиска по ключевым словам.

✍️ OpenClawRadar📅 Опубликовано: 27 марта 2026 г.🔗 Source
Тесты MemAware Benchmark проверяют память ИИ за пределами поиска по ключевым словам.
Ad

MemAware — это открытый бенчмарк, созданный для проверки того, могут ли ИИ-ассистенты с памятью извлекать релевантный контекст из прошлых разговоров, когда текущие запросы явно не содержат намёков на эту информацию.

Как работает бенчмарк

Бенчмарк содержит 900 вопросов по трём уровням сложности. Он тестирует сценарии, где релевантный контекст существует в памяти, но текущий вопрос не содержит ключевых слов, которые могли бы запустить поисковое совпадение. Например: вы рассказали своему ИИ-ассистенту о своей 45-минутной поездке на работу несколько месяцев назад, а позже спрашиваете: «На какое время мне поставить будильник для встречи в 8:30 утра?» Ассистент должен учесть вашу поездку, но поиск по «будильник 8:30 встреча» не найдёт разговоров о поездках на работу.

Ad

Ключевые выводы

  • Поиск почти не помогает: BM25-поиск набрал 2,8% против 0,8% без памяти — крошечное улучшение, которое обходится в 5 раз больше токенов.
  • Векторный поиск проваливается на сложных вопросах: Он помогает, когда ключевые слова пересекаются (6%), но падает до 0,7% на кросс-доменных связях — так же, как и без памяти. Пример сложного вопроса: «Как мне делать ставки на благотворительном аукционе?» должен вспомнить прошлую покупку сумки за $800 как базовый уровень трат, но сходство эмбеддингов не может связать эти концепции.
  • Поиск, когда не нужно, — дорого: Паттерн «всегда искать» читает ~4,7 тыс. токенов результатов на вопрос независимо от того, помогают они или нет. В большинстве случаев результаты — это нерелевантный шум.

Основная проблема

Текущие реализации памяти ИИ по сути являются просто поисковыми системами. Истинная осведомлённость памяти — знание того, какая информация хранится, и активное извлечение релевантного контекста — это другая проблема, которую один только поиск решить не может.

Бенчмарк доступен для тестирования различных подходов по адресу: https://github.com/kevin-hs-sohn/memaware

📖 Read the full source: r/ClaudeAI

Ad

👀 Смотрите также

iai-mcp: локальный демон для постоянной памяти OpenClaw между сессиями
Инструменты

iai-mcp: локальный демон для постоянной памяти OpenClaw между сессиями

iai-mcp — это открытый демон, который перехватывает все разговоры OpenClaw, хранит их в трёх уровнях памяти с локальными нейронными эмбеддингами и шифрованием AES-256, а при новых сессиях подгружает релевантный контекст — точность воспроизведения >99%, время поиска <100мс, стоимость начала сессии <3к токенов.

OpenClawRadar
Трекер сессий Claude: Автоматическое сохранение сессий кода Claude в Issues GitHub
Инструменты

Трекер сессий Claude: Автоматическое сохранение сессий кода Claude в Issues GitHub

Новый инструмент под названием claude-session-tracker автоматически сохраняет сессии Claude Code в GitHub Issues, записывая каждый запрос и ответ в виде комментариев с отметками времени. Он создаёт один Issue на GitHub для каждой сессии, привязывая его к доске Projects, и работает через нативную систему хуков Claude Code, не расходуя токены контекста.

OpenClawRadar
JetBrains представляет плагин для современного Go-кода с AI-агентами Junie и Claude Code.
Инструменты

JetBrains представляет плагин для современного Go-кода с AI-агентами Junie и Claude Code.

JetBrains выпустила плагин для AI-агентов Junie и Claude Code, улучшив их способность генерировать современный код на Go, соответствующий последним функциям и лучшим практикам языка.

OpenClawRadar
Sponsio: Детерминированные защитные барьеры для OpenClaw — блокировка «легальных, но неправильных» вызовов инструментов
Инструменты

Sponsio: Детерминированные защитные барьеры для OpenClaw — блокировка «легальных, но неправильных» вызовов инструментов

Инструмент с открытым исходным кодом, который располагается на границе инструментов и оценивает каждый вызов с помощью контрактов темпоральной логики (~0,14 ms p50). Запрещает агентам редактировать файлы за пределами рабочего каталога, выполнять force-push или запускать миграции в неправильной базе данных.

OpenClawRadar