Тесты MemAware Benchmark проверяют память ИИ за пределами поиска по ключевым словам.

✍️ OpenClawRadar📅 Опубликовано: 27 марта 2026 г.🔗 Source
Тесты MemAware Benchmark проверяют память ИИ за пределами поиска по ключевым словам.
Ad

MemAware — это открытый бенчмарк, созданный для проверки того, могут ли ИИ-ассистенты с памятью извлекать релевантный контекст из прошлых разговоров, когда текущие запросы явно не содержат намёков на эту информацию.

Как работает бенчмарк

Бенчмарк содержит 900 вопросов по трём уровням сложности. Он тестирует сценарии, где релевантный контекст существует в памяти, но текущий вопрос не содержит ключевых слов, которые могли бы запустить поисковое совпадение. Например: вы рассказали своему ИИ-ассистенту о своей 45-минутной поездке на работу несколько месяцев назад, а позже спрашиваете: «На какое время мне поставить будильник для встречи в 8:30 утра?» Ассистент должен учесть вашу поездку, но поиск по «будильник 8:30 встреча» не найдёт разговоров о поездках на работу.

Ad

Ключевые выводы

  • Поиск почти не помогает: BM25-поиск набрал 2,8% против 0,8% без памяти — крошечное улучшение, которое обходится в 5 раз больше токенов.
  • Векторный поиск проваливается на сложных вопросах: Он помогает, когда ключевые слова пересекаются (6%), но падает до 0,7% на кросс-доменных связях — так же, как и без памяти. Пример сложного вопроса: «Как мне делать ставки на благотворительном аукционе?» должен вспомнить прошлую покупку сумки за $800 как базовый уровень трат, но сходство эмбеддингов не может связать эти концепции.
  • Поиск, когда не нужно, — дорого: Паттерн «всегда искать» читает ~4,7 тыс. токенов результатов на вопрос независимо от того, помогают они или нет. В большинстве случаев результаты — это нерелевантный шум.

Основная проблема

Текущие реализации памяти ИИ по сути являются просто поисковыми системами. Истинная осведомлённость памяти — знание того, какая информация хранится, и активное извлечение релевантного контекста — это другая проблема, которую один только поиск решить не может.

Бенчмарк доступен для тестирования различных подходов по адресу: https://github.com/kevin-hs-sohn/memaware

📖 Read the full source: r/ClaudeAI

Ad

👀 Смотрите также

Обзор производительности Omnicoder-9B: Скорость против проблем с вызовом инструментов
Инструменты

Обзор производительности Omnicoder-9B: Скорость против проблем с вызовом инструментов

Omnicoder-9B, модель, ориентированная на программирование, дообученная на Qwen3.5 9B с выводами от Opus 4.6, GPT 5.4, GPT 5.3 Codex и Gemini 3.1 Pro, демонстрирует высокую производительность на оборудовании среднего уровня, но имеет проблемы с вызовом инструментов в IDE.

OpenClawRadar
Изменения в рабочем процессе Claude Code UltraPlan и наблюдения за производительностью
Инструменты

Изменения в рабочем процессе Claude Code UltraPlan и наблюдения за производительностью

Claude Code UltraPlan представляет облачный рабочий процесс планирования с запуском из терминала, интерфейсом просмотра в браузере и вариантами выполнения. Тестирование показало примерно в 2 раза более быстрые повторные запуски по сравнению с локальным планированием, с неоднозначными улучшениями качества.

OpenClawRadar
Octopoda: Открытый слой памяти для локальных ИИ-агентов
Инструменты

Octopoda: Открытый слой памяти для локальных ИИ-агентов

Octopoda — это открытый слой памяти, который предоставляет локальным ИИ-агентам постоянную память между сессиями, семантический поиск, обнаружение циклов и восстановление после сбоев. Работает полностью офлайн с 33-мегабайтной моделью эмбеддингов и интегрируется с LangChain, CrewAI, AutoGen и OpenAI Agents SDK.

OpenClawRadar
CLI-Anything-WEB: плагин с открытым исходным кодом для обратного проектирования любого веб-сайта в Python CLI для Claude Code
Инструменты

CLI-Anything-WEB: плагин с открытым исходным кодом для обратного проектирования любого веб-сайта в Python CLI для Claude Code

CLI-Anything-WEB — это плагин с открытым исходным кодом для Claude Code, который отслеживает трафик вашего браузера, восстанавливает протокол и генерирует полноценный Python CLI с аутентификацией, тестами и поддержкой --json. Включено 19 примеров CLI для таких сайтов, как Reddit, Booking, Airbnb, ChatGPT и LinkedIn.

OpenClawRadar