Бенчмарк MemAware показывает, что память агентов на основе RAG не справляется с неявным извлечением контекста.

✍️ OpenClawRadar📅 Опубликовано: 27 марта 2026 г.🔗 Source
Бенчмарк MemAware показывает, что память агентов на основе RAG не справляется с неявным извлечением контекста.
Ad

Бенчмарк MemAware заполняет пробел в существующем тестировании памяти агентов, оценивая, могут ли ИИ-агенты извлекать релевантный прошлый контекст, когда пользователи явно об этом не спрашивают. Большинство современных систем памяти агентов следуют простой схеме: пользователь задаёт вопрос → агент ищет в памяти → извлекает результаты → отвечает. Это хорошо работает для явных запросов, таких как "какое решение было принято по базе данных?", но терпит неудачу, когда контекст подразумевается.

Что тестирует MemAware

Бенчмарк включает 900 вопросов трёх уровней сложности, проверяющих извлечение неявного контекста:

  • Лёгкий: Вопросы с пересечением ключевых слов (например, "На какое время поставить будильник к встречи в 8:30?" должно вызвать воспоминание о 45-минутной поездке)
  • Средний: Вопросы в одной предметной области
  • Сложный: Междисциплинарные вопросы без связи по ключевым словам (например, "Ford Mustang нуждается в воздушном фильтре, где я могу использовать свои скидки по программе лояльности?" должно вызвать воспоминание, что пользователь покупает в Target)
Ad

Результаты бенчмарка

Тестирование с локальным BM25 + векторным поиском выявило значительные ограничения:

  • Лёгкий уровень: точность 6,0%
  • Средний уровень: точность 3,7%
  • Сложный уровень: точность 0,7% — практически то же самое, что и полное отсутствие памяти (0,8%)

Сложный уровень представляет нерешённые проблемы, когда поисковые запросы не связывают концепции из разных областей. Автор бенчмарка предполагает, что эффективные решения могут потребовать "какого-то предварительно загруженного обзора всей истории пользователя, а не извлечения для каждого запроса".

Практические последствия

Это подчёркивает фундаментальное ограничение современных систем памяти агентов на основе RAG. Когда пользователи не используют правильные ключевые слова или когда связи охватывают разные области, стандартные подходы к поиску не могут извлечь релевантный контекст. Набор данных и тестовый фреймворк имеют открытый исходный код по лицензии MIT, что позволяет разработчикам тестировать свои собственные системы памяти.

📖 Read the full source: r/LocalLLaMA

Ad

👀 Смотрите также

Создание локального голосового AI-ассистента с помощью SwiftUI и CSM-1B на Apple Silicon
Инструменты

Создание локального голосового AI-ассистента с помощью SwiftUI и CSM-1B на Apple Silicon

Разработчик создал mobiGlas, приложение на SwiftUI, которое объединяется с OpenClaw для возможности разговоров без рук через AirPods, используя локальное клонирование голоса (CSM-1B на M2 Ultra) и без облачных API.

OpenClawRadar
Аудит SecureCode: аудитор безопасности сервера Linux, созданный с помощью Claude Code
Инструменты

Аудит SecureCode: аудитор безопасности сервера Linux, созданный с помощью Claude Code

Независимый разработчик создал SecureCode Audit с помощью Claude Code — выполните одну SSH-команду, получите отчет по безопасности из 22 проверок с приоритетными исправлениями. Первые 30 зарегистрировавшихся получат полный аудит бесплатно.

OpenClawRadar
AgentMind: Плагин для Claude Code, который изучает и применяет ваши предпочтения в программировании
Инструменты

AgentMind: Плагин для Claude Code, который изучает и применяет ваши предпочтения в программировании

AgentMind — это плагин Claude Code, который наблюдает за вашими паттернами программирования, изучает предпочтения, такие как выбор инструментов и правила стиля, и автоматически внедряет этот контекст в будущие сессии. Он использует шестишаговый основной цикл и систему оценки уверенности для определения, когда применять изученные предпочтения.

OpenClawRadar
Исправление прокси Quell для устранения скачков прокрутки кода Claude в Windows
Инструменты

Исправление прокси Quell для устранения скачков прокрутки кода Claude в Windows

Quell — это прокси-сервер на Rust, который располагается между вашим терминалом и Claude Code, удаляя последовательности очистки экрана, вызывающие сброс позиции прокрутки при длинных ответах. Также добавляет Shift+Enter для переноса строк, фильтрацию безопасности и полную поддержку Unicode.

OpenClawRadar