Гибридный поиск с использованием RRF улучшает систему памяти ИИ по сравнению с чистым векторным поиском.

Разработана система памяти с открытым исходным кодом для ИИ-ассистентов, использующая PostgreSQL с pgvector в локальной, самостоятельно размещаемой конфигурации. Система хранит информацию для запоминания ИИ-ассистентами между сессиями и делает её доступной для поиска.
Почему чистого векторного поиска было недостаточно
Разработчик начал с чистого векторного поиска: преобразование запросов в эмбеддинги, использование косинусного сходства и возврат топ-k результатов. Хотя это работало для расплывчатых вопросов, оно постоянно давало сбой на точных совпадениях. Например, поиск "RRF merging" возвращал фрагменты о "combining ranked lists" месячной давности вместо документа, который буквально содержит "RRF merging".
Решение гибридного поиска
Решение включало добавление второго компонента поиска: полнотекстовый поиск с использованием tsvector PostgreSQL с индексом GIN. Это сопоставление по ключевым словам улавливает то, что пропускает векторный поиск. Однако это создало два ранжированных списка, которые нужно было объединить.
Reciprocal Rank Fusion (RRF)
Reciprocal Rank Fusion оказался решением для объединения двух ранжированных списков. Формула проста: оценка = 1 / (k + ранг), где k=60 (стандартное значение). Результаты, появляющиеся в обоих списках, получают сумму обеих оценок. Этот подход не требует настройки весов и нормализации оценок между косинусным сходством и ts_rank — он использует только позиции рангов.
Техника обогащения запросов
Перед поиском система пропускает запросы через токенизатор WordPiece модели эмбеддингов для извлечения ключевых терминов (многосоставные токены, которые, вероятно, являются техническими или предметными терминами). Это генерирует до 3 вариантов запроса, преобразует их все в эмбеддинги и выполняет поиск параллельно. Это позволяет находить результаты, которые могли быть пропущены при одной формулировке.
Технологический стек
- PostgreSQL 16 + pgvector (индекс HNSW для векторов, индекс GIN для полнотекстового поиска)
- all-MiniLM-L6-v2 для эмбеддингов (384 измерения, работает на CPU)
- Python с асинхронным psycopg 3
- 3 адаптера для загрузки данных: markdown, обычный текст и JSON диалогов Claude
Вся система работает локально без вызовов API для эмбеддингов и без зависимостей от облачных сервисов. Код недавно выпущен, и разработчик написал подробный пост в блоге о полном подходе.
📖 Read the full source: r/LocalLLaMA
👀 Смотрите также

MemRosetta добавляет постоянную память в Claude Code с помощью одной команды настройки.
MemRosetta v0.2.4 предоставляет Claude Code кроссессионную память с помощью одной команды npm install. Инструмент включает MCP-сервер с 6 инструментами памяти, автоматический захват сессий и локальное хранилище SQLite, которое можно использовать совместно с Cursor.

Claude Code восстановил процесс онбординга SaaS за 6 часов против сметы разработчика на 3 недели, повысив активацию на 13 пунктов
Основатель SaaS стартапа с помощью Claude Code перестроил весь онбординг (регистрация → профиль → первый счет → обучение работе с дашбордом) за 6 часов, заменив оценку разработчика в $4,500 на 3 недели. Коэффициент активации вырос на 13 пунктов — с 35% до 48%.

SkillMesh: MCP-совместимый маршрутизатор для больших каталогов инструментов сокращает объём контекста на 70%
SkillMesh — это MCP-совместимый маршрутизатор, который извлекает только релевантные экспертные карточки для запросов AI-агентов, сокращая объём контекста на 70% и улучшая выбор инструментов. Он поддерживает Claude через MCP-сервер, пакеты навыков Codex и схемы функций в стиле OpenAI.

Когтевой Компактор: 14-ступенчатый движок сжатия токенов для конвейеров LLM
Claw Compactor — это движок сжатия токенов LLM с открытым исходным кодом, использующий 14-ступенчатый Fusion Pipeline для достижения среднего сжатия 54% без затрат на вывод LLM. Включает специализированные компрессоры для кода, JSON, логов, диффов и результатов поиска с возможностью обратимого сжатия.