Pali v0.1: Открытая инфраструктура памяти для LLM с воспроизводимыми тестами производительности.

Что такое Pali
Pali — это инфраструктура памяти с открытым исходным кодом для больших языковых моделей, созданная с упором на инфраструктуру. Она построена на Go в виде готового единого бинарного файла с конфигурациями для модульных подключений, таких как qdrant, neo4j, ollama и openrouter. Проект лицензирован под MIT и полностью поддерживает самостоятельное развёртывание.
Ключевые возможности
- Мультитенантные API памяти с изоляцией по арендаторам
- Гибридный поиск по лексическим, плотным, комбинированным и переранжированным данным с опциональным многошаговым расширением
- Сервер MCP с инструментами, ориентированными на память, и разрешением с учётом арендаторов
- REST API с соответствующими пакетами для Python и JavaScript в реальном времени
- Панель управления для операторов, позволяющая проверять арендаторов, память и состояние системы
- Модульные точки расширения для векторных хранилищ, эмбеддеров, бэкендов фактов сущностей и оценки/маршрутизации
Подход к тестированию
Создатель решает распространённые проблемы с тестированием стеков памяти, внедряя воспроизводимый подход:
- Каждый запуск сохраняет точные используемые конфигурационные файлы (профиль + отрендеренные)
- Аппаратное обеспечение полностью раскрывается (CPU, GPU, RAM, версии моделей)
- Только парные сравнения — одинаковые фикстуры/оценки/top_k для всех профилей
- Скоростные и качественные полосы поиска разделены
Показатели производительности
Результаты тестирования на Ryzen 9 7950X + RTX 5070:
- sqlite + лексический поиск: 208 операций записи/с, Top1=0.32, Recall@5=0.54
- qdrant + ollama (all-minilm): 98 операций записи/с, Top1=0.34, Recall@5=0.52
- парсер+граф (полоса нагрузки структурированной памяти): 2.4 операции записи/с — медленно из-за затрат на структурированное извлечение, но достигает ~30 в среднем на LoCoMo с временными пиками около ~40
Важное уточнение
Pali — это не память для больших языковых моделей в смысле SaaS. Он возвращает сырые результаты поиска, которые вы оптимизируете под свой рабочий процесс — без чёрного ящика оценки, без привязки к решениям провайдеров. Вы можете менять векторные бэкенды, эмбеддеры и системы оценки через конфигурацию, не изменяя контракт вашего приложения.
Статус проекта
Версия 0.1 недавно выпущена с добавлением полноценного набора тестов. Создатель ищет участников для развития проекта.
📖 Read the full source: r/LocalLLaMA
👀 Смотрите также

bareguard: Легковесная система безопасности для AI-агентов — теперь в npm
bareguard v1.0 — это слой безопасности для AI-агентов, состоящий из ~1000 строк кода с одной зависимостью, который блокирует деструктивные действия (rm -rf, DROP TABLE) и обеспечивает контроль бюджета с возможностью эскалации человеку. Входит в состав bare suite, доступен на npm.

Каркас Scaffold решает проблемы с памятью кода и рабочими процессами Claude
Scaffold — это 17-навыковый фреймворк для Claude Code, который обеспечивает постоянную память, принудительное принятие решений и контрольные точки рабочих процессов. Он использует 3-уровневую систему маршрутизации моделей для экономии токенов и может быть установлен через меню плагинов Claude Code.

gui.new: Инструмент для Claude для отображения визуального вывода в виде доступных для общего доступа ссылок
gui.new — это инструмент, который позволяет Claude визуализировать вывод в виде живых ссылок для совместного использования, вместо возврата блоков кода. Он создан с помощью Claude, использует Next.js на Vercel с Supabase и не требует регистрации.

onWatch: Открытый локальный трекер квот API с хранением в SQLite
onWatch — это локальный трекер квот API, который хранит все данные в локальной базе данных SQLite без использования облачных сервисов, телеметрии или регистрации аккаунтов. Это единый исполняемый файл (~13 МБ), работающий как фоновый демон с использованием <50 МБ оперативной памяти и предоставляющий панель управления на localhost.