Pali v0.1: Открытая инфраструктура памяти для LLM с воспроизводимыми тестами производительности.

Что такое Pali
Pali — это инфраструктура памяти с открытым исходным кодом для больших языковых моделей, созданная с упором на инфраструктуру. Она построена на Go в виде готового единого бинарного файла с конфигурациями для модульных подключений, таких как qdrant, neo4j, ollama и openrouter. Проект лицензирован под MIT и полностью поддерживает самостоятельное развёртывание.
Ключевые возможности
- Мультитенантные API памяти с изоляцией по арендаторам
- Гибридный поиск по лексическим, плотным, комбинированным и переранжированным данным с опциональным многошаговым расширением
- Сервер MCP с инструментами, ориентированными на память, и разрешением с учётом арендаторов
- REST API с соответствующими пакетами для Python и JavaScript в реальном времени
- Панель управления для операторов, позволяющая проверять арендаторов, память и состояние системы
- Модульные точки расширения для векторных хранилищ, эмбеддеров, бэкендов фактов сущностей и оценки/маршрутизации
Подход к тестированию
Создатель решает распространённые проблемы с тестированием стеков памяти, внедряя воспроизводимый подход:
- Каждый запуск сохраняет точные используемые конфигурационные файлы (профиль + отрендеренные)
- Аппаратное обеспечение полностью раскрывается (CPU, GPU, RAM, версии моделей)
- Только парные сравнения — одинаковые фикстуры/оценки/top_k для всех профилей
- Скоростные и качественные полосы поиска разделены
Показатели производительности
Результаты тестирования на Ryzen 9 7950X + RTX 5070:
- sqlite + лексический поиск: 208 операций записи/с, Top1=0.32, Recall@5=0.54
- qdrant + ollama (all-minilm): 98 операций записи/с, Top1=0.34, Recall@5=0.52
- парсер+граф (полоса нагрузки структурированной памяти): 2.4 операции записи/с — медленно из-за затрат на структурированное извлечение, но достигает ~30 в среднем на LoCoMo с временными пиками около ~40
Важное уточнение
Pali — это не память для больших языковых моделей в смысле SaaS. Он возвращает сырые результаты поиска, которые вы оптимизируете под свой рабочий процесс — без чёрного ящика оценки, без привязки к решениям провайдеров. Вы можете менять векторные бэкенды, эмбеддеры и системы оценки через конфигурацию, не изменяя контракт вашего приложения.
Статус проекта
Версия 0.1 недавно выпущена с добавлением полноценного набора тестов. Создатель ищет участников для развития проекта.
📖 Read the full source: r/LocalLLaMA
👀 Смотрите также

Шлюз контекста: открытый прокси для сжатия контекста ИИ-агентов
Context Gateway — это открытый прокси, который располагается между кодирующими агентами и LLM, сжимая выходные данные инструментов перед их попаданием в контекстное окно. Он использует небольшие языковые модели для обнаружения сигнала в контексте, выполняет фоновое сжатие при заполнении окна на 85% и включает лимиты расходов, панель управления и уведомления в Slack.

Claude Code Studio: Открытое настольное приложение для управления несколькими сессиями кодирования Claude
Claude Code Studio v0.9.3 — это открытое настольное приложение с многопанельным интерфейсом для управления несколькими сессиями Claude Code CLI. Оно решает типичные проблемы рабочего процесса, такие как переключение между вкладками терминала, сохранение сессий и повторение инструкций.

Открытый исходный код для параллельных AI-агентов кодирования с человеческим шлюзом
Определение навыка в формате Markdown для запуска параллельных агентов Claude Code в отдельных git worktree с проверкой интеграционной ветки, дымовыми тестами и жестким контролем человека перед слиянием в production.

Выпущен навык OpenClaw SEO Audit для технического анализа веб-сайтов.
Новый навык OpenClaw выполняет комплексные SEO-аудиты с помощью команды 'seo audit [url]', проверяя техническое SEO, качество контента, элементы на странице, структурированные данные, метрики производительности, изображения и готовность к AI-поиску, выдавая оценку здоровья и приоритизированный план действий.