Pali v0.1 : Infrastructure de mémoire open source pour LLM avec des benchmarks reproductibles

Qu'est-ce que Pali
Pali est une infrastructure de mémoire open source pour les LLM qui est axée sur l'infrastructure. Il est construit en Go sous forme d'un binaire unique prêt à l'emploi avec des configurations pour des extensions plug-and-play comme qdrant, neo4j, ollama et openrouter. Le projet est sous licence MIT et entièrement auto-hébergeable.
Fonctionnalités principales
- API de mémoire multi-locataires avec isolation par locataire
- Récupération hybride à travers lexical, dense, fusion, reranking et expansion multi-sauts optionnelle
- Serveur MCP avec outils axés sur la mémoire et résolution tenant-aware
- API REST avec packages Python et JavaScript respectifs en direct
- Tableau de bord pour les opérateurs inspectant les locataires, les mémoires et l'état du système
- Points d'extension plug-and-play pour les magasins vectoriels, les embedders, les backends d'entités-faits et le scoring/routage
Approche de benchmark
Le créateur aborde les problèmes courants des benchmarks de piles de mémoire en mettant en œuvre une approche reproductible :
- Chaque exécution stocke les fichiers de configuration exacts utilisés (profil + rendu)
- Le matériel est entièrement divulgué (CPU, GPU, RAM, versions des modèles)
- Comparaisons appariées uniquement — même fixture/évaluation/top_k pour tous les profils
- Les voies de vitesse et les voies de qualité de récupération sont séparées
Chiffres de performance
Benchmarks des tests sur un Ryzen 9 7950X + RTX 5070 :
- sqlite + lexical : 208 opérations de stockage/s, Top1=0.32, Recall@5=0.54
- qdrant + ollama (all-minilm) : 98 opérations de stockage/s, Top1=0.34, Recall@5=0.52
- parser+graph (voie de stress mémoire structurée) : 2.4 opérations de stockage/s — lent en raison du coût d'extraction structurée, mais atteint ~30 en moyenne sur LoCoMo avec des pics temporels autour de ~40
Clarification importante
Pali n'est pas une mémoire LLM au sens SaaS. Il renvoie des résultats de récupération bruts que vous optimisez pour votre propre flux de travail — pas de scoring boîte noire, pas de décisions de fournisseur verrouillées. Vous pouvez échanger les backends vectoriels, les embedders et les scoreurs via la configuration sans changer le contrat de votre application.
État du projet
La version 0.1 a été récemment publiée avec une suite de benchmarks appropriée ajoutée. Le créateur recherche des contributeurs.
📖 Read the full source: r/LocalLLaMA
👀 See Also

ForgeAI : Un atelier visuel pour l'ingénierie de modèles
ForgeAI fournit une interface visuelle pour l'inspection, la fusion et l'entraînement de modèles, offrant des fonctionnalités telles que l'inspection d'architecture de modèle en 3D et M-DNA Forge pour la fusion visuelle de couches.

Comment j'ai construit un site web 3D scroll en 2 heures avec Claude Code et Veo
Un développeur a créé un site web à défilement 3D en 2 heures en utilisant Claude Code, la génération vidéo Veo et une compétence personnalisée « vidéo vers site web ». Code complet et démo en ligne partagés.

Tocket CLI : Un Cadre d'Ingénierie de Contexte pour les Agents d'IA de Codage
Tocket est un outil CLI qui crée un dossier .context/ contenant des fichiers markdown pour que les agents IA puissent maintenir la mémoire du projet entre les sessions. Il détecte automatiquement les piles technologiques à partir du package.json et génère un fichier .cursorrules préconfiguré.

Memtrace : Mémoire persistante et temporelle de la base de code pour les agents Claude Code
Memtrace fournit des instantanés toujours à jour et une relecture bi-temporelle pour les agents Claude Code, en utilisant l'analyse AST Tree-sitter et une récupération hybride (BM25 + embeddings Jina-code) sans aucun coût d'inférence LLM lors de l'indexation.