Pali v0.1: Open-Source-Gedächtnisinfrastruktur für LLMs mit reproduzierbaren Benchmarks

Was Pali ist
Pali ist eine Open-Source-Speicherinfrastruktur für LLMs, die infrastrukturorientiert ist. Es ist in Go als einzelne Binärdatei entwickelt und bietet Konfigurationen für Plug-and-Play-Anbindungen wie qdrant, neo4j, ollama und openrouter. Das Projekt ist unter der MIT-Lizenz lizenziert und vollständig selbst hostbar.
Hauptmerkmale
- Multi-Tenant-Speicher-APIs mit mandantenspezifischer Isolation
- Hybrides Retrieval über lexikalische, dichte, Fusion-, Re-Ranking- und optionale Multi-Hop-Erweiterungen
- MCP-Server mit speicherorientierten Tools und mandantenbewusster Auflösung
- REST-API mit entsprechenden Python- und JavaScript-Paketen live verfügbar
- Dashboard für Betreiber zur Überwachung von Mandanten, Speichern und Systemzustand
- Plug-and-Play-Erweiterungspunkte für Vektorspeicher, Embedder, Entity-Fact-Backends und Scoring/Routing
Benchmark-Ansatz
Der Entwickler adressiert häufige Probleme mit Speicherstack-Benchmarks durch einen reproduzierbaren Ansatz:
- Jeder Lauf speichert die verwendeten Konfigurationsdateien (Profil + gerendert)
- Hardware wird vollständig offengelegt (CPU, GPU, RAM, Modellversionen)
- Nur gepaarte Vergleiche – gleiche Fixture/Evaluation/Top_k über alle Profile
- Geschwindigkeits- und Retrieval-Qualitäts-Spuren werden getrennt gehalten
Leistungszahlen
Benchmarks von Tests auf einem Ryzen 9 7950X + RTX 5070:
- sqlite + lexikalisch: 208 Store-Ops/s, Top1=0.32, Recall@5=0.54
- qdrant + ollama (all-minilm): 98 Store-Ops/s, Top1=0.34, Recall@5=0.52
- Parser+Graph (strukturierte Speicher-Stress-Spur): 2,4 Store-Ops/s – langsam aufgrund der strukturierten Extraktionskosten, erreicht aber ~30 Durchschnitt auf LoCoMo mit temporären Spitzen um ~40
Wichtige Klarstellung
Pali ist kein LLM-Speicher im SaaS-Sinne. Es liefert rohe Retrieval-Ergebnisse, die Sie für Ihren eigenen Workflow optimieren – keine Black-Box-Bewertung, keine festgelegten Provider-Entscheidungen. Sie können Vektor-Backends, Embedder und Scorer über Konfiguration austauschen, ohne Ihren App-Vertrag zu ändern.
Projektstatus
Version 0.1 wurde kürzlich veröffentlicht mit einer vollständigen Benchmark-Suite. Der Entwickler sucht nach Mitwirkenden.
📖 Read the full source: r/LocalLLaMA
👀 Siehe auch

PicoClaw scheitert am Bau eines F1-KI-Agents und verbrennt 20 US-Dollar an API-Guthaben.
Ein Entwickler versuchte, einen F1-Informationsbot mit PicoClaw auf einem Raspberry Pi Zero 2W zu erstellen, doch das Tool nutzte standardmäßig Version 11, erzeugte halluzinierte Python-Codes und verbrauchte 20 US-Dollar an DeepSeek-API-Guthaben, ohne eine funktionierende Lösung zu liefern.

Auto Router vs Sonnet: Kosteneinsparungen vs Antwortqualität
Die Auto Router-Funktion von Open Router wählt LLMs dynamisch basierend auf der Kontextkomplexität aus und bietet erhebliche Kosteneinsparungen (0,8 Cent vs. 0,00071 Cent pro Anfrage), aber Nutzer berichten von einer verschlechterten Antwortqualität im Vergleich zu Sonnet 4.6.

Bewahre meine Klaue: Backup-Dienst für OpenClaw-Arbeitsbereiche
Keep My Claw ist ein Backup-Dienst, der OpenClaw-Arbeitsbereichsdaten lokal verschlüsselt, bevor sie in Cloudflare R2 hochgeladen werden. Er verwaltet Speicherdateien, Cron-Jobs, Skills, Zugangsdaten und Konfigurations-Snapshots mit geplanten Backups und Ein-Kommando-Wiederherstellungen.

Beacon: Open-Source-Endpunkt-Telemetrie für lokale KI-Agenten
Beacon erfasst lokale KI-Agent-Aktivitäten (Claude Code, Codex CLI, Cursor usw.) und normalisiert sie in Endpunkt-Ereignisse zur Überprüfung oder SIEM-Weiterleitung über Wazuh, Elastic, Splunk HEC.