Soul MCP Server fügt lokalen LLMs persistente Speicher und Sicherheit hinzu

Was Soul leistet
Soul ist ein Open-Source-MCP-Server, der entwickelt wurde, um das Sitzungsspeicherproblem für lokale LLMs zu lösen. Durch die Verwendung von zwei einfachen Befehlen ermöglicht er Agenten, sich alles über Sitzungen hinweg zu merken, anstatt am Ende jeder Sitzung zu vergessen.
Hauptfunktionen
- Persistenter Speicher: Zwei Befehle steuern die Speicherpersistenz:
n2_bootzu Sitzungsbeginn undn2_work_endam Ende der Sitzung - Ark-Sicherheitssystem: Integrierte Sicherheit, die gefährliche Befehle wie
rm -rfundDROP DATABASEohne Token-Kosten blockiert - Cloud-Speicher: Konfigurierbarer Cloud-Speicher mit einer einzigen Konfigurationszeile
- Open Source: Veröffentlicht unter der Apache-2.0-Lizenz
Einrichtung mit Ollama + Open WebUI
Installations- und Konfigurationsschritte:
- Installation via npm:
npm install n2-soul - In Open WebUI zu Einstellungen → Tools → MCP-Server gehen
- Einen neuen Server mit dem Befehl "node" hinzufügen
- Die Argumente auf Ihren Pfad zu
node_modules/n2-soul/index.jssetzen
Der Server funktioniert auch mit LM Studio und Cursor.
Zusätzliche Ressourcen
Für detaillierte Funktionen und Community-Diskussionen besuchen Sie das GitHub-Repository und verwandte Reddit-Beiträge. Der Entwickler sucht Feedback von der lokalen LLM-Community.
📖 Read the full source: r/LocalLLaMA
👀 Siehe auch

SuperContext: Ein Persistent Memory Framework für KI-Codierungsagenten
SuperContext ist ein Open-Source-Framework, das KI-Codierungswerkzeugen wie Claude durch strukturierte, zielgerichtete Dateien anstelle großer Anleitungsdokumente dauerhafte Erinnerung verleiht. Es enthält einen ausführbaren Prompt, der das System in etwa 10 Minuten ohne manuelle Einrichtung aufbaut.

SpruceChat läuft mit 0,5B LLM direkt auf Miyoo-Handhelds über llama.cpp
SpruceChat führt Qwen2.5-0.5B vollständig auf dem Gerät auf Handheld-Spielgeräten mit llama.cpp aus, ohne Cloud oder WiFi zu benötigen. Auf einem Miyoo A30 (Cortex-A7 Quad-Core) lädt es in ~60 Sekunden und generiert mit ~1-2 Token/Sekunde.

Krasis: Hybride CPU/GPU-Laufzeitumgebung für große MoE-Modelle erreicht 3.324 Tok/s Prefill auf RTX 5080
Krasis ist eine hybride CPU/GPU-Laufzeitumgebung, die große MoE-Modelle ausführt, indem sie die Vorausfüllung auf der GPU und die Dekodierung auf der CPU verarbeitet. Sie erreicht 3.324 Token/Sekunde bei der Vorausfüllung auf einer RTX 5080 mit Qwen3-Coder-Next 80B Q4. Sie benötigt etwa das 2,5-fache der Modellgröße im System-RAM, ermöglicht aber die Ausführung von Modellen, die für den VRAM zu groß sind.

FlowBoard v5: Der Projektarbeitsbereich, in dem Ihre KI-Agenten tatsächlich laufen
FlowBoard v5 ist ein React-basiertes Projekt-Workspace für KI-Agenten mit einem ereignisgesteuerten Task-Speicher (SQLite), Multi-Agenten-Unterstützung, Ideen-zu-Spezifikationen-Schleife und modularen Übersichts-Widgets.