OmniRecall Beta: FAISS-gestützte Speicherinjektion für Cloud-LLM-Chats

Was OmniRecall macht
OmniRecall ist eine lokale mitmproxy-Umgehung, die den Datenverkehr zu Cloud-Chat-Schnittstellen abfängt (getestet mit DeepSeek). Es hackt sich in den proprietären SSE-Fragmentstrom und zwingt dem System, das für zustandslosen Betrieb konzipiert wurde, eine Langzeitspeicherschicht auf.
Technischer Mechanismus
- Deep-Packet-Parsing: Rekonstruiert die vollständige Assistenten-Antwort durch Verfolgung von Echtzeit-Patches
- Befehlssteuerung: Erkennt [ADD], [UPDATE], [REMOVE], [CLEAR] aus der KI-Ausgabe
- Lokales Gehirn: Verwaltet memory.txt + FAISS-Index (sentence-transformers MiniLM-L6)
- Kontextinjektion: Die am besten erinnerten Fakten werden als [RECALL: ...] in Ihre nächste Nachricht eingefügt
Aktueller Status & Einschränkungen
Dies ist eine Beta-/Experimentalfreigabe. Der Entwickler merkt an: "Das ist das Nächste, was ich nach Wochen Debugging-Hölle dem Traum kommen konnte. Es ist fehlerhaft. Es ist experimentell. [ADD] ist größtenteils stabil, aber [SEARCH] ist launisch – wenn Sie Perfektion wollen, reparieren Sie es selbst. Ich habe meine Energiegrenze für diesen Build erreicht."
Upstream-UI-Änderungen werden es brechen. Der Entwickler erklärt: "Wenn es kaputtgeht, ist das jetzt Ihr Problem."
Anforderungen & Einrichtung
Potato-PC-Anforderungen:
- Nur CPU (faiss-cpu + all-MiniLM-L6-v2)
- Kein lokales LLM erforderlich – erweitert die Cloud-Modelle, die Sie bereits nutzen
- Null Kosten, keine API-Schlüssel, 100 % lokale Datenisolierung
Bereitstellung:
pip install mitmproxy faiss-cpu sentence-transformers numpyVertrauen Sie dem mitmproxy-CA-Zertifikat auf Ihrem OS/Browser (führen Sie mitmproxy einmal aus, um es zu generieren). Setzen Sie den System-Proxy auf 127.0.0.1:8080. Dann ausführen:
mitmdump -s omnirecall.pyGehen Sie zu chat.deepseek.com und beginnen Sie, ihm Erinnerungen zu füttern.
Lizenzbedingungen
Das Projekt verwendet eine aggressiv restriktive quelloffene Lizenz:
- Keine kommerzielle Nutzung
- Keine privaten Forks
- Verpflichtende öffentliche ALTERATIONS.md für jegliche Logikänderungen
- Wenn Sie zu Claude/GPT-4o/irgendwas portieren, halten Sie es gemäß der Lizenz öffentlich
Der Entwickler erklärt: "Ich habe zu viele Solo-Entwicklerprojekte gesehen, die ausgeschlachtet, privatisiert oder in kostenpflichtige SaaS verwandelt wurden, während der Ersteller leer ausgeht. Diese Lizenz ist nicht freundlich – sie ist dazu gebaut, die Arbeit genau vor solchen Leuten zu schützen. Wenn die Bedingungen Sie abschrecken, das ist der Sinn."
📖 Read the full source: r/LocalLLaMA
👀 Siehe auch

OpenRouter Modellpreise und Intelligenz-pro-Dollar-Analyse
Ein Reddit-Nutzer hat die OpenRouter-API-Preise für 16 KI-Modelle zusammengestellt und Intelligenz-pro-Dollar-Werte berechnet, wobei MiMo-V2-Flash mit 0,09 $/M Token als bester Wert identifiziert wurde und GPT-5.4 mit 2,50 $/M Token als intelligentestes Modell.

Claude-Design vs. Huashu-Design: Ein direkter Vergleich von HTML-Layouts und Ratenbegrenzungen
Claude Design erstellt HTML-Prototypen schnell, stößt aber schnell an die Ratenbegrenzung. Huashu-Design, ein Open-Source-Claude-Code-Skill, läuft mit dem normalen Abonnement ohne separate Ratenbegrenzung – braucht aber 20 Minuten statt 5.

Claude Code Hook überwacht die WIP-Akkumulation in KI-Codierungs-Workflows
Ein Entwickler hat einen UserPromptSubmit-Hook für Claude Code erstellt, der die laufende Arbeit in vier Warteschlangen sichtbar macht: nicht committete Änderungen über 200 Zeilen, drei oder mehr nicht gepushte Commits, gepushte Commits ohne Changeset-Dateien und Release-PRs, die länger als 24 Stunden offen sind.

Enthüllung von OpenClaw: Wie es KI-Coding-Agenten stärkt.
Entdecken Sie, wie OpenClaw KI-Coding-Agenten revolutioniert und die Automatisierung in verschiedenen Bereichen vorantreibt.