Lokale semantische Suche für KI-Gespräche mit fastembed und LanceDB

✍️ OpenClawRadar📅 Veröffentlicht: 20. März 2026🔗 Source
Lokale semantische Suche für KI-Gespräche mit fastembed und LanceDB
Ad

Ein Entwickler hat ein lokales semantisches Suchsystem für KI-Konversationsverläufe implementiert, das 368K Nachrichten ohne Cloud-Abhängigkeiten oder API-Schlüssel verarbeitet. Das Projekt verwendet fastembed mit dem BAAI/bge-small-en-v1.5-Modell für CPU-basierte Embeddings und LanceDB als Vektorspeicher, der als einzelnes Verzeichnis ohne Serverprozess arbeitet.

Technischer Stack

  • Embeddings: fastembed mit BAAI/bge-small-en-v1.5-Modell (384 Dimensionen)
  • Vektorspeicher: LanceDB - einzelnes Verzeichnis, kein Serverprozess, anhangsfreundlich
  • Erfassung: Bezieht Daten aus JSONL-Session-Transkripten (Claude Code, beliebiger Chat-Export)
  • Embedding-Leistung: ~500 Dokumente/Sekunde auf M4-CPU

Wichtige Implementierungsdetails

Der Entwickler hat während der 4-monatigen Iteration mehrere praktische Erkenntnisse gewonnen:

  • Selektives Embedding: Frühere Versionen haben jede Nachricht eingebettet, was das Signal-Rausch-Verhältnis verringerte. Die aktuelle Implementierung bettet nur Benutzernachrichten und substanzielle Assistentennachrichten ein (überspringt Antworten wie "sicher, hier ist der Code"), wodurch die Vektoranzahl um 60% reduziert wird und die Suchqualität verbessert wird.
  • Chunking-Strategie: Der Wechsel von festen Chunk-Größen zu Konversationswechsel-Chunks hat einen enormen Unterschied in der Abrufrelevanz gemacht. Die Modellauswahl (getestet wurden nomic-embed-text, bge-large, all-MiniLM) zeigte im Vergleich zum Chunking-Ansatz nur marginale Unterschiede.
  • LanceDB-Vorteile: Der Entwickler fand LanceDB "dumm unterschätzt für persönliche Maßstäbe" - kein Server, kein Docker, nur ein Verzeichnis mit sofortigem Anhängen neuer Vektoren, das eine überkomplizierte pgvector-Einrichtung ersetzt.
  • Re-Embedding-Workflow: Das bge-small-en-v1.5-Modell mit 384 Dimensionen ist schnell genug, um stündlich als Cron-Job neu eingebettet zu werden. Eine vollständige Neuindizierung von 117K Vektoren dauert auf M2-Hardware etwa 4 Minuten.
Ad

Leistungsmetriken

  • Gesamte erfasste Nachrichten: 407K
  • Indizierte Vektoren: 87K
  • Suchlatenz (p50): 12ms über 117K Vektoren
  • Vollständige Neuindizierungszeit: ~4 Minuten (M2)
  • Speicher: ~180MB auf der Festplatte
  • Benötigte API-Schlüssel: 0

Das Projekt ist unter der MIT-Lizenz quelloffen und verfügbar unter github.com/mordechaipotash/brain-mcp. Die Installation erfolgt über pipx install brain-mcp && brain-mcp setup.

📖 Read the full source: r/LocalLLaMA

Ad

👀 Siehe auch

Kreativ-Exzellenz-Plugin für Claude Code verbessert Animationsqualität durch Interaktionsthese
Werkzeuge

Kreativ-Exzellenz-Plugin für Claude Code verbessert Animationsqualität durch Interaktionsthese

Ein neues Open-Source-Plugin für Claude Code adressiert die generische Animation-Erstellung durch die Implementierung eines 'Interaktions-These'-Ansatzes, bei dem Claude zunächst Bewegungskonzepte beschreiben muss, bevor er Code schreibt. Das Plugin umfasst 8 Teilfähigkeiten, die GSAP, Framer Motion, CSS-Animationen und Designprinzipien aus untersuchten Repositories abdecken.

OpenClawRadar
PocketBot Beta: Privatsphäre-zuerst iOS KI-Agent mit hybrider Lokal-/Cloud-Engine
Werkzeuge

PocketBot Beta: Privatsphäre-zuerst iOS KI-Agent mit hybrider Lokal-/Cloud-Engine

PocketBot ist ein iOS-KI-Agent, der im Hintergrund läuft, sich in App Intents einklinkt und eine hybride Engine nutzt: Lokale Ausführung für Systemauslöser und PII-Bereinigung, mit Cloud-Verarbeitung für komplexe Aufgaben wie E-Mail-Zusammenfassungen oder Flugbuchungen.

OpenClawRadar
OpenClaw A2A Plugin: Direkte Agent-zu-Agent-Kommunikation über das Internet
Werkzeuge

OpenClaw A2A Plugin: Direkte Agent-zu-Agent-Kommunikation über das Internet

Ein OpenClaw A2A-Plugin ermöglicht die direkte Übertragung von Dateien und Nachrichten zwischen OpenClaws und anderen Agenten über das Internet ohne Drittanbieterdienste wie WhatsApp oder E-Mail.

OpenClawRadar
Ein 6.400 Dollar lokaler LLM-Server: TCO-Vergleich vs. API-Kosten
Werkzeuge

Ein 6.400 Dollar lokaler LLM-Server: TCO-Vergleich vs. API-Kosten

Ein Entwickler teilt eine detaillierte Gesamtkostenanalyse für einen lokalen Server mit 4x MI100, der llama.cpp nutzt, im Vergleich zu API-Äquivalenten wie OpenAI und Z.AI-Coding-Pläne.

OpenClawRadar