Der MemAware-Benchmark zeigt, dass RAG-basierte Agentenspeicher bei der impliziten Kontextabfrage versagen.

✍️ OpenClawRadar📅 Veröffentlicht: 27. März 2026🔗 Source
Der MemAware-Benchmark zeigt, dass RAG-basierte Agentenspeicher bei der impliziten Kontextabfrage versagen.
Ad

Der MemAware-Benchmark schließt eine Lücke in bestehenden Tests für Agentengedächtnisse, indem er bewertet, ob KI-Agenten relevante frühere Kontexte abrufen können, wenn Nutzer nicht explizit danach fragen. Die meisten aktuellen Agentengedächtnissysteme folgen einem einfachen Muster: Nutzer fragt etwas → Agent durchsucht das Gedächtnis → ruft Ergebnisse ab → antwortet. Dies funktioniert gut für explizite Abfragen wie "Welche Datenbankentscheidung wurde getroffen?", scheitert jedoch, wenn der Kontext implizit ist.

Was MemAware testet

Der Benchmark umfasst 900 Fragen über drei Schwierigkeitsgrade, die das Abrufen impliziter Kontexte testen:

  • Einfach: Fragen mit Schlüsselwortüberschneidungen (z. B. "Auf welche Uhrzeit sollte ich meinen Wecker für mein 8:30-Meeting stellen?" sollte an eine 45-minütige Pendelzeit erinnern)
  • Mittel: Fragen innerhalb derselben Domäne
  • Schwer: Domänenübergreifende Fragen ohne Schlüsselwortverbindungen (z. B. "Ford Mustang benötigt einen Luftfilter, wo kann ich meine Treuerabatte nutzen?" sollte daran erinnern, dass der Nutzer bei Target einkauft)
Ad

Benchmark-Ergebnisse

Tests mit lokaler BM25 + Vektorsuche zeigten erhebliche Einschränkungen:

  • Einfache Stufe: 6,0 % Genauigkeit
  • Mittlere Stufe: 3,7 % Genauigkeit
  • Schwere Stufe: 0,7 % Genauigkeit – im Wesentlichen dasselbe wie ohne Gedächtnis (0,8 %)

Die schwere Stufe repräsentiert ungelöste Probleme, bei denen Suchanfragen Konzepte nicht über Domänen hinweg verbinden. Der Benchmark-Autor schlägt vor, dass effektive Lösungen möglicherweise "eine Art vorab geladene Übersicht über die vollständige Nutzerhistorie anstelle einer abfragebasierten Abfrage" erfordern.

Praktische Implikationen

Dies verdeutlicht eine grundlegende Einschränkung aktueller RAG-basierter Agentengedächtnissysteme. Wenn Nutzer nicht die richtigen Schlüsselwörter verwenden oder Verbindungen verschiedene Domänen überspannen, versagen Standard-Suchansätze beim Abrufen relevanter Kontexte. Der Datensatz und das Test-Framework sind unter MIT-Lizenz quelloffen, sodass Entwickler ihre eigenen Gedächtnissysteme testen können.

📖 Read the full source: r/LocalLLaMA

Ad

👀 Siehe auch

Claude Desktop + Blender via MCP: Echtzeit-3D-Workflow schließt die Feedback-Schleife
Werkzeuge

Claude Desktop + Blender via MCP: Echtzeit-3D-Workflow schließt die Feedback-Schleife

Ein Open-Source-Blender-Add-on führt einen MCP-Server in Blender aus, sodass Claude Desktop Szenen untersuchen, Objekte erstellen, Bilder rendern und Ergebnisse lesen kann – und schließt damit die Feedback-Schleife des Skript-Einfügens.

OpenClawRadar
SmallClaw V1.0.3 fügt Webhooks, n8n-Automatisierung und MCP-Server-Unterstützung hinzu
Werkzeuge

SmallClaw V1.0.3 fügt Webhooks, n8n-Automatisierung und MCP-Server-Unterstützung hinzu

SmallClaw V1.0.3 führt Webhook-Endpunkte für externe Dienstauslöser, lokale Automatisierungs-Workflows mit n8n und MCP-Server-Verbindungen für Tool-Integration ein. Das Update behält den Fokus des Tools auf den Betrieb mit kleinen lokalen LLMs bei.

OpenClawRadar
Claude Code Matrix Channel Plugin in Rust mit E2EE-Unterstützung erstellt
Werkzeuge

Claude Code Matrix Channel Plugin in Rust mit E2EE-Unterstützung erstellt

Ein Entwickler hat ein Matrix-Kanal-Plugin für Claude Code in Rust erstellt, das Unterstützung für Text, Dateien, Bilder mit E2EE-Entschlüsselung, Antwort-Threads, Reaktionen und Bot-Befehle bietet. Die 14 MB große Binärdatei ist unter der MIT-Lizenz lizenziert und funktioniert mit jedem Matrix-Homeserver.

OpenClawRadar
Relay: Ein Tool zur Übergabe von Claude-Code-Sitzungen an andere KI-Agenten
Werkzeuge

Relay: Ein Tool zur Übergabe von Claude-Code-Sitzungen an andere KI-Agenten

Relay ist ein Rust-Binary, das den Sitzungskontext von Claude Code extrahiert – einschließlich Gesprächsverlauf, Tool-Aufrufe, Fehler und Git-Status – und ihn an andere KI-Agenten wie Codex oder Gemini weitergibt, wenn Ratenlimits erreicht werden. Es unterstützt 8 Agenten und kann über GitHub oder npm installiert werden.

OpenClawRadar