Der MemAware-Benchmark zeigt, dass RAG-basierte Agentenspeicher bei der impliziten Kontextabfrage versagen.

✍️ OpenClawRadar📅 Veröffentlicht: 27. März 2026🔗 Source
Der MemAware-Benchmark zeigt, dass RAG-basierte Agentenspeicher bei der impliziten Kontextabfrage versagen.
Ad

Der MemAware-Benchmark schließt eine Lücke in bestehenden Tests für Agentengedächtnisse, indem er bewertet, ob KI-Agenten relevante frühere Kontexte abrufen können, wenn Nutzer nicht explizit danach fragen. Die meisten aktuellen Agentengedächtnissysteme folgen einem einfachen Muster: Nutzer fragt etwas → Agent durchsucht das Gedächtnis → ruft Ergebnisse ab → antwortet. Dies funktioniert gut für explizite Abfragen wie "Welche Datenbankentscheidung wurde getroffen?", scheitert jedoch, wenn der Kontext implizit ist.

Was MemAware testet

Der Benchmark umfasst 900 Fragen über drei Schwierigkeitsgrade, die das Abrufen impliziter Kontexte testen:

  • Einfach: Fragen mit Schlüsselwortüberschneidungen (z. B. "Auf welche Uhrzeit sollte ich meinen Wecker für mein 8:30-Meeting stellen?" sollte an eine 45-minütige Pendelzeit erinnern)
  • Mittel: Fragen innerhalb derselben Domäne
  • Schwer: Domänenübergreifende Fragen ohne Schlüsselwortverbindungen (z. B. "Ford Mustang benötigt einen Luftfilter, wo kann ich meine Treuerabatte nutzen?" sollte daran erinnern, dass der Nutzer bei Target einkauft)
Ad

Benchmark-Ergebnisse

Tests mit lokaler BM25 + Vektorsuche zeigten erhebliche Einschränkungen:

  • Einfache Stufe: 6,0 % Genauigkeit
  • Mittlere Stufe: 3,7 % Genauigkeit
  • Schwere Stufe: 0,7 % Genauigkeit – im Wesentlichen dasselbe wie ohne Gedächtnis (0,8 %)

Die schwere Stufe repräsentiert ungelöste Probleme, bei denen Suchanfragen Konzepte nicht über Domänen hinweg verbinden. Der Benchmark-Autor schlägt vor, dass effektive Lösungen möglicherweise "eine Art vorab geladene Übersicht über die vollständige Nutzerhistorie anstelle einer abfragebasierten Abfrage" erfordern.

Praktische Implikationen

Dies verdeutlicht eine grundlegende Einschränkung aktueller RAG-basierter Agentengedächtnissysteme. Wenn Nutzer nicht die richtigen Schlüsselwörter verwenden oder Verbindungen verschiedene Domänen überspannen, versagen Standard-Suchansätze beim Abrufen relevanter Kontexte. Der Datensatz und das Test-Framework sind unter MIT-Lizenz quelloffen, sodass Entwickler ihre eigenen Gedächtnissysteme testen können.

📖 Read the full source: r/LocalLLaMA

Ad

👀 Siehe auch

Maus: Koordinatenbasierte Bearbeitung von Staging-Änderungen und atomares Rollback für KI-Code-Agenten
Werkzeuge

Maus: Koordinatenbasierte Bearbeitung von Staging-Änderungen und atomares Rollback für KI-Code-Agenten

Mouse ersetzt die String-Ersetzung durch sechs koordinatenbasierte Operationen (INSERT, DELETE, ADJUST) sowie gestaffelte Änderungen mit atomarem Rollback für KI-Agenten.

OpenClawRadar
Benutzerdefinierter GIF-Drehkreis für Claude Code über COLR-Schriftartkonvertierung
Werkzeuge

Benutzerdefinierter GIF-Drehkreis für Claude Code über COLR-Schriftartkonvertierung

Ein Entwickler hat eine Methode entwickelt, um die Standard-Ladeanimation von Claude Code durch eine beliebige animierte GIF-Datei zu ersetzen, indem das GIF in eine OpenType COLR-Farbfont konvertiert wird und die Animation so angepasst wird, dass sie durch Glyphen für jedes Einzelbild wechselt. Das Tool unterstützt derzeit Windows, mit geplanten Versionen für macOS und Linux.

OpenClawRadar
ClawHost Open-Source OpenClaw Ein-Klick-Bereitstellung erreicht über 200 GitHub-Sterne
Werkzeuge

ClawHost Open-Source OpenClaw Ein-Klick-Bereitstellung erreicht über 200 GitHub-Sterne

ClawHost, ein Open-Source-Tool für die Ein-Klick-Installation von OpenClaw mit vollem Serverzugriff und Kontrolle, hat über 200 GitHub-Sterne erreicht. Das Projekt behebt Probleme mit instabilen kommerziellen Wrappern, indem es eine kostenlose, selbst hostbare Lösung bietet.

OpenClawRadar
Googles HEIR-Compiler: Praktische private KI mit homomorpher Verschlüsselung
Werkzeuge

Googles HEIR-Compiler: Praktische private KI mit homomorpher Verschlüsselung

Google veröffentlicht HEIR als Open Source, einen Compiler, der es Entwicklern ermöglicht, KI-Inferenz auf verschlüsselten Daten auszuführen, ohne diese zu entschlüsseln. Zu den Demos gehören Betrugserkennung, Empfehlungen und mehr.

OpenClawRadar