MemAware-Benchmark testet KI-Gedächtnis über die Stichwortsuche hinaus

✍️ OpenClawRadar📅 Veröffentlicht: 27. März 2026🔗 Source
MemAware-Benchmark testet KI-Gedächtnis über die Stichwortsuche hinaus
Ad

MemAware ist ein Open-Source-Benchmark, der testen soll, ob KI-Assistenten mit Gedächtnis relevante Kontexte aus früheren Gesprächen abrufen können, wenn aktuelle Anfragen diese Informationen nicht explizit andeuten.

Wie der Benchmark funktioniert

Der Benchmark enthält 900 Fragen über drei Schwierigkeitsgrade. Er testet Szenarien, in denen relevante Kontexte im Gedächtnis existieren, die aktuelle Frage jedoch keine Schlüsselwörter enthält, die eine Suchtreffer auslösen würden. Beispiel: Sie erzählten Ihrem KI-Assistenten vor Monaten von Ihrer 45-minütigen Pendelstrecke und fragen später: „Auf welche Uhrzeit soll ich meinen Wecker für mein Meeting um 8:30 Uhr stellen?“ Der Assistent sollte Ihre Pendelzeit berücksichtigen, aber die Suche nach „Wecker 8:30 Meeting“ findet keine Gespräche über Pendeln.

Ad

Wichtige Erkenntnisse

  • Suche hilft kaum: BM25-Suche erzielte 2,8 % gegenüber 0,8 % ohne Gedächtnis – eine winzige Verbesserung, die das Fünffache an Tokens kostet.
  • Vektorsuche scheitert bei schwierigen Fragen: Sie hilft bei überlappenden Schlüsselwörtern (6 %), sinkt aber bei domänenübergreifenden Verbindungen auf 0,7 % – genauso wie ohne Gedächtnis. Beispiel für eine schwierige Frage: „Wie sollte ich bei der Wohltätigkeitsauktion bieten?“ sollte einen früheren Kauf einer Handtasche für 800 $ als Ausgabenbasis abrufen, aber Ähnlichkeit in Embeddings kann diese Konzepte nicht verbinden.
  • Suche, wenn man nicht sollte, ist teuer: Das Muster „immer suchen“ liest etwa 4,7 Tausend Tokens an Ergebnissen pro Frage, unabhängig davon, ob sie helfen. Meistens sind die Ergebnisse irrelevantes Rauschen.

Das Kernproblem

Aktuelle KI-Gedächtnisimplementierungen sind im Wesentlichen nur Suchsysteme. Echte Gedächtnisbewusstheit – zu wissen, welche Informationen gespeichert sind und relevante Kontexte proaktiv abzurufen – ist ein anderes Problem, das Suche allein nicht lösen kann.

Der Benchmark ist zum Testen verschiedener Ansätze verfügbar unter: https://github.com/kevin-hs-sohn/memaware

📖 Read the full source: r/ClaudeAI

Ad

👀 Siehe auch

Messung des Claude Code MCP-Stacks: Cache-Freundlichkeit vs. Byte-Ersparnis und eine 2-Zeilen-Korrektur für den Prompt-Cache
Werkzeuge

Messung des Claude Code MCP-Stacks: Cache-Freundlichkeit vs. Byte-Ersparnis und eine 2-Zeilen-Korrektur für den Prompt-Cache

Greg Shevchenko benchmarkt MCP-Kompressoren und Retrieval-Schichten entlang zweier Achsen: Byte-Einsparungen und Cache-Freundlichkeit. Ein 2-Zeilen-Fix (rg-Treffer sortieren, Map-Einträge sortieren) steigert den Cache von ~0% auf 100% ohne Verlust bei den Byte-Einsparungen. Open-Source-Harness inklusive.

OpenClawRadar
Snip: Open-Source-Tool reduziert Claude-Code-Tokenverbrauch mit YAML-Filtern
Werkzeuge

Snip: Open-Source-Tool reduziert Claude-Code-Tokenverbrauch mit YAML-Filtern

Snip ist ein in Go geschriebenes Tool, das zwischen Claude Code und der Shell sitzt und ausführliche Befehlsausgaben durch deklarative YAML-Pipelines filtert, um die Token-Nutzung um 60-90% zu reduzieren. Es enthält 16 kombinierbare Pipeline-Aktionen und funktioniert mit mehreren KI-Codierungsagenten.

OpenClawRadar
Gratis macOS Menüleisten-App zeigt Echtzeit-Claude-Nutzungsstatistiken via SQLite-Cookie-Entschlüsselung
Werkzeuge

Gratis macOS Menüleisten-App zeigt Echtzeit-Claude-Nutzungsstatistiken via SQLite-Cookie-Entschlüsselung

Claude Usage Tracker ist eine kostenlose macOS-Menüleisten-App, die die verschlüsselten SQLite-Cookies der Claude-Desktop-App ausliest, sie via Keychain entschlüsselt und Sitzungsprozente, wöchentliches Limit, Ausgaben und Routineläufe lokal anzeigt – kein API-Key erforderlich.

OpenClawRadar
Pneuma: Eine KI-generierte Desktop-Umgebung, in der sich Software aus Beschreibungen materialisiert
Werkzeuge

Pneuma: Eine KI-generierte Desktop-Umgebung, in der sich Software aus Beschreibungen materialisiert

Pneuma ist eine Desktop-Computing-Umgebung, in der Sie beschreiben, was Sie möchten – einen CPU-Monitor, ein Spiel, eine Notizen-App oder einen Datenvisualisierer – und innerhalb von Sekunden entsteht ein funktionierendes Programm. Das System generiert eigenständige Rust-Module, kompiliert sie zu WebAssembly und führt sie in isolierten Wasmtime-Instanzen mit GPU-Rendering über wgpu aus.

OpenClawRadar