agentmemory V4 erreicht 96,2 % auf dem LongMemEval-Benchmark und übertrifft damit kommerzielle KI-Gedächtnissysteme.

✍️ OpenClawRadar📅 Veröffentlicht: 27. März 2026🔗 Source
agentmemory V4 erreicht 96,2 % auf dem LongMemEval-Benchmark und übertrifft damit kommerzielle KI-Gedächtnissysteme.
Ad

agentmemory V4 ist ein Open-Source-Speichersystem für KI-Agenten, das gerade einen Weltrekordwert von 96,2 % auf LongMemEval erzielt hat, dem Standard-Benchmark für das Langzeitgedächtnis von KI-Agenten.

Benchmark-Leistung

Das System übertraf mehrere geförderte KI-Speicherunternehmen:

  • PwC Chronos: 95,6 %
  • Mastra: 94,87 %
  • OMEGA: 93,2 % (roh)
  • Supermemory: 85,86 %
  • Emergence AI: 86 %
  • Zep: 71,2 %

Entwicklungsdetails

Allein in 16 Tagen auf einem Mittelklasse-Gaming-PC (i3-12100F) mit Gesamtkosten von 1.000 US-Dollar entwickelt. Das System nutzt Claude Opus als Generator und GPT-4o als Bewerter, aber die Abrufarchitektur ist die Kerninnovation.

Ad

Technische Architektur

Das System kombiniert mehrere Abruftechniken in einem einzigen SQLite-basierten System:

  • HNSW (Hierarchical Navigable Small World) für die approximative Suche nach nächsten Nachbarn
  • BM25 für traditionelle Textabfrage
  • Cross-Encoder für Relevanzbewertung
  • Integration von Wissensgraphen
  • Zeitliche Verankerung für zeitbewusste Speicherabrufe

Verfügbarkeit

Das System ist Open Source unter der MIT-Lizenz und verfügbar unter: github.com/JordanMcCann/agentmemory

📖 Read the full source: r/LocalLLaMA

Ad

👀 Siehe auch

Agenten beobachten: Echtzeit-Dashboard zur Überwachung von Claude-Code-Agenten-Teams
Werkzeuge

Agenten beobachten: Echtzeit-Dashboard zur Überwachung von Claude-Code-Agenten-Teams

Agents Observe ist ein lokales Dashboard, das Echtzeit-Beobachtbarkeit für Claude Code Agent-Sitzungen mithilfe von Hooks statt OTEL bietet. Es erfasst jeden Tool-Aufruf, die Agent-Hierarchie und Ereignisse mit Filter- und Suchfunktionen und läuft als Docker-Container, der automatisch mit Claude-Sitzungen startet.

OpenClawRadar
Kurzfassung schlägt Höhlenmensch-Plugin im Claude-Code-Kompressions-Benchmark
Werkzeuge

Kurzfassung schlägt Höhlenmensch-Plugin im Claude-Code-Kompressions-Benchmark

Ein Benchmark mit 24 Prompts zeigt, dass Claude Codes Höhlenmenschen-Komprimierungs-Plugin dieselbe Token-Anzahl und Qualität liefert wie das einfache Voranstellen von „sei kurz.“ – aber die konsistente Ausgabeform und Sicherheitsregeln des Plugins bieten strukturelle Vorteile.

OpenClawRadar
Pilot Shell: Eine strukturierte Workflow-Schicht für Claude Code
Werkzeuge

Pilot Shell: Eine strukturierte Workflow-Schicht für Claude Code

Pilot Shell fügt spezifikationsgesteuerte TDD-Workflows, Qualitäts-Hooks, Context Engineering und Token-Optimierung auf Basis von Claude Code hinzu – ohne die Komplexität von Multi-Agenten-Frameworks.

OpenClawRadar
YouTube-Transkript MCP verbessert den Claude-Forschungs-Workflow
Werkzeuge

YouTube-Transkript MCP verbessert den Claude-Forschungs-Workflow

Ein YouTube-Transkript-MCP ermöglicht es Claude, vollständige Transkripte mit Zeitstempeln von YouTube-Links abzurufen, wodurch manuelles Wechseln zwischen Tabs und Kopieren-Einfügen entfällt. Der Nutzer berichtet von deutlich besseren Antworten, wenn Claude tatsächliche Transkripte anstelle von Nutzerzusammenfassungen hat.

OpenClawRadar