Les tests de référence MemAware évaluent la mémoire de l'IA au-delà de la simple recherche par mots-clés.

✍️ OpenClawRadar📅 Publié: March 27, 2026🔗 Source
Les tests de référence MemAware évaluent la mémoire de l'IA au-delà de la simple recherche par mots-clés.
Ad

MemAware est un benchmark open-source conçu pour tester si les assistants IA dotés de mémoire peuvent faire remonter un contexte pertinent à partir de conversations passées lorsque les requêtes actuelles ne font pas explicitement référence à ces informations.

Fonctionnement du Benchmark

Le benchmark contient 900 questions réparties sur trois niveaux de difficulté. Il teste des scénarios où un contexte pertinent existe en mémoire, mais la question actuelle ne contient pas les mots-clés qui déclencheraient une correspondance de recherche. Par exemple : vous avez informé votre assistant IA de vos 45 minutes de trajet il y a des mois, puis plus tard vous demandez « À quelle heure dois-je régler mon réveil pour ma réunion à 8h30 ? » L'assistant devrait prendre en compte votre trajet, mais rechercher « réveil 8h30 réunion » ne trouvera pas les conversations sur le trajet.

Ad

Principales Constatations

  • La recherche aide à peine : La recherche BM25 a obtenu 2,8 % contre 0,8 % sans mémoire — une amélioration minime qui coûte 5 fois plus de tokens.
  • La recherche vectorielle échoue sur les questions difficiles : Elle aide lorsque les mots-clés se chevauchent (6 %) mais chute à 0,7 % sur les connexions inter-domaines — le même résultat que sans mémoire. Exemple de question difficile : « Combien devrais-je enchérir à la vente aux enchères caritative ? » devrait rappeler un achat passé d'un sac à main à 800 $ comme base de dépenses, mais la similarité d'embedding ne peut pas relier ces concepts.
  • Rechercher quand on ne devrait pas est coûteux : Le modèle « toujours rechercher » lit environ 4,7K tokens de résultats par question, qu'ils aident ou non. La plupart du temps, les résultats sont du bruit non pertinent.

Le Problème Central

Les implémentations actuelles de la mémoire IA sont essentiellement des systèmes de recherche. La véritable conscience de la mémoire — savoir quelles informations sont stockées et faire remonter proactivement un contexte pertinent — est un problème différent que la recherche seule ne peut résoudre.

Le benchmark est disponible pour tester différentes approches à l'adresse : https://github.com/kevin-hs-sohn/memaware

📖 Read the full source: r/ClaudeAI

Ad

👀 See Also

Serveur MCP Freddy connecte les wearables aux agents IA avec connexion sans interface
Tools

Serveur MCP Freddy connecte les wearables aux agents IA avec connexion sans interface

Freddy est un serveur MCP personnel qui connecte des wearables (Polar, Oura, Withings, Suunto, Intervals.icu, Hevy, plus WHOOP, Strava, Dexcom en bêta) à des clients IA comme Claude Code, ChatGPT et Notion AI via OAuth. Une nouvelle connexion sans tête (headless sign-in) permet des workflows planifiés pour des agents autonomes.

OpenClawRadar
Mandala v0.3 : Un runtime asynchrone open-source pour unifier la télémétrie logistique en tant que spans OpenTelemetry pour le raisonnement agentiel
Tools

Mandala v0.3 : Un runtime asynchrone open-source pour unifier la télémétrie logistique en tant que spans OpenTelemetry pour le raisonnement agentiel

Mandala v0.3 fournit un runtime asynchrone open-source qui ingère la télémétrie de Samsara, Descartes, Vizion et FMCSA via des webhooks, émet des événements sous forme de spans OpenTelemetry et expose les données via des outils MCP pour les agents LLM.

OpenClawRadar
Nexus Desktop App automatise la configuration MCP pour la gestion de campagnes TTRPG
Tools

Nexus Desktop App automatise la configuration MCP pour la gestion de campagnes TTRPG

Fatigué de modifier manuellement le fichier de configuration de Claude Desktop pour chaque MCP ? Nexus installe et configure Archivist, Foundry VTT, Notion, Obsidian et NotebookLM pour la gestion de campagnes TTRPG.

OpenClawRadar
Skir : Une alternative moderne aux Protocoles Buffers pour l'échange de données typé
Tools

Skir : Une alternative moderne aux Protocoles Buffers pour l'échange de données typé

Skir est un langage déclaratif pour définir des types de données, des constantes et des API qui génère du code idiomatique et type-safe en TypeScript, Python, Java, C++, Kotlin et Dart à partir d'un seul fichier .skir. Il inclut une sécurité intégrée pour l'évolution des schémas, un support RPC similaire à gRPC, et une sérialisation vers des formats JSON ou binaires.

OpenClawRadar