MemAwareベンチマークは、AIの記憶力をキーワード検索を超えてテストします

MemAwareは、記憶機能を持つAIアシスタントが、現在のクエリに明示的なヒントがない場合に、過去の会話から適切なコンテキストを想起できるかをテストするために設計されたオープンソースのベンチマークです。
ベンチマークの仕組み
このベンチマークには、3つの難易度レベルにわたる900の質問が含まれています。関連するコンテキストが記憶に存在するものの、現在の質問には検索マッチを引き起こすキーワードが含まれていないシナリオをテストします。例:数か月前にAIアシスタントに45分間の通勤時間について話した後、後で「午前8時30分の会議のためにアラームを何時に設定すべきですか?」と尋ねます。アシスタントは通勤時間を考慮すべきですが、「アラーム 8:30 会議」を検索しても、通勤に関する会話は見つかりません。
主な発見
- 検索はほとんど役に立たない: BM25検索は2.8%を記録し、記憶なしの0.8%と比較してわずかな改善ですが、トークンコストは5倍です。
- ベクトル検索は難しい質問で失敗する: キーワードが重なる場合には役立ちます(6%)が、ドメイン間の関連性では0.7%に低下します—記憶なしと同じです。難しい質問の例:「チャリティーオークションでどのように入札すべきですか?」は、過去の800ドルのハンドバッグ購入を支出の基準として思い出すべきですが、埋め込み類似性ではこれらの概念を関連付けることができません。
- 検索すべきでないときに検索するのはコストがかかる: 「常に検索」パターンは、結果が役に立つかどうかに関係なく、質問ごとに約4.7Kトークンの結果を読み取ります。ほとんどの場合、結果は無関係なノイズです。
核心的な問題
現在のAI記憶実装は、本質的に単なる検索システムです。真の記憶認識—どの情報が保存されているかを知り、関連するコンテキストを積極的に想起すること—は、検索だけでは解決できない別の問題です。
このベンチマークは、さまざまなアプローチをテストするために利用できます: https://github.com/kevin-hs-sohn/memaware
📖 Read the full source: r/ClaudeAI
👀 See Also

SIDJUAフレームワークは、自律型AIエージェントにガバナンス層を追加します。
SIDJUAは、APIを持つあらゆるAIモデルの上に構築された、組み込みガバナンス、ロールベースの権限ルール、完全な監査証跡を備えたフレームワークです。デモでは、3階層の階層構造が7+1階層までスケールし、すべての決定が記録され、コストがリアルタイムで追跡される様子が示されています。

OpenClawデベロッパーがUberとレストラン予約自動化でAIエージェントのブレークスルーを達成
OpenClawの開発者が、実際のウェブサイト上でUberの乗車予約とレストランの予約を自律的に完了するAIエージェントの作成に成功しました。ステルスブラウザ、住宅用プロキシ、CAPTCHA解決を組み合わせた技術スタックを用いて、ボット検出やCAPTCHAを回避しています。

Memento Vault:Claudeコードセッションの永続的コンテキストのためのローカルツール
Memento Vaultは、セッショントランスクリプトを自動的にキャプチャし、スコアリングし、ローカルのgitリポジトリにアトミックノートを保存する一連のフックです。BM25 + ベクトル検索によるゼロコストの検索を提供し、平均レイテンシは472msで、セッション開始時、すべてのプロンプト時、ファイル読み取り時に関連するコンテキストを注入します。

cldctrl: Claudeコードセッション管理用ターミナルダッシュボード
cldctrlは、プロジェクト間でClaude Codeセッションを起動および管理するためのターミナルダッシュボードを提供するnpmパッケージです。既存の~/.claudeデータを読み取り、プロジェクトを自動検出し、レート制限バー付きのトークン使用量を表示します。