MemAware 벤치마크, AI 기억력을 키워드 검색 이상으로 테스트하다

MemAware는 메모리가 있는 AI 어시스턴트가 현재 쿼리가 해당 정보를 명시적으로 암시하지 않을 때 과거 대화에서 관련 컨텍스트를 표면화할 수 있는지 테스트하기 위해 설계된 오픈소스 벤치마크입니다.
벤치마크 작동 방식
이 벤치마크는 세 가지 난이도에 걸쳐 900개의 질문을 포함합니다. 관련 컨텍스트가 메모리에 존재하지만 현재 질문에 검색 일치를 유발할 키워드가 포함되지 않은 시나리오를 테스트합니다. 예를 들어: 몇 달 전에 AI 어시스턴트에게 45분 통근 시간에 대해 말했고, 나중에 "오전 8시 30분 회의를 위해 알람을 몇 시로 설정해야 하나요?"라고 묻습니다. 어시스턴트는 통근 시간을 고려해야 하지만, "알람 8:30 회의"를 검색하면 통근에 대한 대화를 찾을 수 없습니다.
주요 발견 사항
- 검색은 거의 도움이 되지 않음: BM25 검색은 메모리 없음 대비 2.8% vs 0.8%로 점수를 기록했으며, 이는 토큰을 5배 더 소모하는 미미한 개선입니다.
- 벡터 검색은 어려운 질문에서 실패함: 키워드가 겹칠 때는 도움이 되지만(6%), 도메인 간 연결에서는 0.7%로 떨어집니다 — 메모리가 없는 경우와 동일합니다. 어려운 질문 예시: "자선 경매에서 어떻게 입찰해야 하나요?"는 과거 $800 핸드백 구매를 지출 기준으로 상기시켜야 하지만, 임베딩 유사성은 이러한 개념을 연결할 수 없습니다.
- 검색하지 말아야 할 때 검색하는 것은 비용이 많이 듦: "항상 검색" 패턴은 결과가 도움이 되는지 여부와 관계없이 질문당 약 4.7K 토큰의 결과를 읽습니다. 대부분의 경우 결과는 관련 없는 노이즈입니다.
핵심 문제
현재 AI 메모리 구현은 본질적으로 검색 시스템에 불과합니다. 진정한 메모리 인식 — 저장된 정보가 무엇인지 알고 관련 컨텍스트를 사전에 표면화하는 것 — 은 검색만으로 해결할 수 없는 다른 문제입니다.
벤치마크는 다양한 접근 방식을 테스트할 수 있게 다음에서 이용 가능합니다: https://github.com/kevin-hs-sohn/memaware
📖 Read the full source: r/ClaudeAI
👀 See Also

Claude Code 세션 대시보드: 다중 세션 모니터링을 위한 오픈소스 도구
여러 개의 Claude Code 세션을 동시에 모니터링하는 오픈소스 대시보드로, 토큰 사용량, 비용, 세션 상태, 컨텍스트 창 사용량, 활성 서브에이전트를 보여줍니다. 설치에는 세 가지 명령어가 필요합니다: git clone, cd, npm install && npm start.

AI 에이전트 호환 CLI 도구: 스킬 디렉토리 접근법
Reddit 사용자가 SKILL.md 파일을 생성하여 AI 코딩 에이전트(Claude Code 등)에게 설치, 인증, 사용법을 가르치는 방법을 공유했습니다. 이 접근법은 대화형 프롬프트, JSON 출력, 인증 방법 등 일반적인 문제를 해결합니다.

MCP 서버는 쿠키와 인증 정보를 사용하여 AI 에이전트를 기존 Chrome 세션에 연결합니다.
@playwright-repl/mcp는 Dramaturg 확장 프로그램을 통해 AI 에이전트가 기존 Chrome 브라우저에 연결할 수 있는 MCP 서버로, 쿠키와 인증을 포함한 실제 브라우저 세션에 접근할 수 있습니다. 전체 Playwright JavaScript와 어설션을 지원하며 Claude Desktop, Claude Code, Cursor 또는 모든 MCP 클라이언트와 함께 작동합니다.

스킬 스캐폴더: 코드 작성 없이 OpenClaw 스킬 구축하기
Skill Scaffolder는 사용자가 일반 영어로 원하는 내용을 설명하여 OpenClaw 스킬을 만들 수 있게 해주는 오픈소스 도구입니다. YAML, Python 또는 설정 파일 없이도 전체 프로세스(사용자 인터뷰, 스킬 파일 작성, 테스트 및 설치)를 처리합니다.