클로드를 위한 지속적 메모리: MCP 기반 로컬 스택, 39ms 검색, 82% 토큰 감소

한 Reddit 사용자가 Claude용 로컬 영구 메모리 레이어를 구축하여 세션 간 제로 컨텍스트 문제를 해결했습니다. 스택은 완전히 로컬에서 실행되며(클라우드 없음, API 키 없음) MCP를 통해 통합됩니다. 주요 아키텍처: 4개 레이어(L0: SQLite의 추가 전용 이벤트 로그, L1: 지연된 구조화된 사실, L2/L3: 위키 산문, L4: 요약 + 결정 + 열린 스레드가 있는 결정화된 세션 노드), 벡터 검색용 Qdrant Docker, GPU에서 Qwen3-Embedding-4B와 CPU에서 Qwen3.5-2B-Q4_K_M을 사용하는 llama.cpp(임베딩 및 채팅용), 7가지 도구(retrieve, crystallize_session, list_sessions, get_l4_node, index_status, reindex, shutdown_models)를 노출하는 FastMCP 서버.
수치
- grep+Read 기준 대비 토큰 감소: 평균 82.7%, 중앙값 86.2%.
- 검색 F1: 기준 0.20 대비 0.50.
- 임베딩 콜드 스타트 약 4초; 핫패스 p95 39ms(버그 수정 전 2241ms).
- L4 세션 검색 평가: 평균 점수 0.920(게이트 0.6).
- 104개 마크다운 파일에서 738개 청크 인덱싱.
핵심 교훈: Windows에서 연결 재사용
핫패스 검색이 4070 Ti Super에서 GPU 상주 임베딩을 사용함에도 p95가 2241ms에서 멈췄습니다. 원인: 모든 httpx.post()가 새 TCP 연결을 열었고, Windows 로컬호스트 핸드셰이크가 약 2초가 걸렸습니다. 지속적인 httpx.Client와 keep-alive로 전환하여 p95가 39ms로 떨어졌습니다—57배 속도 향상.
기타 놀라운 점
- Qwen3 생각 모드: llama-server에서
chat_template_kwargs: {enable_thinking: false}와--jinja를 통해enable_thinking을 비활성화하지 않으면, 모델이 모든 토큰 예산을 생각 블록에 사용하고 빈 내용을 출력합니다. - MCP 등록: Claude Desktop의 에이전트 모드(Cowork)는
~/.claude.json이 아닌 플러그인 구성 파일을 읽습니다. LKS 서비스는 적절한 Cowork .plugin 번들로 패키징되어야 합니다.
대상 사용자
Claude를 많이 사용하고 클라우드 의존 없이 비용 효율적이고 개인적인 로컬 메모리 레이어를 통해 세션 간 컨텍스트를 유지하려는 개발자.
📖 전체 소스 읽기: r/ClaudeAI
👀 See Also

Godmode 플러그인, Claude Code 및 기타 AI 코딩 에이전트에 자율 반복 루프 기능 추가
Godmode는 Claude Code에 자율적인 측정-수정-검증 루프를 추가하는 오픈소스 플러그인으로, 병렬 에이전트, 실패 메모리, 최적화, 보안 감사, TDD를 포함한 126가지 기능을 제공합니다. Cursor, Codex, Gemini CLI, OpenCode와 호환됩니다.

RRF를 활용한 하이브리드 검색은 순수 벡터 검색보다 AI 메모리 시스템을 향상시킵니다
PostgreSQL와 pgvector를 사용하는 오픈소스 AI 메모리 시스템은 순수 벡터 검색만으로는 정확한 일치 검색에 부족함을 발견했습니다. 그래서 전문 검색을 추가하고 k=60의 Reciprocal Rank Fusion(RRF)을 사용해 결과를 병합했으며, 토크나이저를 통한 쿼리 강화도 적용했습니다.

인터랙티브 웹사이트가 Claude 코드 프로젝트 구조를 시뮬레이션합니다
개발자가 exploreclaudecode.com을 구축했으며, 이는 기능적인 파일 트리, 구성 가능한 파일 및 터미널 패널을 갖춘 Claude Code 프로젝트의 브라우저 기반 시뮬레이션입니다. 이 사이트는 .claude/ 디렉토리, 설정 파일, 스킬, 에이전트, 훅 및 MCP 구성이 함께 작동하는 방식을 설명합니다.

토탈 리콜: 클로드 코드 대화 기록을 위한 로컬 지식 그래프
토탈 리콜은 Claude Code의 JSONL 대화 기록을 SQLite 데이터베이스에 수집하여 전체 텍스트 검색과 벡터 임베딩을 제공하는 오픈소스 시스템으로, 세션 간 대화 기록을 검색 가능하게 만듭니다. 이 시스템은 DAG 인식 컨텍스트로 실제 대화 발췌문을 검색하며 ChatGPT 가져오기 기능을 포함합니다.