클로드를 위한 지속적 메모리: MCP 기반 로컬 스택, 39ms 검색, 82% 토큰 감소

한 Reddit 사용자가 Claude용 로컬 영구 메모리 레이어를 구축하여 세션 간 제로 컨텍스트 문제를 해결했습니다. 스택은 완전히 로컬에서 실행되며(클라우드 없음, API 키 없음) MCP를 통해 통합됩니다. 주요 아키텍처: 4개 레이어(L0: SQLite의 추가 전용 이벤트 로그, L1: 지연된 구조화된 사실, L2/L3: 위키 산문, L4: 요약 + 결정 + 열린 스레드가 있는 결정화된 세션 노드), 벡터 검색용 Qdrant Docker, GPU에서 Qwen3-Embedding-4B와 CPU에서 Qwen3.5-2B-Q4_K_M을 사용하는 llama.cpp(임베딩 및 채팅용), 7가지 도구(retrieve, crystallize_session, list_sessions, get_l4_node, index_status, reindex, shutdown_models)를 노출하는 FastMCP 서버.
수치
- grep+Read 기준 대비 토큰 감소: 평균 82.7%, 중앙값 86.2%.
- 검색 F1: 기준 0.20 대비 0.50.
- 임베딩 콜드 스타트 약 4초; 핫패스 p95 39ms(버그 수정 전 2241ms).
- L4 세션 검색 평가: 평균 점수 0.920(게이트 0.6).
- 104개 마크다운 파일에서 738개 청크 인덱싱.
핵심 교훈: Windows에서 연결 재사용
핫패스 검색이 4070 Ti Super에서 GPU 상주 임베딩을 사용함에도 p95가 2241ms에서 멈췄습니다. 원인: 모든 httpx.post()가 새 TCP 연결을 열었고, Windows 로컬호스트 핸드셰이크가 약 2초가 걸렸습니다. 지속적인 httpx.Client와 keep-alive로 전환하여 p95가 39ms로 떨어졌습니다—57배 속도 향상.
기타 놀라운 점
- Qwen3 생각 모드: llama-server에서
chat_template_kwargs: {enable_thinking: false}와--jinja를 통해enable_thinking을 비활성화하지 않으면, 모델이 모든 토큰 예산을 생각 블록에 사용하고 빈 내용을 출력합니다. - MCP 등록: Claude Desktop의 에이전트 모드(Cowork)는
~/.claude.json이 아닌 플러그인 구성 파일을 읽습니다. LKS 서비스는 적절한 Cowork .plugin 번들로 패키징되어야 합니다.
대상 사용자
Claude를 많이 사용하고 클라우드 의존 없이 비용 효율적이고 개인적인 로컬 메모리 레이어를 통해 세션 간 컨텍스트를 유지하려는 개발자.
📖 전체 소스 읽기: r/ClaudeAI
👀 See Also

cq: AI 코딩 에이전트를 위한 로컬-퍼스트 지식 공유 시스템
Mozilla.ai의 cq는 로컬 SQLite 저장소를 통해 AI 코딩 에이전트가 일반적인 함정에 대한 '지식 단위'를 공유할 수 있게 해주는 오픈소스 도구로, Docker API를 통한 팀 공유 옵션도 제공합니다. Claude Code 플러그인 또는 OpenCode MCP 서버로 설치할 수 있습니다.

클로드 코드 템플릿을 위한 맞춤형 음성 추출 과정
개발자가 LLM-ism 금지 목록, 반-퍼포먼스 규칙, 형식별 음성 모드를 포함한 510줄의 SKILL.md 파일로 결과를 낸 Claude Code용 맞춤형 음성 스킬을 만들기 위한 3단계 추출 과정을 공유합니다. 이 오픈소스 템플릿은 10개 이상의 글 샘플을 사용하여 모든 언어에서 작동합니다.

원격 상호 작용을 위해 채팅 앱에 Claude 코드 연결하기
cc-connect라는 GitHub 프로젝트는 Claude Code를 Slack과 Telegram 같은 메시징 플랫폼에 연결하여 로컬 머신을 노출하지 않고도 원격 상호작용을 가능하게 합니다. 에이전트는 로컬에서 실행되며 작은 브리지가 에이전트와 채팅 앱 사이에서 메시지를 중계합니다.

AI 기능: 자동화된 검증을 통한 런타임 코드 생성
AI Functions는 구현 코드 대신 자연어 명세로 함수를 정의할 수 있는 Python 라이브러리로, 런타임에 LLM이 생성한 코드를 실행하고 실패 시 자동 재시도를 트리거하는 사후 조건으로 출력을 검증합니다.