클로드를 위한 지속적 메모리: MCP 기반 로컬 스택, 39ms 검색, 82% 토큰 감소

✍️ OpenClawRadar📅 게시일: May 8, 2026🔗 Source
클로드를 위한 지속적 메모리: MCP 기반 로컬 스택, 39ms 검색, 82% 토큰 감소
Ad

한 Reddit 사용자가 Claude용 로컬 영구 메모리 레이어를 구축하여 세션 간 제로 컨텍스트 문제를 해결했습니다. 스택은 완전히 로컬에서 실행되며(클라우드 없음, API 키 없음) MCP를 통해 통합됩니다. 주요 아키텍처: 4개 레이어(L0: SQLite의 추가 전용 이벤트 로그, L1: 지연된 구조화된 사실, L2/L3: 위키 산문, L4: 요약 + 결정 + 열린 스레드가 있는 결정화된 세션 노드), 벡터 검색용 Qdrant Docker, GPU에서 Qwen3-Embedding-4B와 CPU에서 Qwen3.5-2B-Q4_K_M을 사용하는 llama.cpp(임베딩 및 채팅용), 7가지 도구(retrieve, crystallize_session, list_sessions, get_l4_node, index_status, reindex, shutdown_models)를 노출하는 FastMCP 서버.

수치

  • grep+Read 기준 대비 토큰 감소: 평균 82.7%, 중앙값 86.2%.
  • 검색 F1: 기준 0.20 대비 0.50.
  • 임베딩 콜드 스타트 약 4초; 핫패스 p95 39ms(버그 수정 전 2241ms).
  • L4 세션 검색 평가: 평균 점수 0.920(게이트 0.6).
  • 104개 마크다운 파일에서 738개 청크 인덱싱.
Ad

핵심 교훈: Windows에서 연결 재사용

핫패스 검색이 4070 Ti Super에서 GPU 상주 임베딩을 사용함에도 p95가 2241ms에서 멈췄습니다. 원인: 모든 httpx.post()가 새 TCP 연결을 열었고, Windows 로컬호스트 핸드셰이크가 약 2초가 걸렸습니다. 지속적인 httpx.Client와 keep-alive로 전환하여 p95가 39ms로 떨어졌습니다—57배 속도 향상.

기타 놀라운 점

  • Qwen3 생각 모드: llama-server에서 chat_template_kwargs: {enable_thinking: false}--jinja를 통해 enable_thinking을 비활성화하지 않으면, 모델이 모든 토큰 예산을 생각 블록에 사용하고 빈 내용을 출력합니다.
  • MCP 등록: Claude Desktop의 에이전트 모드(Cowork)는 ~/.claude.json이 아닌 플러그인 구성 파일을 읽습니다. LKS 서비스는 적절한 Cowork .plugin 번들로 패키징되어야 합니다.

대상 사용자

Claude를 많이 사용하고 클라우드 의존 없이 비용 효율적이고 개인적인 로컬 메모리 레이어를 통해 세션 간 컨텍스트를 유지하려는 개발자.

📖 전체 소스 읽기: r/ClaudeAI

Ad

👀 See Also

cq: AI 코딩 에이전트를 위한 로컬-퍼스트 지식 공유 시스템
Tools

cq: AI 코딩 에이전트를 위한 로컬-퍼스트 지식 공유 시스템

Mozilla.ai의 cq는 로컬 SQLite 저장소를 통해 AI 코딩 에이전트가 일반적인 함정에 대한 '지식 단위'를 공유할 수 있게 해주는 오픈소스 도구로, Docker API를 통한 팀 공유 옵션도 제공합니다. Claude Code 플러그인 또는 OpenCode MCP 서버로 설치할 수 있습니다.

OpenClawRadar
클로드 코드 템플릿을 위한 맞춤형 음성 추출 과정
Tools

클로드 코드 템플릿을 위한 맞춤형 음성 추출 과정

개발자가 LLM-ism 금지 목록, 반-퍼포먼스 규칙, 형식별 음성 모드를 포함한 510줄의 SKILL.md 파일로 결과를 낸 Claude Code용 맞춤형 음성 스킬을 만들기 위한 3단계 추출 과정을 공유합니다. 이 오픈소스 템플릿은 10개 이상의 글 샘플을 사용하여 모든 언어에서 작동합니다.

OpenClawRadar
원격 상호 작용을 위해 채팅 앱에 Claude 코드 연결하기
Tools

원격 상호 작용을 위해 채팅 앱에 Claude 코드 연결하기

cc-connect라는 GitHub 프로젝트는 Claude Code를 Slack과 Telegram 같은 메시징 플랫폼에 연결하여 로컬 머신을 노출하지 않고도 원격 상호작용을 가능하게 합니다. 에이전트는 로컬에서 실행되며 작은 브리지가 에이전트와 채팅 앱 사이에서 메시지를 중계합니다.

OpenClawRadar
AI 기능: 자동화된 검증을 통한 런타임 코드 생성
Tools

AI 기능: 자동화된 검증을 통한 런타임 코드 생성

AI Functions는 구현 코드 대신 자연어 명세로 함수를 정의할 수 있는 Python 라이브러리로, 런타임에 LLM이 생성한 코드를 실행하고 실패 시 자동 재시도를 트리거하는 사후 조건으로 출력을 검증합니다.

OpenClawRadar