llmLibrarian: 파일 기반 AI 검색을 위한 MCP 통합 로컬 RAG 엔진

이것이 무엇인가요
llmLibrarian은 Model Context Protocol(MCP)을 통해 검색 기능을 노출하는 로컬 RAG(검색 증강 생성) 엔진입니다. 폴더를 실로(ChromaDB 컬렉션)로 인덱싱한 다음, Claude를 포함한 모든 MCP 클라이언트에서 쿼리하여 근거가 있고 인용된 답변을 얻을 수 있게 합니다.
주요 기능 및 아키텍처
이 도구는 폴더를 ChromaDB 컬렉션인 실로로 인덱싱합니다. 원시 청크 대신 직접적인 답변을 원할 때는 Ollama가 합성 계층을 처리합니다. 모든 것은 사용자의 기기에서 로컬로 실행됩니다.
개발자는 특히 다중 실로 기능을 강력하게 강조합니다: 실로를 결합하면 수동으로 파악하기 어려운 도메인 간 패턴이 표면화될 수 있습니다. 예를 들어, 저널 폴더는 사용자가 작성한 내용을 기억하는 사고 파트너가 되고, 코드베이스는 사용자의 실제 파일을 아는 에이전트가 됩니다.
노출된 MCP 도구
retrieve— Claude가 추론할 수 있도록 신뢰도 점수와 함께 원시 청크를 반환하는 하이브리드 RRF 벡터 검색retrieve_bulk— 문서 유형 간 집계 시 유용한 단일 호출 내 다중 각도 쿼리ask— 검색된 컨텍스트에서 직접 Ollama로 합성된 답변(기본값은 llama3.1:8b이지만, 사용자가 가져온 어떤 모델로든 교체 가능)list_silos,inspect_silo,trigger_reindex— 인덱스 관리 도구
기술 스택
- 벡터 저장을 위한 ChromaDB
- 모델 합성을 위한 Ollama
- 임베딩을 위한 sentence-transformers(all-mpnet-base-v2, MPS 가속)
- MCP 계층을 위한 fastmcp
개발자는 ChromaDB의 다중 실로 메타데이터 태깅이 올바르게 설정되기까지 여러 번의 반복이 필요했으며, 아키텍처에 대한 논의에 열려 있다고 언급합니다.
이러한 유형의 도구는 데이터를 외부 서비스로 전송하지 않고 로컬 파일을 참조하고 추론할 수 있는 AI 에이전트를 구축하려는 개발자에게 유용합니다.
📖 전체 Source 읽기: r/LocalLLaMA
👀 See Also

클로드 코드의 사양 기반 개발 워크플로우: 분해, 컨텍스트 정리 및 비용 관리
Claude Code를 위한 사양 기반 개발 접근법으로, 2차원 분해, 단계 간 컨텍스트 정리, 디스크에 사양 저장을 통해 에이전트 성능을 개선하고 비용을 절감합니다.
WorldClaw:大规模智能体3D开放世界生成
텐센트의 WorldClaw는 대규모 에이전트 기반 3D 오픈 월드 생성을 위한 새로운 시스템으로, 크고 상세한 가상 환경을 만드는 것을 목표로 합니다.

Sx: AI 스킬, MCP 및 명령어를 위한 오픈소스 패키지 매니저
Sx는 팀이 모든 AI 클라이언트(Claude Code, Cursor, Copilot, Gemini)에서 AI 구성을 공유, 버전 관리 및 범위 지정할 수 있도록 하는 스킬, MCP 설정, 명령, 후크 및 에이전트를 위한 비공개 npm 같은 패키지 관리자입니다.

Ninetails 메모리 엔진 V4.5: Int8 양자화 + LRU 캐시로 로컬 MCP 메모리를 60MB로 절감
Ninetails Memory Engine V4.5는 Int8 스칼라 양자화와 LRU 캐시 제거를 사용하여 임베딩당 벡터 저장 공간을 6KB에서 1.5KB로 줄여 전체 엔진을 40-60MB RAM으로 유지합니다. 완전히 로컬 SQLite 구현에서 70% 벡터 유사도와 30% BM25 검색을 결합합니다.