로컬 RAG 도구, Nemotron Nano 9B v2 및 vLLM 도구 호출로 구축됨

기술 구현 세부사항
한 개발자가 단일 GPU에서 완전히 실행되는 로컬-퍼스트 RAG 연구 도구를 구축하는 접근 방식을 공유했습니다. 전체 백엔드는 단일 app.py 파일에 포함되어 있습니다.
스택 및 구성
이 도구는 RTX 5090 GPU에서 실행되는 FP16 양자화된 vLLM 상의 Nemotron Nano 9B v2 Japanese를 사용합니다. 백엔드는 FastAPI + SQLite FTS5 + Jinja2를 결합합니다. 도구 호출을 위해 개발자는 NVIDIA의 공식 파서 플러그인, 특히 --tool-call-parser nemotron_json과 --tool-parser-plugin을 사용하며, Nemotron v2는 내장 vLLM 파서(v3용) 대신 커스텀 파서 플러그인이 필요하다고 언급합니다.
주요 설계 결정
시스템은 추출 → 실행 두 단계 흐름을 구현합니다:
- 질문이 제기되면 시스템은 먼저 LLM을 통해 이중 언어 키워드(영어와 일본어)를 추출합니다
- 로컬 소스에 대한 FTS5 검색과 DuckDuckGo 웹 검색을 병렬로 실행합니다
- 사용자 선택을 위한 체크박스와 함께 결과를 표시합니다
- 사용자 선택 후에만 최종 응답을 생성합니다
이 접근 방식은 10만 개 이상의 토큰 컨텍스트를 덤프하고 모델이 알아내길 바라는 것을 피합니다.
성능 및 기능
- 도구 호출: 모델은 웹 검색 시기를 자율적으로 결정하며, 온도 0.1에서 놀랍도록 잘 작동합니다
- 접두사 캐시 워밍업: 소스 로드 시 모든 것을 캐싱하는 대신, 사용자가 소스 미리보기를 볼 때 KV 캐시가 워밍업됩니다. 사용자가 실행을 클릭할 때쯤이면 vLLM의
--enable-prefix-caching을 사용하여 접두사가 이미 캐시되어 있습니다 - 이중 언어 FTS5 검색: 사용자 쿼리 → Nemotron이 영어와 일본어로 키워드 추출 → OR-결합된 FTS5 MATCH 쿼리, 다국어 특허/연구 데이터에 효과적입니다
성능 수치
- ~80-120 토큰/초 출력
- 8192 최대 토큰
- 소스 추출: ~3-5초 (키워드 추출 + FTS5 + DDG 병렬)
- 5개 소스 + 3개 웹 결과를 포함한 전체 응답: RTX 5090에서 상세 답변에 대해 ~50초
설정 및 Source
소스 코드는 https://github.com/soy-tuber/SoyLM에서 확인할 수 있습니다. uv pip install -r requirements.txt로 설치할 수 있는 단일 파일 애플리케이션입니다. 별도로 Nemotron 파서 플러그인이 포함된 vLLM이 필요합니다.
📖 Read the full source: r/LocalLLaMA
👀 See Also

LLM 세션 드리프트 방지를 위한 7-파일 거버넌스 레이어
한 개발자가 Claude가 세션 간에 아키텍처 결정을 조용히 되돌리는 것을 방지하기 위해 7개의 파일로 구성된 거버넌스 레이어를 만들었습니다. 이 시스템에는 active_context.md, contracts.md, decisions.md 파일과 엄격한 실행 루프가 포함되어 있습니다.

헤들: 클로드 데스크톱 MCP 연결을 위한 신뢰 강화 및 감사 로깅
Heddle은 Claude Desktop의 MCP 연결에 신뢰 계층, 접근 제어 및 감사 로깅을 추가하는 오픈소스 도구로, 6개의 스타터 팩이 포함된 단일 인터페이스를 통해 여러 서비스를 안전하게 관리할 수 있도록 합니다.

마크다운 매니저: macOS용 간편한 마크다운 에디터
Markdown Manager는 문서 변환 및 미리보기 기능을 갖춘 무료 오픈소스 macOS 앱으로, Markdown 파일 관리를 위한 도구입니다.

클로드 디자인 vs 화수 디자인: HTML 레이아웃과 속도 제한 대결
Claude Design은 HTML 프로토타입을 빠르게 만들지만 속도 제한에 곧 도달합니다. 오픈소스인 Huashu-Design은 일반 구독으로 실행되며 별도의 속도 제한이 없지만, 5분 대신 20분이 소요됩니다.