로컬 AI를 위한 Ollama와 MCP로 구축된 다중 에이전트 커리어 멘토

한 개발자가 'AI 커리어 멘토'라는 멀티 에이전트 AI 시스템을 구축했습니다. 이 시스템은 이력서를 읽고 포괄적인 커리어 인텔리전스 보고서를 생성합니다. 시스템은 Ollama와 llama3를 사용하여 완전히 로컬에서 실행되며, API 키나 외부 비용이 필요하지 않습니다.
기술 아키텍처
이 시스템은 출력을 연결하는 5개의 전문 에이전트로 구성됩니다:
- 각 에이전트는 이전 에이전트의 출력을 공유 컨텍스트로 받습니다
- 로드맵 에이전트는 분석 에이전트로부터 기술 격차를 인식합니다
- 급여 에이전트는 이전 에이전트로부터 로드맵을 인식합니다
- 이 연결 방식은 보고서가 파이프라인을 통해 진행될수록 점점 더 스마트해지도록 만듭니다
기술 스택 세부사항
- AI 엔진: Ollama + llama3 (100% 로컬)
- RAG 시스템: FAISS + SentenceTransformers (지식 베이스 인덱싱용)
- 도구 계층: MCP (Model Context Protocol) - FastAPI가 MCP 서버를 하위 프로세스로 생성하고 stdio JSON-RPC를 통해 통신합니다
- 이력서 처리: PDF 이력서 읽기용 pdfplumber
- 프론트엔드: React
MCP 구현 노트
개발자는 MCP 구축이 특히 흥미로웠다고 합니다. MCP는 Anthropic의 AI와 도구를 연결하기 위한 개방형 표준으로, 하나의 서버가 모든 클라이언트와 작동할 수 있습니다. 시스템은 또한 구성 파일을 통해 Claude Desktop에 연결되어 Claude가 9개의 모든 도구를 직접 호출할 수 있도록 합니다.
발견된 주목할 만한 버그: MCP SDK v1.x가 핸들러 시그니처를 완전히 변경했습니다. 이전 코드는 전체 요청 객체를 전달하는 반면, 새 코드는 이름과 인수를 직접 언패킹합니다. 이로 인해 상당한 디버깅 시간이 소요되었습니다.
보고서 출력
시스템은 다음을 포함한 완전한 커리어 인텔리전스 보고서를 생성합니다:
- 이력서 분석
- 기술 격차 식별
- 6개월 로드맵
- 급여 전략
- 면접 준비
모든 구성 요소는 이력서 처리 후 일괄적으로 실행됩니다.
리소스
이 프로젝트는 GitHub에서 확인할 수 있으며 비디오 워크스루가 제공됩니다. 개발자는 RAG 설정과 MCP 클라이언트/서버 배선이 구현하기 가장 까다로운 부분이었다고 언급합니다.
📖 Read the full source: r/LocalLLaMA
👀 See Also

LLMSpend: Anthropic 및 OpenAI SDK용 오픈소스 비용 추적기
LLMSpend는 두 줄의 코드로 Anthropic 및 OpenAI SDK 호출에 비용 추적 기능을 추가하는 Python 라이브러리입니다. 외부로 데이터를 전송하지 않고 로컬 SQLite 저장소, CLI 보고서, 웹 대시보드를 제공합니다.

OpenBridge: Slack/Discord를 통한 Claude 코드 무료 오픈소스 원격 제어
OpenBridge는 Slack이나 Discord를 통해 Claude Code를 제어할 수 있는 무료 오픈소스 도구로, 프로젝트를 채널로, 대화를 스레드로 구성합니다. 로컬이나 VPS에서 실행되며 기존 Claude Code/Codex 구독과 함께 작동하여 추가 API 비용이 발생하지 않습니다.

Echo-TTS를 Apple Silicon에 MLX로 포팅하여 네이티브 TTS와 음성 복제 기능 구현
Echo-TTS는 음성 복제 기능이 있는 24억 개의 파라미터를 가진 확산 텍스트-음성 변환 모델로, CUDA에서 MLX를 사용하여 Apple M 시리즈 실리콘에서 네이티브로 실행되도록 포팅되었습니다. 기본 16GB M4 Mac mini에서 5초 음성 복제는 약 10초, 30초 복제는 약 60초가 소요됩니다.

Hipocampus: 압축 트리를 사용하는 AI 에이전트용 지속적 메모리 시스템
Hipocampus는 압축 트리를 구현하여 대화 기록을 다섯 단계(원본 → 일별 → 주별 → 월별 → 루트)로 압축하고, ROOT.md라는 주제 인덱스를 통해 AI 에이전트가 세션 간 컨텍스트를 잊는 문제를 해결합니다.