프로덕션 AI IDE에서 Ollama를 지원하는 다중 제공자 LLM 폴백 체인

프로덕션 AI IDE 플랫폼인 Resonant Genesis는 아키텍처에서 로컬 LLM 지원을 1급 제공자로 통합했습니다. 이 플랫폼은 30개 이상의 마이크로서비스에서 실행되며 로컬 모델을 Groq, OpenAI, Anthropic, Gemini와 같은 클라우드 제공자와 동등하게 취급합니다.
아키텍처와 통합
이 플랫폼은 모든 서비스에 볼륨 마운트된 공유 rg_llm 라이브러리인 UnifiedLLMClient를 사용합니다. LLM 기능이 필요한 모든 마이크로서비스는 이 동일한 클라이언트를 임포트합니다. 폴백 체인은 Groq → OpenAI → Anthropic → Gemini → Ollama/LM Studio 순으로 구성됩니다.
IDE의 씬 클라이언트 확장은 로컬 Ollama 모델을 자동으로 탐지하여 제공자 목록에 추가합니다. 사용자는 원하는 경우 시스템을 로컬 모델을 우선적으로 사용하도록 구성할 수 있습니다.
서버 측 오케스트레이션
모든 오케스트레이션은 서버 측에서 이루어지며, IDE는 UI를 렌더링하고 로컬 도구(파일 작업, 터미널, git)를 실행하며 Server-Sent Events(SSE)를 통해 결과를 스트리밍하는 씬 클라이언트 역할을 합니다. 에이전트 루프, 도구 선택, 시스템 프롬프트, LLM 라우팅은 모두 서버에서 처리됩니다.
로컬 모델을 사용할 때도 동일한 통제된 실행 파이프라인을 거칩니다:
- 사전 실행 정책 적용(작업 실행 전 차단)
- 제공자 API를 통한 네이티브 함수 호출(JSON 프롬프트 주입 없음)
- 모든 에이전트에 대한 암호화된 신원(Ethereum L2의 DSID)
- 선택한 LLM 제공자에 관계없이 사용 가능한 동일한 59개의 로컬 도구
로컬 LLM 사용자를 위한 이점
로컬에서 Ollama를 실행하는 사용자에게 이 아키텍처는 다음과 같은 이점을 제공합니다:
- 프라이버시: 씬 클라이언트 아키텍처는 바이너리에 회사 인텔리전스가 없음을 의미하며, 로컬 모델을 사용하면 프롬프트가 로컬에 유지됩니다
- 도구 사용: 프롬프트 주입된 JSON 스키마가 아닌 네이티브 함수 호출을 지원하는 59개의 로컬 도구
- 폴백: 로컬 모델이 복잡한 작업을 처리할 수 없는 경우 자동으로 클라우드 제공자로 폴백됩니다
개발자들은 로컬 모델을 실행하는 사용자들로부터 피드백을 구하고 있으며, 특히 작은 모델의 함수 호출 성능과 에이전트 도구 사용에 적합한 모델에 관한 의견을 원합니다.
이 프로젝트는 GitHub에서 오픈 소스로 제공되며, 도구 생태계를 시연하는 게스트 채팅은 dev-swat.com에서 라이브로 운영됩니다(클라우드 모델 사용).
📖 전체 소스 읽기: r/LocalLLaMA
👀 See Also

클로드리틱스: 클로드 코드 토큰 사용량 및 비용 추적을 위한 셀프 호스팅 대시보드
Claudlytics는 Claude Code의 로컬 .jsonl 세션 파일을 읽어 토큰 사용량과 비용을 실시간으로 추적하는 Node.js 웹 서버입니다. 127.0.0.1에서 로컬로 실행되며, 원격 서버의 경우 SSH 터널을 통해 접근할 수 있습니다.
Terry Tao, LLM 에이전트를 사용해 24개의 Java 애플릿을 JavaScript로 포팅하다 — 원본 코드에서 버그 발견
테렌스 타오가 LLM 코딩 에이전트를 사용하여 1999년에 만든 자바 애플릿 24개를 단 몇 시간 만에 자바스크립트로 포팅했습니다. 에이전트는 원본 코드에서 버그 2개를 찾아냈고, 드래그 처리 관련 사소한 버그 하나만 새로 만들었습니다.

PromptFlow 음성: 힌디어로 말하면 구조화된 클로드 코드 프롬프트를 받으세요 — 클로드 코드로 제작됨
개발자가 Claude Code와 Codex를 사용하여 PromptFlow Voice를 구축했습니다.이 데스크톱 앱은 자연어 힌디어 음성을 구조화된 개발 프롬프트(Claude Code용)나 바로 보낼 수 있는 이메일(Gmail용)로 변환합니다. 데모에서는 힌디어 음성 요청이 지수 백오프를 포함한 소켓 재연결 로직에 대한 영어 Claude Code 프롬프트를 생성하는 모습을 보여줍니다.

Semble: 클로드 코드용 로컬 MCP 서버, 토큰 98% 절감
Semble는 Claude Code를 위한 오픈소스 MCP 서버로, grep+read 워크플로우를 대체합니다. 임베딩, BM25, 재순위화를 사용하여 리포지토리를 약 250ms에 인덱싱하면서 토큰 사용량을 약 98% 줄입니다.