개발자가 공유하는 하이브리드 AI 코딩 워크플로우: 계획은 Claude, 실행은 로컬 모델

하이브리드 AI 코딩 워크플로우로 클라우드 비용 절감
r/LocalLLaMA의 한 개발자가 코딩 품질을 유지하면서 토큰 비용을 줄이기 위해 클라우드와 로컬 AI 모델을 결합한 상세한 워크플로우를 공유했습니다. 이 접근법은 많은 코딩 작업이 비싼 클라우드 모델을 필요로 하지 않는다는 인식에 대응합니다.
워크플로우 아키텍처
이 시스템은 "클라우드에서 추론, 로컬에서 실행" 논리를 따릅니다:
- 플래너 (Claude 3.5 Sonnet): 작업을 받아 지침, 파일 경로, 논리를 포함한 정확한
task_context.md파일을 생성합니다. 이는 약 300-500 토큰이 소요됩니다. - 코더 (Ollama를 통한 로컬 Qwen2.5-Coder 30B): 명세서와 실제 파일 내용을 받아 코드를 작성합니다. 이는 로컬에서 실행되어 비용이 발생하지 않습니다.
- 검증자: 간단한 Bash 스크립트가
tsc --noEmit또는mypy를 실행하여 타입 검사를 수행합니다. - 검토자 (로컬 Qwen2.5-Coder 7B): 명백한 논리적 결함을 확인하기 위해 병렬로 실행됩니다.
- 자동 수정: 빌드가 실패하면 오류 로그가 로컬 코더로 돌아가 2-3회 반복됩니다.
구현 세부사항
전체 파이프라인은 Ollama API와 통신하기 위해 jq와 curl만 사용하는 일련의 Bash 스크립트로 래핑되었습니다. 이 시스템은 플래너의 출력을 기반으로 언어 표준(TypeScript, Python, C++ 등)을 자동 감지하며 무거운 Python/Node 런타임이 필요하지 않습니다.
해당 개발자는 로컬 모델(30B 규모도)이 복잡한 아키텍처 추론에서는 종종 실패하지만, 명확한 명세서가 주어지면 실행 측면에서 놀라울 정도로 뛰어나다고 언급했습니다.
결과 및 절감 효과
12개 파일이 변경된 최근 TypeScript 프로젝트에서:
- Claude 사용은 초기 계획 단계로만 제한되었습니다
- 로컬 모델이 나머지 모든 작업(12개 파일 작성, 린팅, 검토)을 처리했습니다
- 총 절감액: Claude Code CLI 내에서 모든 작업을 수행하는 것과 비교해 약 85%의 토큰 감소
해당 개발자는 구현 세부사항에 관심 있는 사람들을 위해 GitHub의 ai-orchestrator라는 저장소(사용자명: Mybono)에서 스크립트를 공개했습니다.
📖 Read the full source: r/LocalLLaMA
👀 See Also

Claude MCP로 Jira 스프린트 조회: 즉시 상태, 미할당 이슈, 차단 항목
레딧 사용자가 MCP를 통해 Jira를 Claude에 연결한 후, 스프린트에 대해 평범한 언어로 질문하자 즉시 깔끔한 표를 얻었습니다 — 보드를 클릭할 필요 없이.

OpenClaw Wrappers로 자동화를 간소화하기
OpenClaw Wrappers는 AI 코딩 에이전트를 효율적으로 관리하는 방법을 제공합니다. 구체적인 명령어 예시와 커뮤니티 피드백을 통해 기존 프레임워크에 쉽게 통합되는 이 도구들의 활용법을 알아보세요.

AI 코딩 에이전트를 위한 교차 모델 검토 루프가 치명적인 계획 결함을 포착합니다
한 개발자가 코딩 에이전트의 계획을 실행 전에 두 번째 AI 모델이 검토하는 교차 모델 검토 시스템을 구축했습니다. 이 시스템은 롤백 실패와 보안 허점 같은 치명적 결함을 포착합니다. 이 도구는 MIT 라이선스로 배포되며 TUI 대시보드를 포함합니다.

LLM 숨겨진 에이전시 신호(Â)를 활용한 향상된 도구 호출
개발자가 LLM이 AUC > 0.94로 도구 호출을 예측하는 선형 분리 가능한 숨겨진 상태 방향인 Â를 가지고 있음을 발견했습니다. 이 신호를 사용하여 도구 호출을 강제하면 Qwen3-1.7B 성능이 26.7%에서 85%로 향상되었으며(+58% 이득), 도구 미사용 실패가 43%에서 2.6%로 감소했습니다.