AI 모델 선택 그만 묻기: 작업을 Haiku, Sonnet, Opus 계층으로 라우팅하세요

Reddit 사용자 u/spencer_kw는 매일 올라오는 "어떤 모델을 써야 하나요?" 게시물을 지적하며, 한 달 동안 작업 유형별로 라우팅한 구체적인 답변을 제시합니다. 핵심 통찰: 모든 작업에 최적인 단일 모델은 없으며, 최소 세 가지 등급으로 작업을 라우팅해야 합니다.
작업별 모델 등급
- 파일 읽기, 요약, 코드 질문 답변: 가장 저렴한 모델 사용 — Haiku, Qwen 3.6 via Ollama, Gemma 4. 파일 읽기에 Opus를 사용하는 것은 돈 낭비입니다.
- 코드, 테스트, 보일러플레이트 작성: Sonnet 등급 — GPT-5.5 mini, DeepSeek v4. 최고 성능 모델 비용의 일부로 견고한 생성 능력.
- 다중 파일 리팩터, 아키텍처, 복잡한 비동기 디버깅: Opus나 GPT-5.5가 필요한 유일한 경우. 이는 업무의 약 15-20%를 차지합니다.
실용적인 라우팅 설정
u/spencer_kw의 현재 분포:
- ~40% 작업 → Haiku 등급 (저렴한 읽기)
- ~35% → Sonnet 등급 (생성)
- ~25% → Opus 등급 (복잡한 추론)
월 총 지출: $30–40 (작업량에 따라 다름).
"데일리 드라이버"라는 접근 방식은 잘못되었습니다. 모든 것을 담당할 하나의 모델을 찾는 것은 화물 운송과 출퇴근을 모두 하는 하나의 차량을 찾는 것과 같습니다. 여러 모델을 사용하고 작업별로 라우팅하세요.
📖 전체 출처 읽기: r/openclaw
👀 See Also

지속적인 OpenClaw 에이전트 컨텍스트를 위한 3계층 메모리 아키텍처
한 개발자가 에이전트가 컨텍스트 없이 각 세션을 시작하는 것을 방지하기 위해 OpenClaw의 인프라 위에 3계층 메모리 시스템을 구축했습니다. 이 아키텍처에는 매 턴마다 주입되는 L1 작업공간 파일, L2 의미론적 메모리 검색, 필요 시 열리는 L3 참조 문서가 포함됩니다.

LLM 음성 문제: AI 생성 글쓰기 패턴 피하기
한 개발자가 LLM 지원 글쓰기의 일반적인 문제인 즉각적인 AI 감지를 유발하는 인식 가능한 'LLM-isms'에 대해 논의하며, 이러한 패턴을 식별하고 진정성을 위해 편집하는 방법에 관한 기사를 공유합니다.

로컬 백엔드로 Claude Code의 KV 캐시 무효화 문제 해결하기
Claude Code 버전 2.1.36 이상은 모든 요청에 동적 원격 측정 헤더와 git 상태 업데이트를 주입하여 프리픽스 매칭을 방해하고 llama.cpp와 같은 로컬 백엔드에서 전체 20K+ 토큰 시스템 프롬프트 재처리를 강제합니다. ~/.claude/settings.json의 구성 수정으로 처리 시간을 60초 이상에서 약 4초로 줄일 수 있습니다.

Opus 4.7, 프롬프트의 40%를 망가뜨렸다; 해결책은 CLAUDE.md와 스킬의 구조화였다
Opus 4.7이 출시된 후 6개 설정에서 약 40%의 프롬프트 성능이 저하되자, AI 책임자가 임시 프롬프트를 구조화된 Skill 파일, 계층적 CLAUDE.md, 그리고 별도의 메모리 파일로 대체하여 토큰 사용량을 22% 줄이고 반복 횟수를 3-4회에서 1-2회로 줄였습니다.