추론 가격 분석 결과, 동일 모델에 대해 제공업체 간 4.4배 가격 차이 확인

AI 코딩 에이전트 추론 비용 분석
다양한 제공업체의 추론 가격을 분석한 결과, 동일한 모델 출력에 대해 최대 4.4배(표준 모델)에서 30배(추론 모델)까지 상당한 비용 차이가 존재하는 것으로 나타났습니다.
원본 자료의 주요 가격 데이터
Llama 3.1 70B Instruct(동일 모델, 동일 가중치) 기준:
- DeepInfra: 백만 토큰당 $0.20 / $0.27
- Hyperbolic: 백만 토큰당 $0.40 / $0.40
- Groq: 백만 토큰당 $0.59 / $0.79
- Fireworks: 백만 토큰당 $0.70 / $0.70
- Together: 백만 토큰당 $0.88 / $0.88
이는 동일한 API 호출에 대해 최저가(DeepInfra)와 최고가(Together) 제공업체 간 4.4배의 차이를 의미합니다.
사용 비용에 미치는 영향
하루 약 1천만 토큰을 처리하는 단일 에이전트 기준:
- DeepInfra: 연간 약 $876
- Together: 연간 약 $3,212
동일한 출력, 동일한 API 호출이지만 연간 $2,336의 차이가 발생합니다.
추론 모델 가격 차이
분석은 더욱 큰 가격 차이를 보이는 추론 모델로 확장됩니다:
- DeepSeek R1 (Hyperbolic): 백만 출력 토큰당 약 $2
- OpenAI o1: 백만 출력 토큰당 약 $60
이는 제공업체 간 약 30배의 가격 차이를 나타냅니다.
시장 관찰
원본 자료는 제공업체 간 가격이 예상보다 자주 변동하여 추론 서비스에 아직 확립된 "시장 가격"이 없다고 지적합니다. 저자는 현재 DeepInfra, Hyperbolic, Groq, Fireworks, Together, OpenAI, Anthropic, Akash의 가격을 추적 중입니다.
개발자 고려사항
이 분석은 AI 코딩 에이전트를 사용하는 개발자들에게 다음과 같은 실질적 질문을 제기합니다:
- 단일 제공업체에 고정할 것인지 vs 가격에 따라 라우팅할 것인지
- 가격 변동을 적극적으로 추적할 것인지 아니면 무시할 것인지
- 모니터링에 추가할 다른 제공업체는 무엇인지
📖 Read the full source: r/LocalLLaMA
👀 See Also

Anthropic, Claude 커넥터에서 Gmail 메시지 본문 액세스 제거
Anthropic이 Gmail 커넥터에서 gmail_read_message와 gmail_search_messages 도구를 제거하고, 메시지 본문이나 첨부 파일 내용을 반환하지 않는 get_thread와 search_threads로 대체했습니다.

알리바바, 기업 자동화를 위한 'Wukong' AI 플랫폼 출시
알리바바가 문서 편집, 스프레드시트 업데이트, 회의 녹취록 작성, 연구 등 복잡한 비즈니스 업무를 처리하기 위해 여러 에이전트를 조율하는 AI 플랫폼 'Wukong'을 출시했습니다. 현재 초대 전용 베타 테스트 중입니다.

자기주도적 오류 기반 미세 조정, 소형 모델의 HumanEval 성능 80% 달성
한 개발자가 Qwen 2.5 7B를 자체 생성한 코딩 쌍으로 훈련시켜, 인간이 작성한 훈련 데이터 없이 HumanEval에서 112/164 (+87 문제)를 달성했습니다. 이 접근법은 Llama 3.2 3B와 Qwen 3 4B에도 적용됩니다.

SDL 프로젝트, GitHub 이슈에 대응해 AI 작성 커밋 금지
SDL 프로젝트는 GitHub 이슈에서 Copilot 사용에 대한 우려가 제기된 후 AI 생성 커밋을 금지하는 정책을 시행했습니다. 이 이슈는 특히 리뷰 #13277과 #12730을 AI 지원이 감지된 사례로 언급했습니다.