LLM 비용 프로파일러: API 지출을 추적하여 로컬 모델 도입 근거를 마련하는 오픈소스 도구

LLM 비용 프로파일러는 코드가 OpenAI와 Anthropic에 수행하는 모든 API 호출을 추적하여 정확히 어디에, 왜, 얼마를 지출하고 있는지 보여주는 오픈소스 파이썬 도구입니다. 이 도구는 복잡도 대비 과도하게 비싼 작업을 드러내어 로컬 추론으로 전환하는 근거로 사용할 구체적인 데이터를 제공합니다.
주요 기능 및 발견 사항
이 도구는 모든 것을 로컬 SQLite에 저장하며 MIT 라이선스를 따릅니다. 소스에 따르면, API 호출 낭비의 몇 가지 구체적인 예시를 발견했습니다:
- 5개 레이블 중 하나를 출력하는 GPT-4o를 사용한 분류기 — 어떤 괜찮은 7B 로컬 모델도 쉽게 처리할 수 있는 작업입니다. 비용: API 호출당 주당 약 $89.
- 동일한 프롬프트에 대한 수천 번의 중복 호출 — 캐싱이 전혀 없습니다. 캐싱이 있는 로컬 추론은 이를 사실상 무료로 만들 것입니다.
- 34%의 호출이 형식 오류로 인한 재시도였던 요약기. 제약된 생성을 가진 잘 튜닝된 로컬 모델은 이러한 종류의 낭비를 완전히 제거합니다.
저자는 이 도구가 로컬 추론 인프라에 투자하기 위한 구체적인 근거를 팀에 제공한다고 언급했습니다: "X 작업을 로컬 모델로 옮기면 정확히 이만큼의 금액을 절약할 수 있습니다."
이 도구는 https://github.com/BuildWithAbid/llm-cost-profiler에서 GitHub를 통해 이용 가능합니다. 저자는 로컬 모델 추론 비용(계산 시간 기반 비용 산정) 추적 지원도 추가할 계획이며, 커뮤니티에 이것이 유용할지 질문했습니다.
이러한 종류의 비용 프로파일링 도구는 AI 코딩 에이전트를 사용하는 개발자들에게 특히 관련이 있습니다. 왜냐하면 API 지출이 로컬 대안에 비해 비효율적일 수 있는 부분에 대한 데이터 기반 통찰력을 제공하기 때문입니다.
📖 전체 소스 읽기: r/LocalLLaMA
👀 See Also

오픈소스 CLI 도구 sdf는 Claude를 사용하여 스택형 GitHub PR을 관리합니다.
sdf는 무료이며 MIT 라이선스가 적용된 CLI 도구로, git과 gh를 사용하여 스택형 풀 리퀘스트 워크플로우를 자동화하며, Claude CLI가 diff 분석 및 충돌 해결과 같은 복잡한 작업을 처리합니다.

하드웨어 위젯 및 Chrome 확장 프로그램으로 Claude API 요율 제한 모니터링
개발자가 ESP8266과 OLED 디스플레이를 사용하여 Claude의 속도 제한을 실시간으로 추적하는 하드웨어 위젯을 제작했으며, Claude의 내부 /usage API를 가로채 사용 패턴을 보여주는 Chrome 확장 프로그램도 함께 개발했습니다. 총 BOM 비용은 약 6.50달러입니다.

rawq: AI 에이전트 시맨틱 코드 검색을 위한 로컬 CLI 도구
rawq는 ONNX 런타임을 통한 시맨틱 검색과 tantivy를 통한 BM25 어휘 검색을 결합한 33MB 로컬 모델을 사용하는 오픈소스 CLI 도구로, AI 에이전트가 관련 코드를 찾는 데 도움을 줍니다. 테스트에서 rawq를 사용한 AI 에이전트는 무작위 read/grep 도구에 비해 4배 적은 토큰을 소비하고 작업을 2배 빠르게 완료했습니다.

안티그래비티 2.0, OpenSCAD 건축 3D 벤치마크에서 1위 - ModelRift, 판테온으로 6개 LLM 테스트
ModelRift가 6개 LLM을 벤치마킹하여 OpenSCAD로 판테온을 제작했습니다. Antigravity는 건축 품질에서 4.5/5를 기록하며 베이스라인 Codex 5.5를 제쳤습니다. Cursor 3.5는 가장 빨랐지만 가장 약했습니다.