RAG 파이프라인 테스트는 토큰당 비용이 모델 선택을 위한 올바른 지표가 아님을 보여줍니다

✍️ OpenClawRadar📅 게시일: March 2, 2026🔗 Source
RAG 파이프라인 테스트는 토큰당 비용이 모델 선택을 위한 올바른 지표가 아님을 보여줍니다
Ad

한 개발자가 SOC 2 준수에 대한 세부적인 고객 질문에 답하기 위해 동일한 RAG 파이프라인을 사용하여 세 가지 AI 모델의 프로덕션 수준 비교를 실행했습니다. 이 테스트는 동일한 설정으로 Claude Haiku 4.5, Amazon Nova Pro, Amazon Nova Lite를 사용했습니다: 두 개의 벡터 스토어(제품 문서와 마케팅/경쟁 문서), 13개의 아키텍처 결정 기록을 근거 컨텍스트로, 쿼리당 약 49K 입력 토큰의 검색된 컨텍스트, 동일한 시스템 프롬프트, 그리고 모델 ID만 변경된 동일한 Bedrock API 호출 구조입니다.

테스트 설정 및 결과

쿼리는 다음과 같았습니다: "고객이 SOC 2 준수에 대해 물었습니다 — 어떻게 응답해야 하나요?" 모든 모델은 복사-붙여넣기 이메일, 반론 처리기, 경쟁 포지셔닝, 프레임워크별 준수 답변, 그리고 말하지 말아야 할 내용에 대한 가이드라인이 포함된 완전한 플레이북을 포함하는 동일한 RAG 컨텍스트를 받았습니다.

결과:

  • Nova Lite: 49,067 입력 토큰, 244 출력 토큰, 5.5초 응답 시간, ~$0.003 비용
  • Nova Pro: 49,067 입력 토큰, 368 출력 토큰, 13.5초 응답 시간, ~$0.040 비용
  • Haiku 4.5: 53,674 입력 토큰, 1,534 출력 토큰, 15.6초 응답 시간, $0.049 비용
Ad

출력 품질 비교

동일한 컨텍스트에도 불구하고, 모델들은 극적으로 다른 응답을 생성했습니다:

  • Nova Lite: 핵심 사실(귀하의 계정에 배포, 별도의 SOC 2 보고서 없음)은 맞췄지만 반론 처리, 경쟁 포지셔닝, 또는 컨텍스트의 세부 사항이 포함되지 않은 네 단락의 일반적인 이메일을 생성했습니다. ADR 준수에 대한 메타 논평으로 끝났습니다.
  • Nova Pro: 데이터 거주지, 인증, 접근 제어, 모니터링, 패치, 비밀 관리, 준수 범위와 같은 기술적 측면을 다루는 일곱 개의 번호 매기기 불릿 포인트를 생성했습니다. 기술적으로 정확했지만 유사한 메타 논평과 함께 붙여넣은 AWS 문서처럼 읽혔습니다.
  • Haiku 4.5: 평이한 영어 설명, 복사-붙여넣기 준비된 이메일, Terraform 비유가 포함된 반박 처리기, HIPAA, PCI-DSS, SOX, FINRA에 대한 프레임워크별 답변, "말하지 말아야 할 내용" 가이드라인, CRM 준비 대화 포인트, 그리고 다른 도구에 대한 경쟁 포지셔닝이 포함된 완전한 플레이북을 제공했습니다.

주요 발견

차이는 사용 가능한 정보에 관한 것이 아니었습니다 — 모든 모델은 완전한 플레이북을 포함하는 동일한 ~49K 입력 토큰을 가지고 있었습니다. 차이는 각 모델이 추출하고 종합할 수 있는 능력에 있었습니다. Nova Lite는 하나의 사실을 추출했고, Nova Pro는 사실을 목록으로 조직화했으며, Haiku는 컨텍스트를 예상되는 후속 조치와 함께 실행 가능한 도구 키트로 종합했습니다.

Nova Pro와 Haiku 사이의 비용 차이는 쿼리당 $0.009(1센트 미만)였지만, 출력 품질 차이는 상당했습니다. 토큰당 가장 저렴한 모델은 Haiku의 단일 패스 출력과 일치시키기 위해 2-3개의 후속 쿼리가 필요한 응답을 생성했으며, 결국 반복된 RAG 파이프라인 사용을 통해 더 많은 비용이 들었습니다.

📖 전체 출처 읽기: r/ClaudeAI

Ad

👀 See Also

레딧 사용자가 맥에서 25개 이상의 예약된 AI 에이전트를 개인 페르소나로 운영: 유용함인가, 복잡성일 뿐인가?
Use Cases

레딧 사용자가 맥에서 25개 이상의 예약된 AI 에이전트를 개인 페르소나로 운영: 유용함인가, 복잡성일 뿐인가?

한 개발자가 자신의 맥에서 25개 이상의 예약 에이전트를 운영하며, 업무 자동화, 오픈소스 프로젝트, 취미 제작, GitHub PR 등을 처리하는 네 개의 페르소나(아내, 딸, 아들, 모니터)로 구성된 개인 AI 설정을 공유하고, 이것이 실제로 유용한지, 아니면 복잡성 자체를 위한 것인지 커뮤니티에 묻습니다.

OpenClawRadar
OpenClaw 에이전트 구조: 5가지 핵심 파일과 3가지 실용적 사용 사례
Use Cases

OpenClaw 에이전트 구조: 5가지 핵심 파일과 3가지 실용적 사용 사례

OpenClaw 사용자가 모든 에이전트가 다섯 가지 핵심 파일(User, Soul, Agent, Tools, Identity)로 구성된다는 사실을 발견했습니다. 이들은 일일 AI 브리핑 수집기, 어린이를 위한 수학 코치, YouTube 쇼츠 생성기를 포함한 세 가지 작동하는 에이전트를 공유했습니다.

OpenClawRadar
OpenClaw와 Obsidian을 통합하여 개인 AI 지식 베이스 구축하기
Use Cases

OpenClaw와 Obsidian을 통합하여 개인 AI 지식 베이스 구축하기

한 개발자가 개인 정보를 유지하면서 AI 에이전트를 사용하기 위해 OpenClaw용으로 격리된 Obsidian 볼트를 설정하고 SyncThing을 통해 동기화하는 방법을 공유했습니다. 이들은 OpenClaw를 통한 작업 관리와 자동화된 연구 및 메타데이터 보강을 구현했습니다.

OpenClawRadar
지속적인 AI 메모리 via 옵시디언 MCP: 클로드 코워크를 위한 16가지 도구
Use Cases

지속적인 AI 메모리 via 옵시디언 MCP: 클로드 코워크를 위한 16가지 도구

사용자 정의 MCP 서버가 Claude Cowork와 Obsidian을 연결하여 세션 간 지속적인 메모리를 제공하며, 16개의 도구와 Dataview 쿼리를 사용합니다.

OpenClawRadar