Teste do Pipeline RAG Mostra que o Custo por Token Não é a Métrica Correta para Seleção de Modelos

✍️ OpenClawRadar📅 Publicado: March 2, 2026🔗 Source
Teste do Pipeline RAG Mostra que o Custo por Token Não é a Métrica Correta para Seleção de Modelos
Ad

Um desenvolvedor realizou uma comparação em nível de produção de três modelos de IA usando pipelines RAG idênticos para responder a uma consulta complexa de cliente sobre conformidade SOC 2. O teste utilizou Claude Haiku 4.5, Amazon Nova Pro e Amazon Nova Lite com a mesma configuração: dois armazenamentos vetoriais (documentação do produto e documentação de marketing/concorrência), 13 Registros de Decisão de Arquitetura como contexto de base, aproximadamente 49K tokens de entrada de contexto recuperado por consulta, prompts de sistema idênticos e a mesma estrutura de chamada API Bedrock com apenas o ID do modelo alterado.

Configuração do Teste e Resultados

A consulta foi: "Um cliente perguntou sobre conformidade SOC 2 — como devo responder?" Todos os modelos receberam o mesmo contexto RAG contendo um manual completo com e-mails prontos para copiar e colar, tratadores de objeções, posicionamento competitivo, respostas de conformidade específicas por framework e salvaguardas sobre o que não dizer.

Resultados:

  • Nova Lite: 49.067 tokens de entrada, 244 tokens de saída, 5,5s de tempo de resposta, ~US$ 0,003 de custo
  • Nova Pro: 49.067 tokens de entrada, 368 tokens de saída, 13,5s de tempo de resposta, ~US$ 0,040 de custo
  • Haiku 4.5: 53.674 tokens de entrada, 1.534 tokens de saída, 15,6s de tempo de resposta, US$ 0,049 de custo
Ad

Comparação da Qualidade da Saída

Apesar do contexto idêntico, os modelos produziram respostas dramaticamente diferentes:

  • Nova Lite: Gerou um e-mail genérico de quatro parágrafos que acertou o fato principal (implanta na sua conta, sem relatório SOC 2 separado) mas não incluiu tratamento de objeções, posicionamento competitivo ou nuances do contexto. Terminou com comentários meta sobre aderência aos ADRs.
  • Nova Pro: Produziu sete tópicos numerados cobrindo aspectos técnicos como residência de dados, autenticação, controle de acesso, monitoramento, correções, gerenciamento de segredos e escopo de conformidade. Tecnicamente preciso, mas parecia documentação da AWS colada com comentários meta similares.
  • Haiku 4.5: Entregou um manual completo com explicação em linguagem simples, e-mail pronto para copiar e colar, tratador de resistência com analogia de Terraform, respostas específicas por framework para HIPAA, PCI-DSS, SOX, FINRA, salvaguardas sobre "o que NÃO dizer", pontos de discussão prontos para CRM e posicionamento competitivo contra outras ferramentas.

Descoberta Principal

A diferença não estava nas informações disponíveis — todos os modelos tinham os mesmos ~49K tokens de entrada contendo o manual completo. A diferença estava no que cada modelo conseguia extrair e sintetizar. O Nova Lite extraiu um fato, o Nova Pro organizou fatos em uma lista, enquanto o Haiku sintetizou o contexto em um kit de ferramentas acionável com acompanhamentos antecipados.

A diferença de custo entre Nova Pro e Haiku foi de US$ 0,009 por consulta (menos de um centavo), mas a diferença na qualidade da saída foi substancial. O modelo mais barato por token produziu respostas que exigiriam 2-3 consultas de acompanhamento para igualar a saída de única passagem do Haiku, custando mais no final através do uso repetido do pipeline RAG.

📖 Leia a fonte completa: r/ClaudeAI

Ad

👀 See Also

Executando Agentes de LLM Locais em Mac Minis com Interface do Telegram
Use Cases

Executando Agentes de LLM Locais em Mac Minis com Interface do Telegram

Um desenvolvedor compartilha uma configuração usando 5 agentes de LLM locais em Mac Minis, controlados via bots do Telegram com custo zero de API. O sistema usa LMStudio para servir modelos, sessões tmux para Claude Code e 80 linhas de Python para a ponte do Telegram.

OpenClawRadar
Usando IA para Aprimorar Ferramentas Empresariais Existentes Como o Jira
Use Cases

Usando IA para Aprimorar Ferramentas Empresariais Existentes Como o Jira

Um desenvolvedor usou a extensão do Chrome do Claude para criar uma barra lateral no Jira que mostra gráficos de dependência entre projetos em 4 prompts, trabalhando diretamente na interface existente do Jira.

OpenClawRadar
O agente de IA Bub da OpenClaw tem dificuldade com delegação, gasta US$ 20 em 15 minutos durante a otimização do site móvel.
Use Cases

O agente de IA Bub da OpenClaw tem dificuldade com delegação, gasta US$ 20 em 15 minutos durante a otimização do site móvel.

Durante os testes de QA do Driftwatch V3, o bot OpenClaw Bub queimou US$ 20 em 15 minutos por não delegar tarefas adequadamente. O desenvolvedor descobriu que templates de especificação detalhados reduzem custos, enquanto a adaptação para mobile adicionou tempo e despesas inesperados.

OpenClawRadar
Usuários do OpenClaw relatam melhor utilidade após conexão à documentação via MCP
Use Cases

Usuários do OpenClaw relatam melhor utilidade após conexão à documentação via MCP

Um usuário descobriu que sua configuração do OpenClaw se tornou significativamente mais útil após conectá-la à sua documentação usando yavy.dev para indexação e MCP para integração, indo além da resposta genérica de perguntas para assistência específica em solução de problemas e configuração.

OpenClawRadar