Redirecionamento de Subtarefas do Agente para Modelos Mais Baratos Reduziu o Custo de $18 para $4 na Mesma Refatoração

✍️ OpenClawRadar📅 Publicado: May 19, 2026🔗 Source
Redirecionamento de Subtarefas do Agente para Modelos Mais Baratos Reduziu o Custo de $18 para $4 na Mesma Refatoração
Ad

Um desenvolvedor no r/ClaudeAI descreve uma estratégia prática de otimização de custos para loops de agente: rotear subtarefas rotineiras para modelos baratos e reservar modelos caros (Opus 4.7) apenas para raciocínio complexo. Seu agente de refatoração — lidando com renomeação de variáveis CSS, atualizações de configuração YAML e execuções de linter via MCP — originalmente enviava cada etapa para o Opus 4.7 a um total de cerca de $18. Após implementar a lógica de roteamento, 178 de 212 etapas foram para modelos baratos, reduzindo o custo para aproximadamente $4, sem diferença observável de qualidade nas alterações rotineiras.

Lógica de Roteamento

  • Subtarefas difíceis → Opus 4.7: Arquitetura de componentes, depuração de código às 2h da manhã, qualquer coisa que exija raciocínio sustentado em conversas longas. O autor observa que o Opus é realmente incomparável nesse tipo de trabalho — uma tentativa anterior de rotear um bug de middleware de autenticação para um modelo mais barato quebrou silenciosamente o tratamento de sessão, custando uma hora para rastrear.
  • Subtarefas rotineiras → modelos mais baratos: Lint, renomeação, edições de configuração, orquestração de ferramentas. O autor optou pelo DeepSeek V4 Pro para tarefas gerais de codificação e pelo Tencent Hunyuan Hy3 preview para chamadas pesadas de ferramentas. No final de abril, o Hunyuan Hy3 estava classificado em #1 no OpenRouter por volume de chamadas de ferramentas e quase nunca erra uma chamada de função quando o esquema está limpo.
Ad

Comparação de Custos

  • Opus 4.7: ~$0,18 por milhão de tokens de entrada (estimado a partir do contexto de alternativa ~28x mais barata).
  • Tencent Hunyuan Hy3: $0,18 por milhão de tokens de entrada, $0,59 por milhão de saída — aproximadamente 28x mais barato que o Opus 4.7 na entrada.
  • Mesma refatoração de 212 etapas: 178 etapas para o nível barato, 34 etapas para o Opus. O custo caiu de $18 para ~$4.

Modos de Falha

  • O modelo de chamada de ferramentas alucina parâmetros quando os esquemas são confusos (o autor admite que os esquemas eram ruins).
  • O DeepSeek V4 Pro ocasionalmente escreve código sintaticamente perfeito que faz o oposto do que foi solicitado, sobrevivendo a uma olhada rápida.
  • Nenhum dos modelos baratos consegue igualar o Opus na depuração de problemas profundos (por exemplo, fluxo de autenticação silenciosamente ignorando um cookie).

Heurística de Decisão

A regra prática de roteamento do autor: "Quão caro é pegar uma resposta errada?" Uma correção de lint ruim custa um git revert de 2 segundos; uma decisão de arquitetura ruim custa a tarde toda.

A economia permitiu tarefas anteriormente ignoradas — como escrever e executar testes para cada alteração de CSS, ou regenerar todas as imagens Open Graph — porque a frações de centavo por chamada de ferramenta não há motivo para não fazer.

📖 Leia a fonte original: r/ClaudeAI

Ad

👀 See Also

Como o roteamento de tarefas simples para modelos mais baratos reduziu os custos de IA em 40%
Tips

Como o roteamento de tarefas simples para modelos mais baratos reduziu os custos de IA em 40%

Um usuário do OpenClaw reduziu sua conta de IA em 40% ao analisar logs de uso e direcionar tarefas simples, como operações de arquivo e perguntas e respostas, para modelos mais baratos como DeepSeek-v3 e Gemini Flash, enquanto reservava o Claude Sonnet para tarefas de raciocínio complexo.

OpenClawRadar
Desperdício de Tokens no Claude Code: Auditoria de Usuário Mostra que Correções Comportamentais Superam a Troca de Modelo
Tips

Desperdício de Tokens no Claude Code: Auditoria de Usuário Mostra que Correções Comportamentais Superam a Troca de Modelo

Um usuário mediu o uso de tokens no Claude Code e descobriu que /clear entre tarefas, planejar antes de editar e proibir a releitura de arquivos editados economizaram mais tokens do que trocar de modelo. Disciplina prática vence wrappers.

OpenClawRadar
Usando Narrativas de Projeto para Manter o Contexto do OpenClaw em Projetos de Longo Prazo
Tips

Usando Narrativas de Projeto para Manter o Contexto do OpenClaw em Projetos de Longo Prazo

Um desenvolvedor compartilha uma técnica para criar 'narrativas de projeto' onde um trabalhador separado do OpenClaw analisa a base de código após marcos importantes para documentar a compreensão do sistema, identificar problemas e manter o contexto.

OpenClawRadar
Preferências do Usuário Claude: Configuração de um Redditor para Respostas Concisas e Críticas
Tips

Preferências do Usuário Claude: Configuração de um Redditor para Respostas Concisas e Críticas

Um usuário do Reddit compartilha suas configurações personalizadas de Preferências de Usuário do Claude para obter respostas menos corporativas e mais críticas. Inclui dicas para evitar repetições, começar pelas conclusões e simplificar a pontuação.

OpenClawRadar