Redirecionamento de Subtarefas do Agente para Modelos Mais Baratos Reduziu o Custo de $18 para $4 na Mesma Refatoração

Um desenvolvedor no r/ClaudeAI descreve uma estratégia prática de otimização de custos para loops de agente: rotear subtarefas rotineiras para modelos baratos e reservar modelos caros (Opus 4.7) apenas para raciocínio complexo. Seu agente de refatoração — lidando com renomeação de variáveis CSS, atualizações de configuração YAML e execuções de linter via MCP — originalmente enviava cada etapa para o Opus 4.7 a um total de cerca de $18. Após implementar a lógica de roteamento, 178 de 212 etapas foram para modelos baratos, reduzindo o custo para aproximadamente $4, sem diferença observável de qualidade nas alterações rotineiras.
Lógica de Roteamento
- Subtarefas difíceis → Opus 4.7: Arquitetura de componentes, depuração de código às 2h da manhã, qualquer coisa que exija raciocínio sustentado em conversas longas. O autor observa que o Opus é realmente incomparável nesse tipo de trabalho — uma tentativa anterior de rotear um bug de middleware de autenticação para um modelo mais barato quebrou silenciosamente o tratamento de sessão, custando uma hora para rastrear.
- Subtarefas rotineiras → modelos mais baratos: Lint, renomeação, edições de configuração, orquestração de ferramentas. O autor optou pelo DeepSeek V4 Pro para tarefas gerais de codificação e pelo Tencent Hunyuan Hy3 preview para chamadas pesadas de ferramentas. No final de abril, o Hunyuan Hy3 estava classificado em #1 no OpenRouter por volume de chamadas de ferramentas e quase nunca erra uma chamada de função quando o esquema está limpo.
Comparação de Custos
- Opus 4.7: ~$0,18 por milhão de tokens de entrada (estimado a partir do contexto de alternativa ~28x mais barata).
- Tencent Hunyuan Hy3: $0,18 por milhão de tokens de entrada, $0,59 por milhão de saída — aproximadamente 28x mais barato que o Opus 4.7 na entrada.
- Mesma refatoração de 212 etapas: 178 etapas para o nível barato, 34 etapas para o Opus. O custo caiu de $18 para ~$4.
Modos de Falha
- O modelo de chamada de ferramentas alucina parâmetros quando os esquemas são confusos (o autor admite que os esquemas eram ruins).
- O DeepSeek V4 Pro ocasionalmente escreve código sintaticamente perfeito que faz o oposto do que foi solicitado, sobrevivendo a uma olhada rápida.
- Nenhum dos modelos baratos consegue igualar o Opus na depuração de problemas profundos (por exemplo, fluxo de autenticação silenciosamente ignorando um cookie).
Heurística de Decisão
A regra prática de roteamento do autor: "Quão caro é pegar uma resposta errada?" Uma correção de lint ruim custa um git revert de 2 segundos; uma decisão de arquitetura ruim custa a tarde toda.
A economia permitiu tarefas anteriormente ignoradas — como escrever e executar testes para cada alteração de CSS, ou regenerar todas as imagens Open Graph — porque a frações de centavo por chamada de ferramenta não há motivo para não fazer.
📖 Leia a fonte original: r/ClaudeAI
👀 See Also

Colaborativo vs Diretivo: Prompts de IA Produzem Resultados Diferentes
Uma discussão no Reddit destaca diferenças mensuráveis nos resultados do desenvolvimento assistido por IA entre usuários que colaboram com a IA usando linguagem de 'nós' versus aqueles que dão comandos direcionais de 'faça isso'. A abordagem colaborativa revela becos sem saída e desafia suposições através de contexto compartilhado.

Como um não-programador criou um fluxo de trabalho reutilizável do Claude para marketing de conteúdo de fundador
Um ex-editor de revista com zero experiência em programação compartilha como acidentalmente criou um fluxo de trabalho repetível com Claude para marketing de conteúdo de founder solo: despeje pensamentos crus e depois reestruture com Claude em formatos específicos para cada plataforma.

Auditoria do Claude Code encontra 3GB de lixo em ~/.claude — Veja como limpar
Um usuário pediu ao Claude Code para auditar seu próprio diretório ~/.claude e encontrou 2,6 GB de transcrições de sessão obsoletas, 170 MB de logs de repetição de telemetria com falha e 153 MB de buffers de desfazer — reduzindo de 3 GB para menos de 200 MB após a limpeza.

Roteamento de Modelo Reduz Custos de API em 85% vs Assinatura Claude Max – Análise de um Desenvolvedor
Um assinante do Claude Max monitorou o uso de tokens e descobriu que apenas 15% das tarefas precisavam do Opus. Ao mudar para roteamento por API (Sonnet para tarefas rotineiras, Opus para raciocínio complexo), o custo mensal caiu de US$ 200 para aproximadamente US$ 30, com qualidade de saída idêntica.