Redirecionamento de Subtarefas do Agente para Modelos Mais Baratos Reduziu o Custo de $18 para $4 na Mesma Refatoração

Um desenvolvedor no r/ClaudeAI descreve uma estratégia prática de otimização de custos para loops de agente: rotear subtarefas rotineiras para modelos baratos e reservar modelos caros (Opus 4.7) apenas para raciocínio complexo. Seu agente de refatoração — lidando com renomeação de variáveis CSS, atualizações de configuração YAML e execuções de linter via MCP — originalmente enviava cada etapa para o Opus 4.7 a um total de cerca de $18. Após implementar a lógica de roteamento, 178 de 212 etapas foram para modelos baratos, reduzindo o custo para aproximadamente $4, sem diferença observável de qualidade nas alterações rotineiras.
Lógica de Roteamento
- Subtarefas difíceis → Opus 4.7: Arquitetura de componentes, depuração de código às 2h da manhã, qualquer coisa que exija raciocínio sustentado em conversas longas. O autor observa que o Opus é realmente incomparável nesse tipo de trabalho — uma tentativa anterior de rotear um bug de middleware de autenticação para um modelo mais barato quebrou silenciosamente o tratamento de sessão, custando uma hora para rastrear.
- Subtarefas rotineiras → modelos mais baratos: Lint, renomeação, edições de configuração, orquestração de ferramentas. O autor optou pelo DeepSeek V4 Pro para tarefas gerais de codificação e pelo Tencent Hunyuan Hy3 preview para chamadas pesadas de ferramentas. No final de abril, o Hunyuan Hy3 estava classificado em #1 no OpenRouter por volume de chamadas de ferramentas e quase nunca erra uma chamada de função quando o esquema está limpo.
Comparação de Custos
- Opus 4.7: ~$0,18 por milhão de tokens de entrada (estimado a partir do contexto de alternativa ~28x mais barata).
- Tencent Hunyuan Hy3: $0,18 por milhão de tokens de entrada, $0,59 por milhão de saída — aproximadamente 28x mais barato que o Opus 4.7 na entrada.
- Mesma refatoração de 212 etapas: 178 etapas para o nível barato, 34 etapas para o Opus. O custo caiu de $18 para ~$4.
Modos de Falha
- O modelo de chamada de ferramentas alucina parâmetros quando os esquemas são confusos (o autor admite que os esquemas eram ruins).
- O DeepSeek V4 Pro ocasionalmente escreve código sintaticamente perfeito que faz o oposto do que foi solicitado, sobrevivendo a uma olhada rápida.
- Nenhum dos modelos baratos consegue igualar o Opus na depuração de problemas profundos (por exemplo, fluxo de autenticação silenciosamente ignorando um cookie).
Heurística de Decisão
A regra prática de roteamento do autor: "Quão caro é pegar uma resposta errada?" Uma correção de lint ruim custa um git revert de 2 segundos; uma decisão de arquitetura ruim custa a tarde toda.
A economia permitiu tarefas anteriormente ignoradas — como escrever e executar testes para cada alteração de CSS, ou regenerar todas as imagens Open Graph — porque a frações de centavo por chamada de ferramenta não há motivo para não fazer.
📖 Leia a fonte original: r/ClaudeAI
👀 See Also

Como o roteamento de tarefas simples para modelos mais baratos reduziu os custos de IA em 40%
Um usuário do OpenClaw reduziu sua conta de IA em 40% ao analisar logs de uso e direcionar tarefas simples, como operações de arquivo e perguntas e respostas, para modelos mais baratos como DeepSeek-v3 e Gemini Flash, enquanto reservava o Claude Sonnet para tarefas de raciocínio complexo.

Desperdício de Tokens no Claude Code: Auditoria de Usuário Mostra que Correções Comportamentais Superam a Troca de Modelo
Um usuário mediu o uso de tokens no Claude Code e descobriu que /clear entre tarefas, planejar antes de editar e proibir a releitura de arquivos editados economizaram mais tokens do que trocar de modelo. Disciplina prática vence wrappers.

Usando Narrativas de Projeto para Manter o Contexto do OpenClaw em Projetos de Longo Prazo
Um desenvolvedor compartilha uma técnica para criar 'narrativas de projeto' onde um trabalhador separado do OpenClaw analisa a base de código após marcos importantes para documentar a compreensão do sistema, identificar problemas e manter o contexto.

Preferências do Usuário Claude: Configuração de um Redditor para Respostas Concisas e Críticas
Um usuário do Reddit compartilha suas configurações personalizadas de Preferências de Usuário do Claude para obter respostas menos corporativas e mais críticas. Inclui dicas para evitar repetições, começar pelas conclusões e simplificar a pontuação.