Economize nas Contas do Claude Code Roteando Tokens de Planejamento para Modelos Mais Baratos

Um usuário do Reddit relata ter economizado cerca de US$ 40 em taxas de excesso no Claude Code no mês passado ao dividir o uso de tokens entre modelos. A principal descoberta: etapas de planejamento (especialmente em refatorações de vários arquivos) podem consumir até 80% do orçamento de tokens, mas a maior parte do planejamento não precisa do modelo mais caro.
Como Funciona
Eles escreveram um wrapper de 30 linhas que roteia o trabalho inicial de 'descobrir o que mudar' para o Haiku 3.5 — um modelo mais barato. Apenas as edições reais e as tomadas de decisão permanecem no Opus ou Sonnet. A configuração levou cerca de 2 horas, incluindo descobrir quais etapas valiam a pena delegar.
Resultados
O último ciclo terminou com orçamento sobrando pela primeira vez em 4 meses. O usuário evitou a espera habitual de 2 dias pela janela de redefinição. Economia: aproximadamente US$ 40 em taxas de excesso.
# Pseudocódigo para a lógica do wrapper:
# 1. Enviar prompt de planejamento para haiku-3.5
# 2. Receber uma lista de arquivos e alterações
# 3. Passar o plano + instrução para opus/sonnet para edições reais
Ressalvas
A qualidade do planejamento do Haiku é visivelmente pior em decisões de arquitetura. Para fluxos de refatoração e teste, onde o Opus assume as decisões reais de qualquer forma, funciona bem. Para design do zero ('o que esse aplicativo deveria ser'), o usuário ainda deixa o Opus planejar do início.
O usuário observa que esse padrão é 'provavelmente óbvio para quem já olhou as tabelas de preços dos modelos do OpenRouter', mas a documentação dos subagentes do Claude Code é escassa sobre essa abordagem exata.
📖 Leia a fonte original: r/ClaudeAI
👀 See Also

Como as Instruções do Projeto Claude São Injetadas — E Por Que Alterá-las no Meio da Conversação Quebra o Histórico
Instruções do Projeto e Preferências do Usuário são carregadas no prompt do sistema no início da conversa, não são reinseridas a cada turno. Alterá-las no meio da conversa faz com que Claude sobrescreva sua memória das instruções anteriores, levando a falsas lembranças.

Executando OpenClaw em um Raspberry Pi Model B com APIs gratuitas
O OpenClaw roda de forma estável em um Raspberry Pi Model B com APIs de nível gratuito, incluindo Google Gemma 4 31B IT (~20 RPM, contexto ilimitado) e Gemini Flash, com Firefox headless superando o Chromium em automação de navegador.

Telegram vs Discord vs WhatsApp: Escolhendo Seu Canal OpenClaw
Nenhum

Padrões de Código Superam Diretrizes de IA: Portando uma Extensão do Firefox para o Chrome
Um desenvolvedor falhou duas vezes ao portar uma extensão do Firefox para o Chrome usando prompts de IA, mas depois conseguiu extraindo a lógica principal independente de navegador com uma interface BrowserShell, reduzindo o código específico do Chrome para apenas 5 linhas significativas.