Roteamento do tráfego da API Claude para controlar custos após mudança na assinatura Max

Migração para cobrança por API e implicações de custo
A partir do meio-dia PT, a assinatura Max da Anthropic não cobre mais o uso de ferramentas de terceiros como o OpenClaw. Todos os usuários do OpenClaw agora estão na cobrança por API com estas tarifas:
- Claude Opus 4.6: US$ 5 por milhão de tokens de entrada, US$ 25 por milhão de tokens de saída
- Claude Sonnet 4.6: US$ 3 por milhão de tokens de entrada, US$ 15 por milhão de tokens de saída
- Claude Haiku 4.5: US$ 1 por milhão de tokens de entrada, US$ 5 por milhão de tokens de saída
Uma sessão intensa do OpenClaw no Opus pode custar US$ 1-4, enquanto a mesma sessão no Sonnet custa US$ 0,20-0,80 com resultados semelhantes para a maioria das tarefas.
A solução de roteamento
A maioria das operações do OpenClaw não requer o Opus: verificações de heartbeat, leituras de arquivo, resumos, decisões de roteamento e chamadas curtas de ferramentas podem ser todas tratadas pelo Sonnet. Sem uma camada de roteamento, cada solicitação atinge seu modelo padrão, potencialmente desperdiçando orçamento do Opus em tarefas simples.
Um proxy local roteia solicitações do Claude por complexidade: tarefas simples vão automaticamente para o Sonnet, as complexas escalam para o Opus. Esta abordagem reduziu significativamente os custos sem perda de qualidade em tarefas importantes.
O proxy é de código aberto e instalável via npm: npm install -g @relayplane/proxy
Documentação detalhada e discussão estão disponíveis no r/ClaudeCode, onde a solução recebeu 52 mil visualizações.
📖 Read the full source: r/openclaw
👀 See Also

Homebutler: Servidor MCP para Gerenciamento de Homelab Multi-Servidor via Claude
Homebutler é um binário Go com um servidor MCP integrado que permite ao Claude gerenciar vários servidores via SSH sem instalar agentes nas máquinas remotas. Ele fornece 9 ferramentas incluindo monitoramento de status do sistema, gerenciamento de contêineres Docker, varredura de portas e regras de alerta.

Construindo um Agente de Voz com Latência Inferior a 500ms: Arquitetura e Insights de Desempenho
Um desenvolvedor criou um agente de voz do zero, alcançando uma latência de ponta a ponta de aproximadamente 400ms com streaming completo de STT → LLM → TTS. As principais percepções incluem tratar a voz como um problema de revezamento de turnos, usar detecção semântica de fim de turno e colocar todos os componentes no mesmo local para latência mínima.

CC-Canary: Detecte Regressões no Claude Code com Análise Local de JSONL
CC-Canary lê os logs de sessão do Claude Code e produz um relatório forense sobre deriva de modelo, incluindo razão leitura:edição, loops de raciocínio, tendências de custo e datas de inflexão detectadas automaticamente.

CLI do Navegador: Uma Ferramenta de Automação de Navegador Eficiente em Tokens para Agentes de IA de Codificação
Browser CLI é um daemon persistente do Chromium headless que fornece automação de navegador por meio de comandos Bash simples, alcançando uma economia de ~95% de tokens em comparação com o Playwright MCP, reduzindo as chamadas de ~1.500 tokens para ~75 tokens.