Maximizando o Valor em Sessões do Claude Code: Dicas de Eficiência de Tokens

A Anthropic publicou um guia prático para obter mais valor de cada token gasto nas sessões do Claude Code. O guia aborda a mecânica de preços dos tokens e oferece seis táticas concretas para reduzir o desperdício sem trocar de modelo.
O que determina o custo do token
Você é cobrado por token, mas na verdade está pagando pelo tempo de inferência da GPU. Três fatores decidem o preço de um token: tamanho do modelo, entrada vs. saída e cache. Tokens de saída custam cerca de 5x mais que os de entrada, porque a decodificação executa o modelo uma vez por token. Tokens de entrada em cache são mais baratos, e o cache de prompt expira após uma hora.
Seis maneiras de reduzir o desperdício de tokens
- Execute
/clearentre tarefas — evita que contexto anterior irrelevante seja enviado ao modelo, reduzindo o uso de tokens. - Defina seu modelo e nível de esforço antes de começar — alterá-los no meio da conversa quebra o cache de prompt, aumentando o custo.
- Mencione arquivos com @ em vez de nomeá-los — o arquivo é anexado diretamente à sua mensagem, economizando uma chamada de leitura ou uma pesquisa no repositório.
- Adicione flags silenciosas a comandos ruidosos ou execute-os em um subagente — a saída do comando permanece na conversa pelo resto da sessão.
- Execute
/contextuma vez em uma sessão nova — mostra o que está carregado (CLAUDE.md, ferramentas MCP), para que você possa cortar itens desnecessários. /compactantes de fazer uma pausa — o cache de prompt expira após uma hora, e resumir enquanto está em cache é mais barato.
O guia enfatiza que ser eficiente em tokens não significa usar menos no geral, mas garantir que os que você usa sejam direcionados à tarefa real. Por exemplo, em uma sessão, o Claude lê o teste e o arquivo que ele cobre, edita e termina em poucas etapas. Em outra, ele faz grep por aí, lê uma dúzia de arquivos para chegar aos mesmos dois, e arrasta todo esse contexto para cada etapa seguinte — custando mais e fazendo o modelo pensar em arquivos irrelevantes.
📖 Leia a fonte completa: HN AI Agents
👀 See Also

Qwen3.5-397B MoE roda em 14GB de RAM via carregamento paginado de especialistas no M1 Ultra
O mecanismo Paged MoE mantém apenas 20 especialistas residentes e carrega o restante sob demanda do SSD, executando um modelo de 397B com 209GB em um Mac Studio de 64GB com 1,59 tok/s e pico de RAM de 14GB. Inclui benchmarks de modelos menores.

Como Solucionar Problemas de Configuração do OpenClaw: Questões de Multiagentes e Respostas de Modelo
Com dificuldades para configurar o OpenClaw? Descubra problemas comuns com configurações multiagente e modelos não responsivos, e aprenda como resolvê-los.

Qwen 3.5 122B MoE a 35 t/s em uma única 3090 com ik_llama.cpp MTP
Uma stack local rodando Qwen 3.5 122B MoE em uma única 3090 a 35 t/s usando operações MoE fundidas do ik_llama.cpp para MTP. O llama.cpp padrão mostrou apenas +4% de melhoria; o fork ik resulta em +20%.

Regras de Vibe Coding: Crie Projetos Paralelos pelo Celular Usando Claude Code Sem Ler Código
Um engenheiro sênior compartilha suas regras para construir projetos paralelos inteiramente pelo celular usando Claude Code sem ler código: começar no modo plano, commit no git, escrever testes, usar subagentes para revisões e modo automático.