Analisando a Queima de Tokens da Janela de Contexto de 1M do Claude: Dados Mostram Crescimento Ilimitado e Acúmulo de Falhas de Cache

Análise do Consumo de Tokens a partir de Dados Reais de Uso
Uma análise detalhada da implementação da janela de contexto de 1 milhão do Claude revela fatores técnicos específicos que causam consumo rápido de tokens. O autor analisou arquivos de sessão JSONL em várias conversas para identificar padrões.
Principais Descobertas dos Dados
Crescimento Ilimitado do Contexto: Antes da janela de contexto de 1 milhão, a compactação automática era acionada em aproximadamente 160 mil tokens. Após a implementação de 1 milhão, esse limite desapareceu, permitindo que as sessões regularmente alcancem 500 mil+ tokens. Cada prompt reenvia todo o contexto, o que significa que em 500 mil tokens, mesmo uma simples confirmação custa 500 mil tokens. Se o Claude faz 3 chamadas de ferramenta para responder a um prompt, isso representa 1,5 milhão de tokens para uma única interação.
Compensação de Falhas de Cache: A Anthropic armazena o contexto em cache no servidor por aproximadamente 5 minutos. Após essa janela, o próximo prompt reprocessa o contexto completo a aproximadamente 10 vezes o preço em cache. Embora a taxa de falhas de cache não tenha mudado (permanecendo em cerca de 2,5% das interações), uma falha de cache em um contexto de 500 mil tokens é significativamente mais cara do que uma em um contexto de 150 mil tokens.
Ferramenta de Análise
O autor criou um script Python que analisa as contagens de tokens de arquivos de sessão JSONL do Claude sem acessar o conteúdo das conversas. O script detecta automaticamente seu diretório de dados do Claude e requer matplotlib e numpy. O script está disponível em: https://github.com/RyanSeanPhillips/cldctrl/blob/master/docs/context_analysis.py
O autor também menciona o CLD CTRL (https://github.com/RyanSeanPhillips/cldctrl), um painel de terminal para iniciar e monitorar sessões do Claude Code, uso de tokens e atividade de projetos.
📖 Leia a fonte completa: r/ClaudeAI
👀 See Also
Claude Melhora o Limite Zero da Hipótese de Riemann de 41,6% para 67,2%
Uma versão de pesquisa não lançada do Claude melhorou o limite inferior para zeros na linha crítica de 41,6% para 67,2%, usando uma nova combinação de trabalhos anteriores.
Como Funciona a Marca d'Água de Texto da Claude
A futura marca d'água do Claude usa uma chave e palavras anteriores para alterar escolhas aleatórias sem afetar a qualidade da saída. Projetada para cumprir o AI Act da UE.

DiLoCo Desacoplado: Treinamento Distribuído Resiliente Entre Data Centers com Baixa Largura de Banda
O Decoupled DiLoCO do Google DeepMind treina LLMs em centros de dados distantes usando WAN de 2-5 Gbps, com ilhas de computação auto-recuperáveis que isolam falhas de hardware sem degradar o desempenho de ML.
Quem São os Corretores de Tokens? A Ascensão da Revenda de Créditos de IA
Uma análise do mercado emergente de corretores de tokens que compram créditos de IA não utilizados de startups e os revendem com grandes descontos, com detalhes sobre marketplaces, roteadores de volume e canais do Telegram.