Inchaço de tokens em frameworks de agentes: uma relação de entrada-saída de 500:1 é normal

✍️ OpenClawRadar📅 Publicado: May 2, 2026🔗 Source
Inchaço de tokens em frameworks de agentes: uma relação de entrada-saída de 500:1 é normal
Ad

Um usuário do Reddit executando um agente de IA auto-hospedado baseado no Telegram, com roteamento de múltiplos provedores, notou proporções extremas de tokens de entrada para saída: ~21k tokens de entrada por mensagem contra 50-200 tokens de saída, resultando em proporções de 100:1 a 500:1. Detalhamento: definições de ferramentas ~13k tokens, prompt do sistema ~5k, arquivos de memória/contexto ~3k, mensagem do usuário <100 tokens.

Isso é Normal?

A resposta da comunidade confirma que 15-25k de contexto base é padrão para frameworks de agentes como LangChain e AutoGPT. A alta proporção é estrutural para ter acesso real a ferramentas. Principais recomendações:

  • Modelo principal barato — os custos permanecem limitados mesmo com inchaço
  • Cache de prompt — economiza em sessões ativas, mas tem um TTL de 5 minutos, limitando a eficácia em períodos ociosos
  • Limites de gastos — salvaguarda essencial mesmo com modelos baratos
Ad

Estratégias de Mitigação

Os usuários debatem duas abordagens: reduzir as definições de ferramentas por mensagem com base na intenção (seleção dinâmica de ferramentas) versus aceitar o inchaço e confiar no cache. Avaliações sugerem que bifurcar o framework para reduzir a sobrecarga raramente é necessário, a menos que esteja construindo em escala. O consenso: 21k de contexto é “o custo de fazer negócios” com frameworks de agentes.

📖 Leia a fonte original: r/openclaw

Ad

👀 See Also

Como Desativar a Janela de Contexto de 1 Milhão de Tokens do Claude Code para Reduzir o Uso de Tokens
Tips

Como Desativar a Janela de Contexto de 1 Milhão de Tokens do Claude Code para Reduzir o Uso de Tokens

Os usuários do Anthropic podem desativar a janela de contexto de 1M no Claude Code adicionando variáveis de ambiente ao settings.json, o que pode reduzir o consumo inesperado de tokens. A fonte fornece duas opções de configuração: desativar completamente o contexto de 1M ou limitar a janela de compactação automática.

OpenClawRadar
OpenClaw: Se Sua Tarefa Não Sobrevive a uma Reinicialização, Ainda é uma Sessão de Chat
Tips

OpenClaw: Se Sua Tarefa Não Sobrevive a uma Reinicialização, Ainda é uma Sessão de Chat

Uma publicação no Reddit argumenta que tarefas do OpenClaw que dependem do histórico de conversa para estado não são retomáveis. Armazene identidade da tarefa, passo e estado de aprovação fora da transcrição.

OpenClawRadar
QA e Testes Automatizados com IA: Uma Nova Era para Testes de Software
Tips

QA e Testes Automatizados com IA: Uma Nova Era para Testes de Software

antirez descreve o uso de agentes LLM para QA automatizado, escrevendo um arquivo markdown que instrui o agente a realizar testes manuais em novos lançamentos. Aplicado ao DwarfStar e Redis Arrays, essa abordagem eleva a qualidade do software sem comprometer a minúcia.

OpenClawRadar
Correção da velocidade de processamento de prompts no Llama.cpp usando o parâmetro --ubatch-size
Tips

Correção da velocidade de processamento de prompts no Llama.cpp usando o parâmetro --ubatch-size

Um usuário descobriu que definir --ubatch-size para corresponder ao tamanho do cache L3 da GPU (64MB para Radeon 9070XT) melhorou drasticamente a velocidade de processamento de prompts para modelos maiores como Qwen 27B no Llama.cpp, tornando a invocação de código Claude utilizável.

OpenClawRadar