Os frameworks de agentes desperdiçam mais de 350.000 tokens por sessão ao reenviar arquivos estáticos.

✍️ OpenClawRadar📅 Publicado: April 13, 2026🔗 Source
Os frameworks de agentes desperdiçam mais de 350.000 tokens por sessão ao reenviar arquivos estáticos.
Ad

Resultados do benchmark de desperdício de tokens

Medições em uma configuração local do Qwen 3.5 122B revelaram que frameworks de agentes desperdiçam mais de 350.000 tokens por sessão ao reenviar repetidamente arquivos estáticos. A fonte descreve esses números como "irreais".

Abordagem de otimização

Foi descoberta uma abordagem de tempo de compilação que reduz o contexto da consulta de 1.373 tokens para apenas 73 tokens. Isso representa uma redução de 95% no uso de tokens para este contexto específico.

O benchmark também descobriu que a conversão ingênua de JSON torna o problema 30% pior, aumentando o desperdício de tokens além das medições de referência.

Ad

Contexto técnico

Frameworks de agentes normalmente incluem prompts do sistema, definições de ferramentas e outros dados de configuração que permanecem estáticos em múltiplas interações dentro de uma sessão. Quando esses dados são reenviados a cada consulta, eles consomem tokens sem fornecer novas informações ao modelo. Isso é particularmente custoso com modelos grandes como o Qwen 3.5 122B, onde o processamento de tokens impacta diretamente tanto o desempenho quanto o custo.

A abordagem de tempo de compilação provavelmente envolve pré-processar elementos estáticos para que sejam referenciados em vez de reenviados, semelhante a como aplicações web modernas armazenam em cache ativos estáticos. Para desenvolvedores que trabalham com agentes de codificação de IA, reduzir essa sobrecarga pode melhorar significativamente os tempos de resposta e reduzir custos operacionais.

📖 Read the full source: r/LocalLLaMA

Ad

👀 See Also

Assistente de IA da UIUC Executa 11 Modelos em Paralelo para Respostas em Menos de 2 Segundos
Tools

Assistente de IA da UIUC Executa 11 Modelos em Paralelo para Respostas em Menos de 2 Segundos

O chatbot assistente de ensino de IA da UIUC executa 11 modelos em paralelo para recuperação e geração de texto e imagem, moderação e classificação, alcançando tempo de resposta médio de 2 segundos. Código aberto com RAG Pinecone e conjunto de dados RLHF.

OpenClawRadar
Gemini 3.1 Pro em Sistemas Multiagentes: Alta Qualidade de Design, Taxa de 20% de Falha em Chamadas de Ferramentas
Tools

Gemini 3.1 Pro em Sistemas Multiagentes: Alta Qualidade de Design, Taxa de 20% de Falha em Chamadas de Ferramentas

Desenvolvedores construindo Bobr, um gerador de apresentações em IA com arquitetura multiagente, relatam que o Gemini 3.1 Pro produz resultados de design impressionantes, mas sofre com uma taxa de falha de chamadas de ferramentas de ~20% e corrupção de texto em pipelines de produção.

OpenClawRadar
Desenvolvedor Cria Servidor MCP para Integração do Claude com WhatsApp, Compartilha Desafios
Tools

Desenvolvedor Cria Servidor MCP para Integração do Claude com WhatsApp, Compartilha Desafios

Um desenvolvedor criou um servidor MCP para dar ao Claude acesso a conversas reais do WhatsApp, descobrindo que o gerenciamento do contexto das conversas foi mais complicado do que o esperado e exigiu um banco de dados para rastrear as conversas.

OpenClawRadar
Logseq Brain v0.6.0: Plugin de Memória Persistente para Claude Code Adiciona Diário de Jornada e Leituras Direcionadas por Seção
Tools

Logseq Brain v0.6.0: Plugin de Memória Persistente para Claude Code Adiciona Diário de Jornada e Leituras Direcionadas por Seção

Logseq Brain v0.6.0 adiciona um diário de jornada para todas as operações, leituras direcionadas por seção para economia de tokens e divulgação progressiva para arquivos de habilidades.

OpenClawRadar