Os frameworks de agentes desperdiçam mais de 350.000 tokens por sessão ao reenviar arquivos estáticos.

Resultados do benchmark de desperdício de tokens
Medições em uma configuração local do Qwen 3.5 122B revelaram que frameworks de agentes desperdiçam mais de 350.000 tokens por sessão ao reenviar repetidamente arquivos estáticos. A fonte descreve esses números como "irreais".
Abordagem de otimização
Foi descoberta uma abordagem de tempo de compilação que reduz o contexto da consulta de 1.373 tokens para apenas 73 tokens. Isso representa uma redução de 95% no uso de tokens para este contexto específico.
O benchmark também descobriu que a conversão ingênua de JSON torna o problema 30% pior, aumentando o desperdício de tokens além das medições de referência.
Contexto técnico
Frameworks de agentes normalmente incluem prompts do sistema, definições de ferramentas e outros dados de configuração que permanecem estáticos em múltiplas interações dentro de uma sessão. Quando esses dados são reenviados a cada consulta, eles consomem tokens sem fornecer novas informações ao modelo. Isso é particularmente custoso com modelos grandes como o Qwen 3.5 122B, onde o processamento de tokens impacta diretamente tanto o desempenho quanto o custo.
A abordagem de tempo de compilação provavelmente envolve pré-processar elementos estáticos para que sejam referenciados em vez de reenviados, semelhante a como aplicações web modernas armazenam em cache ativos estáticos. Para desenvolvedores que trabalham com agentes de codificação de IA, reduzir essa sobrecarga pode melhorar significativamente os tempos de resposta e reduzir custos operacionais.
📖 Read the full source: r/LocalLLaMA
👀 See Also

Voygr Lança API de Validação de Negócios para Inteligência de Localização Atualizada
A API de Validação de Negócios da Voygr verifica se as empresas estão operando, fechadas, rebatizadas ou inválidas, agregando múltiplas fontes de dados e detectando sinais conflitantes. A equipe está construindo um perfil de local infinito e consultável que combina dados precisos de locais com contexto web atualizado, como notícias, artigos e eventos.

Qwen 3.6 27B alcança velocidade 2,5x com decodificação especulativa MTP no llama.cpp
Um usuário do Reddit relata inferência 2,5x mais rápida no Qwen 3.6 27B usando decodificação especulativa MTP com um PR personalizado do llama.cpp, alcançando 28 tok/s no Mac M2 Max 96GB. Inclui quants GGUF pré-convertidos e templates de chat corrigidos.

LLMock: Servidor de simulação baseado em HTTP para testes determinísticos de LLM entre processos
LLMock é um servidor HTTP real que simula as APIs da OpenAI, Claude e Gemini, permitindo que desenvolvedores executem testes determinísticos em múltiplos processos sem acessar APIs reais. Ele suporta streaming SSE, chamadas de ferramentas, roteamento por predicados e registro de solicitações sem dependências.

Radicle 1.8.0 Lançado: Forja de Código Descentralizado Ponto a Ponto Construída no Git
O Radicle 1.8.0 oferece uma forja de código soberana e ponto a ponto no Git com CLI, interface web e cliente desktop. Repositórios são replicados entre pares usando NoiseXK e um protocolo gossip personalizado – sem servidor central.