OpenClaw Implementa Compressão do Histórico do Agente para Reduzir o Uso de Contexto

✍️ OpenClawRadar📅 Publicado: March 10, 2026🔗 Source
OpenClaw Implementa Compressão do Histórico do Agente para Reduzir o Uso de Contexto
Ad

Problema de Gerenciamento de Contexto

Ao executar o OpenClaw dentro do Docker, a escrita direta de código pelo agente enche o contexto com ruído: leitura de arquivos (5 mil tokens), escrita de edições (500 tokens), execução de testes (200 tokens) e recebimento de rastreamentos de pilha (3 mil tokens). Um único ciclo de depuração consome 10 mil a 15 mil tokens, principalmente de saída do console e rastreamentos de pilha que se tornam inúteis após correções de bugs. Com 20 a 30 ciclos de depuração por sessão, toda a janela de contexto é consumida por ruído.

Arquitetura Cérebro/Trabalhador

A solução envolve separar responsabilidades: o OpenClawd (no Docker) atua como o cérebro para planejamento, dividindo o trabalho em subtarefas, delegando e coordenando. Um trabalhador local no host macOS, alimentado pelo Qwen3.5-27B rodando no Apple Silicon via MLX sem custo, serve como as mãos para ler arquivos, escrever código, executar testes e depurar. Isso mantém o ruído de ida e volta no contexto do trabalhador, com o cérebro vendo apenas resultados finais como "tarefa concluída, aqui estão os arquivos que mudaram".

Estratégia de Compressão

Mesmo com a divisão cérebro/trabalhador, o contexto do orquestrador ainda se enche com documentos operacionais: AGENTES (~6,6 mil tokens), ALMA (~1,5 mil tokens), LIÇÕES (~10 mil tokens) e planos/instruções (~13 mil tokens em disco), totalizando 20 mil a 30 mil tokens antes de qualquer trabalho começar. As sessões podem chegar a 100 mil a 200 mil tokens.

A percepção chave: trabalho concluído não precisa de detalhes brutos. Uma vez que uma subtarefa é finalizada, seu histórico bruto se torna peso morto. O agente só precisa saber: qual era a tarefa, se teve sucesso, quais arquivos mudaram e quaisquer erros.

Ad

Detalhes de Implementação

Passo 1: Detectar limites do ciclo de vida - O orquestrador decompõe o trabalho em subtarefas com ciclos de vida: Gerar (o agente chama sessions_spawn ou delegate_task), Executar (chamadas de ferramentas, raciocínio) e Concluir (Mensagem do Sistema "subagente 'nome_da_tarefa' concluído"). Um scanner de 4 passagens percorre o JSONL da sessão:

  • Passagem 1: Encontrar eventos de geração
  • Passagem 2: Encontrar erros de geração
  • Passagem 3: Encontrar marcadores de conclusão
  • Passagem 4: Calcular contagem de tokens e duração por ciclo de vida

Isso identifica intervalos de mensagens pertencentes a subtarefas concluídas.

Passo 2: Resumir na "linguagem do agente" (mascaramento) - Os resumos são gerados para parecerem saídas normais do agente, mantendo compatibilidade com o formato de mensagem esperado pelo orquestrador (funções, blocos de conteúdo, estruturas de chamadas de ferramentas, cadeias de IDs pai-filho). Esses resumos mascarados substituem o histórico bruto da tarefa.

Exemplo de resumo compactado de tarefa:

── TAREFA COMPACTADA ──
origem: agente
tarefa: Implementar tempo limite de inatividade para servidor MLX
resultado: sucesso
conclusão: Adicionado temporizador de 5 minutos de inatividade ao MlxServerManager.
O servidor descarrega automaticamente quando nenhuma solicitação é recebida.
arquivos+: src/services/mlx_idle_monitor.py
arquivos~: src/services/mlx_server.py, config.json
erros: nenhum
tentou_e_falhou: threading.Timer — condição de corrida
deve_lembrar: O servidor MLX deve recarregar apenas sob solicitação explícita do trabalhador, não em qualquer chamada de ferramenta
─────────────────

Este resumo de ~100 tokens substitui 5 mil tokens de chamadas de ferramentas brutas e raciocínio (redução de 99,2%). Os resumos são gerados por um LLM barato (Gemini Flash Lite ou MLX local), com mecanismos de fallback se a geração falhar.

📖 Leia a fonte completa: r/openclaw

Ad

👀 See Also

Nanocode: Treinando agentes de codificação semelhantes ao Claude com JAX em TPUs
Tools

Nanocode: Treinando agentes de codificação semelhantes ao Claude com JAX em TPUs

Nanocode é uma biblioteca JAX para treinar agentes de codificação semelhantes ao Claude de ponta a ponta, usando Constitutional AI e otimização TPU. O modelo de 1,3B de parâmetros pode ser treinado em ~9 horas por US$ 200 em TPU v6e-8.

OpenClawRadar
Modo Cowork do Claude explicado: execução de tarefas em nível de arquivo versus modos de bate-papo e código
Tools

Modo Cowork do Claude explicado: execução de tarefas em nível de arquivo versus modos de bate-papo e código

O modo Cowork do Claude opera dentro de uma pasta escolhida para realizar tarefas em nível de arquivo, como organizar pastas bagunçadas, extrair dados estruturados de capturas de tela e combinar notas dispersas em documentos estruturados.

OpenClawRadar
IUM: Índice de Símbolos MCP reduz uso de tokens de IA em 15,9x comparado ao grep
Tools

IUM: Índice de Símbolos MCP reduz uso de tokens de IA em 15,9x comparado ao grep

IUM indexa bases de código em uma matriz SQLite de eventos de símbolo, expondo coordenadas exatas de arquivo:linha, rastreamento de grafo de chamadas e busca semântica via MCP. Benchmark contra DataFusion (1.538 arquivos) mostra 15,9x menos tokens que grep para consultas equivalentes.

OpenClawRadar
Implementando Verificações de IA com Continue para Revisões de PR Controladas por Código-Fonte
Tools

Implementando Verificações de IA com Continue para Revisões de PR Controladas por Código-Fonte

O Continue integra verificações de IA diretamente no fluxo de trabalho de pull requests, usando arquivos markdown como verificações controladas por versão, visíveis através das verificações de status do GitHub.

OpenClawRadar