OpenClaw Implementa Compressão do Histórico do Agente para Reduzir o Uso de Contexto

Problema de Gerenciamento de Contexto
Ao executar o OpenClaw dentro do Docker, a escrita direta de código pelo agente enche o contexto com ruído: leitura de arquivos (5 mil tokens), escrita de edições (500 tokens), execução de testes (200 tokens) e recebimento de rastreamentos de pilha (3 mil tokens). Um único ciclo de depuração consome 10 mil a 15 mil tokens, principalmente de saída do console e rastreamentos de pilha que se tornam inúteis após correções de bugs. Com 20 a 30 ciclos de depuração por sessão, toda a janela de contexto é consumida por ruído.
Arquitetura Cérebro/Trabalhador
A solução envolve separar responsabilidades: o OpenClawd (no Docker) atua como o cérebro para planejamento, dividindo o trabalho em subtarefas, delegando e coordenando. Um trabalhador local no host macOS, alimentado pelo Qwen3.5-27B rodando no Apple Silicon via MLX sem custo, serve como as mãos para ler arquivos, escrever código, executar testes e depurar. Isso mantém o ruído de ida e volta no contexto do trabalhador, com o cérebro vendo apenas resultados finais como "tarefa concluída, aqui estão os arquivos que mudaram".
Estratégia de Compressão
Mesmo com a divisão cérebro/trabalhador, o contexto do orquestrador ainda se enche com documentos operacionais: AGENTES (~6,6 mil tokens), ALMA (~1,5 mil tokens), LIÇÕES (~10 mil tokens) e planos/instruções (~13 mil tokens em disco), totalizando 20 mil a 30 mil tokens antes de qualquer trabalho começar. As sessões podem chegar a 100 mil a 200 mil tokens.
A percepção chave: trabalho concluído não precisa de detalhes brutos. Uma vez que uma subtarefa é finalizada, seu histórico bruto se torna peso morto. O agente só precisa saber: qual era a tarefa, se teve sucesso, quais arquivos mudaram e quaisquer erros.
Detalhes de Implementação
Passo 1: Detectar limites do ciclo de vida - O orquestrador decompõe o trabalho em subtarefas com ciclos de vida: Gerar (o agente chama sessions_spawn ou delegate_task), Executar (chamadas de ferramentas, raciocínio) e Concluir (Mensagem do Sistema "subagente 'nome_da_tarefa' concluído"). Um scanner de 4 passagens percorre o JSONL da sessão:
- Passagem 1: Encontrar eventos de geração
- Passagem 2: Encontrar erros de geração
- Passagem 3: Encontrar marcadores de conclusão
- Passagem 4: Calcular contagem de tokens e duração por ciclo de vida
Isso identifica intervalos de mensagens pertencentes a subtarefas concluídas.
Passo 2: Resumir na "linguagem do agente" (mascaramento) - Os resumos são gerados para parecerem saídas normais do agente, mantendo compatibilidade com o formato de mensagem esperado pelo orquestrador (funções, blocos de conteúdo, estruturas de chamadas de ferramentas, cadeias de IDs pai-filho). Esses resumos mascarados substituem o histórico bruto da tarefa.
Exemplo de resumo compactado de tarefa:
── TAREFA COMPACTADA ── origem: agente tarefa: Implementar tempo limite de inatividade para servidor MLX resultado: sucesso conclusão: Adicionado temporizador de 5 minutos de inatividade ao MlxServerManager. O servidor descarrega automaticamente quando nenhuma solicitação é recebida. arquivos+: src/services/mlx_idle_monitor.py arquivos~: src/services/mlx_server.py, config.json erros: nenhum tentou_e_falhou: threading.Timer — condição de corrida deve_lembrar: O servidor MLX deve recarregar apenas sob solicitação explícita do trabalhador, não em qualquer chamada de ferramenta ─────────────────
Este resumo de ~100 tokens substitui 5 mil tokens de chamadas de ferramentas brutas e raciocínio (redução de 99,2%). Os resumos são gerados por um LLM barato (Gemini Flash Lite ou MLX local), com mecanismos de fallback se a geração falhar.
📖 Leia a fonte completa: r/openclaw
👀 See Also

Precisa de Servidor MCP que Fornece Descoberta Semântica de Ferramentas para Agentes de IA
Um servidor MCP chamado Need permite busca semântica em mais de 10.000 ferramentas de brew, npm, pip e cargo. Quando um agente solicita uma tarefa como 'comprima esses PNGs', ele encontra o pngquant, instala, executa e relata o sucesso.

OmniCoder-9B: Agente de Programação com 9 Bilhões de Parâmetros Ajustado em 425 Mil Trajetórias Agênticas
A Tesslate lançou o OmniCoder-9B, um modelo de agente de codificação com 9 bilhões de parâmetros, ajustado sobre a arquitetura híbrida do Qwen3.5-9B. Ele foi treinado em mais de 425.000 trajetórias de codificação agentica curadas do Claude Opus 4.6, GPT-5.4, GPT-5.3-Codex e Gemini 3.1 Pro.

Corrigindo o Inchaço de Contexto na Memória Automática do Claude Code com um Esquema de Nomenclatura e Script de Auditoria
Uma skill do Claude Code impõe um esquema de nomenclatura com 3 tipos, frontmatter obrigatório e um script de auditoria em bash para deduplicar arquivos de memória e reduzir a carga de contexto.

Qwen 3.6 27B alcança velocidade 2,5x com decodificação especulativa MTP no llama.cpp
Um usuário do Reddit relata inferência 2,5x mais rápida no Qwen 3.6 27B usando decodificação especulativa MTP com um PR personalizado do llama.cpp, alcançando 28 tok/s no Mac M2 Max 96GB. Inclui quants GGUF pré-convertidos e templates de chat corrigidos.