A arquitetura de modelo duplo reduz o consumo de tokens pela metade em conversas longas.

✍️ OpenClawRadar📅 Publicado: March 9, 2026🔗 Source
A arquitetura de modelo duplo reduz o consumo de tokens pela metade em conversas longas.
Ad

Sistema de compressão de contexto para agentes de IA

Um desenvolvedor no r/ClaudeAI compartilhou uma solução para o problema de agentes de IA perderem contexto após a compactação da conversa. O sistema usa uma arquitetura de modelo duplo onde um modelo pequeno e barato (chamado de "subconsciente") comprime continuamente o histórico da conversa em segundo plano.

Detalhes da arquitetura

O sistema tem quatro camadas:

  • Resumo narrativo (~1K tokens)
  • Fatos comprimidos
  • Citações literais recuperadas semanticamente
  • Turnos recentes brutos

O modelo principal ("consciente") recebe um contexto curado de ~35K tokens com a mesma densidade de informação que normalmente exigiria 120K tokens de histórico bruto. O modelo principal lê uma linha do tempo coerente e não sabe que o sistema de memória existe.

Ad

Resultados de desempenho

O desenvolvedor simulou 260 turnos em diferentes tipos de conversa. Para trabalhos de projeto sustentados (começando com pesquisa pesada e gradualmente mudando para trocas rápidas à medida que o modelo aprende o domínio), o sistema reduz o consumo de tokens aproximadamente pela metade.

Ferramentas de desenvolvimento

O sistema foi construído com Claude Code para a simulação e Claude.ai na fase de consultoria e pesquisa. O desenvolvedor está procurando por outras pessoas que tentaram direcionar um modelo menor para gerenciar o contexto de um maior ou encontraram outras soluções alternativas para o problema de compactação.

📖 Leia a fonte completa: r/ClaudeAI

Ad

👀 See Also

Três servidores MCP para pesquisa de e-commerce com Claude: ferramentas Shopify, Amazon e Google Maps
Tools

Três servidores MCP para pesquisa de e-commerce com Claude: ferramentas Shopify, Amazon e Google Maps

Um desenvolvedor criou três servidores MCP para Claude analisar lojas Shopify sem chaves de API, pontuar oportunidades de produtos na Amazon e encontrar/classificar leads de negócios locais no Google Maps. Todos estão disponíveis no Apify.

OpenClawRadar
Dois Padrões para Prevenir a Degradação da Memória de Agentes de IA: AutoDream e Recuperação Cética
Tools

Dois Padrões para Prevenir a Degradação da Memória de Agentes de IA: AutoDream e Recuperação Cética

O OpenClaw introduz dois padrões licenciados pelo MIT para lidar com a deterioração da memória baseada em arquivos em IA: o AutoDream para consolidação noturna da memória e o Skeptical Retrieval para pontuação de memória ponderada por deterioração. Ambos trabalham juntos em um ciclo de autoaperfeiçoamento para manter o contexto do agente atualizado.

OpenClawRadar
Título do artigo: Bot de Paper Trading Multi-LLM com Claude Opus como Engenheiro Líder e Gemini como Estrategista: Análise da Arquitetura
Tools

Título do artigo: Bot de Paper Trading Multi-LLM com Claude Opus como Engenheiro Líder e Gemini como Estrategista: Análise da Arquitetura

Um desenvolvedor solo compartilha um bot de paper-trading de 4.900 linhas de código na Alpaca, onde o Claude Opus 4 (Engenheiro) tem poder de veto sobre o Gemini Pro (Estrategista), com um registro de discordância com mais de 270 entradas chamado Strategist Codex.

OpenClawRadar
OnUI: Extensão de Navegador para Feedback Preciso de Interface ao Claude Code
Tools

OnUI: Extensão de Navegador para Feedback Preciso de Interface ao Claude Code

OnUI é uma extensão de navegador que permite anotar elementos de páginas web e exportar relatórios estruturados para o Claude Code via MCP local, eliminando descrições ambíguas de interface. Desenvolvida principalmente com o Claude Code, é gratuita, de código aberto e disponível para Chrome, Edge e Firefox.

OpenClawRadar