A arquitetura de modelo duplo reduz o consumo de tokens pela metade em conversas longas.

Sistema de compressão de contexto para agentes de IA
Um desenvolvedor no r/ClaudeAI compartilhou uma solução para o problema de agentes de IA perderem contexto após a compactação da conversa. O sistema usa uma arquitetura de modelo duplo onde um modelo pequeno e barato (chamado de "subconsciente") comprime continuamente o histórico da conversa em segundo plano.
Detalhes da arquitetura
O sistema tem quatro camadas:
- Resumo narrativo (~1K tokens)
- Fatos comprimidos
- Citações literais recuperadas semanticamente
- Turnos recentes brutos
O modelo principal ("consciente") recebe um contexto curado de ~35K tokens com a mesma densidade de informação que normalmente exigiria 120K tokens de histórico bruto. O modelo principal lê uma linha do tempo coerente e não sabe que o sistema de memória existe.
Resultados de desempenho
O desenvolvedor simulou 260 turnos em diferentes tipos de conversa. Para trabalhos de projeto sustentados (começando com pesquisa pesada e gradualmente mudando para trocas rápidas à medida que o modelo aprende o domínio), o sistema reduz o consumo de tokens aproximadamente pela metade.
Ferramentas de desenvolvimento
O sistema foi construído com Claude Code para a simulação e Claude.ai na fase de consultoria e pesquisa. O desenvolvedor está procurando por outras pessoas que tentaram direcionar um modelo menor para gerenciar o contexto de um maior ou encontraram outras soluções alternativas para o problema de compactação.
📖 Leia a fonte completa: r/ClaudeAI
👀 See Also

Três servidores MCP para pesquisa de e-commerce com Claude: ferramentas Shopify, Amazon e Google Maps
Um desenvolvedor criou três servidores MCP para Claude analisar lojas Shopify sem chaves de API, pontuar oportunidades de produtos na Amazon e encontrar/classificar leads de negócios locais no Google Maps. Todos estão disponíveis no Apify.

Dois Padrões para Prevenir a Degradação da Memória de Agentes de IA: AutoDream e Recuperação Cética
O OpenClaw introduz dois padrões licenciados pelo MIT para lidar com a deterioração da memória baseada em arquivos em IA: o AutoDream para consolidação noturna da memória e o Skeptical Retrieval para pontuação de memória ponderada por deterioração. Ambos trabalham juntos em um ciclo de autoaperfeiçoamento para manter o contexto do agente atualizado.

Título do artigo: Bot de Paper Trading Multi-LLM com Claude Opus como Engenheiro Líder e Gemini como Estrategista: Análise da Arquitetura
Um desenvolvedor solo compartilha um bot de paper-trading de 4.900 linhas de código na Alpaca, onde o Claude Opus 4 (Engenheiro) tem poder de veto sobre o Gemini Pro (Estrategista), com um registro de discordância com mais de 270 entradas chamado Strategist Codex.

OnUI: Extensão de Navegador para Feedback Preciso de Interface ao Claude Code
OnUI é uma extensão de navegador que permite anotar elementos de páginas web e exportar relatórios estruturados para o Claude Code via MCP local, eliminando descrições ambíguas de interface. Desenvolvida principalmente com o Claude Code, é gratuita, de código aberto e disponível para Chrome, Edge e Firefox.