La arquitectura de doble modelo reduce el consumo de tokens a la mitad en conversaciones largas.

Sistema de compresión de contexto para agentes de IA
Un desarrollador en r/ClaudeAI compartió una solución al problema de que los agentes de IA pierden contexto después de la compactación de conversaciones. El sistema utiliza una arquitectura de doble modelo donde un modelo pequeño y económico (llamado el "subconsciente") comprime continuamente el historial de conversación en segundo plano.
Detalles de la arquitectura
El sistema tiene cuatro capas:
- Resumen narrativo (~1K tokens)
- Factoides comprimidos
- Citas textuales recuperadas semánticamente
- Turnos recientes crudos
El modelo principal ("consciente") recibe un contexto curado de ~35K tokens con la misma densidad de información que normalmente requeriría 120K tokens de historial crudo. El modelo principal lee una línea de tiempo coherente y no sabe que existe el sistema de memoria.
Resultados de rendimiento
El desarrollador simuló 260 turnos en diferentes tipos de conversaciones. Para trabajos de proyecto sostenidos (comenzando con investigación intensiva y cambiando gradualmente a intercambios rápidos a medida que el modelo aprende el dominio), el sistema reduce aproximadamente a la mitad el consumo de tokens.
Herramientas de desarrollo
El sistema fue construido con Claude Code para la simulación y Claude.ai en la etapa de consultoría e investigación. El desarrollador busca a otros que hayan intentado enrutar un modelo más pequeño para gestionar el contexto de uno más grande o hayan encontrado otras soluciones para el problema de compactación.
📖 Read the full source: r/ClaudeAI
👀 Ver también
Cue AI usa Gemma 4 para dictado por voz más rápido: 44% menos latencia, 30% más uso
Cue AI reemplazó un paso de corrección de texto en la nube con Gemma 4 E4B de Google DeepMind ejecutándose localmente mediante Ollama, reduciendo la latencia media de 876 ms a 488 ms y aumentando el uso de dictado en un 30%.

Caddie: Alternativa de OpenClaw Basada en Slack Se Lanza la Próxima Semana
Caddie es una versión basada en Slack de OpenClaw que no requiere instalación local ni configuración MCP. Los usuarios lo autorizan a través del Directorio de Aplicaciones de Slack en 60 segundos, luego escriben comandos para automatizar tareas en Gmail, LinkedIn, CRM, calendario y más de 100 otras herramientas.

Grafo de Habilidades Recorrible para Memoria Persistente de Agentes de IA en Bases de Código
Un desarrollador construyó un sistema de gráfico de habilidades de tres capas que reside dentro de una base de código, permitiendo a los asistentes de programación con IA mantener memoria persistente entre sesiones. El sistema utiliza divulgación progresiva con instrucciones autodirigidas en lugar de archivos de contexto monolíticos.

De Replit a Local: Cómo un desarrollador usó Claude para construir StillHere, una app de chat de acompañante IA con API
Un desarrollador construyó StillHere.ink, una app de chat con IA para conversaciones de compañía usando claves API personales, después de migrar de Replit al desarrollo local con Claude. La app cuenta con memoria, resúmenes de diario, RAG, cambio de modelo y herramientas de control de costos.