La arquitectura de doble modelo reduce el consumo de tokens a la mitad en conversaciones largas.

Sistema de compresión de contexto para agentes de IA
Un desarrollador en r/ClaudeAI compartió una solución al problema de que los agentes de IA pierden contexto después de la compactación de conversaciones. El sistema utiliza una arquitectura de doble modelo donde un modelo pequeño y económico (llamado el "subconsciente") comprime continuamente el historial de conversación en segundo plano.
Detalles de la arquitectura
El sistema tiene cuatro capas:
- Resumen narrativo (~1K tokens)
- Factoides comprimidos
- Citas textuales recuperadas semánticamente
- Turnos recientes crudos
El modelo principal ("consciente") recibe un contexto curado de ~35K tokens con la misma densidad de información que normalmente requeriría 120K tokens de historial crudo. El modelo principal lee una línea de tiempo coherente y no sabe que existe el sistema de memoria.
Resultados de rendimiento
El desarrollador simuló 260 turnos en diferentes tipos de conversaciones. Para trabajos de proyecto sostenidos (comenzando con investigación intensiva y cambiando gradualmente a intercambios rápidos a medida que el modelo aprende el dominio), el sistema reduce aproximadamente a la mitad el consumo de tokens.
Herramientas de desarrollo
El sistema fue construido con Claude Code para la simulación y Claude.ai en la etapa de consultoría e investigación. El desarrollador busca a otros que hayan intentado enrutar un modelo más pequeño para gestionar el contexto de uno más grande o hayan encontrado otras soluciones para el problema de compactación.
📖 Read the full source: r/ClaudeAI
👀 Ver también

OCTO-VEC: Empresa de software virtual de código abierto con 24 agentes de IA.
OCTO-VEC es un proyecto de código abierto en TypeScript/SQLite que simula una empresa de software con 9 agentes de IA predeterminados y 15 especialistas contratables. Incluye escaneo de seguridad automatizado, identidades git por agente y soporta más de 22 proveedores de LLM.

Reimplementación de código Claude de código abierto parcheada para compatibilidad con modelos locales
Un desarrollador parcheó la reimplementación de código abierto de Claude Code para que funcione con Ollama y modelos locales al eliminar las dependencias codificadas del cliente de Anthropic. La CLI ahora detecta automáticamente los proveedores a partir de los nombres de los modelos y las variables de entorno.

Steerling-8B: Un modelo de lenguaje interpretable con atribución a nivel de token
Guide Labs lanzó Steerling-8B, un modelo de lenguaje de 8 mil millones de parámetros entrenado en 1.35 billones de tokens que puede rastrear cualquier token generado hasta el contexto de entrada, conceptos comprensibles para humanos y fuentes de datos de entrenamiento. El modelo logra un rendimiento competitivo con modelos entrenados con 2-7× más datos.

PeaDB: Base de Datos Compatible con Redis Desarrollada con Asistentes de IA en C++20
Un desarrollador creó PeaDB, un reemplazo directo de Redis 7.2.5 escrito en C++20 usando Codex, Copilot y Claude, implementando ~147 comandos con persistencia, replicación y soporte de clúster. Los benchmarks muestran un rendimiento cercano a Redis.