La arquitectura de doble modelo reduce el consumo de tokens a la mitad en conversaciones largas.

✍️ OpenClawRadar📅 Publicado: 9 de marzo de 2026🔗 Source
La arquitectura de doble modelo reduce el consumo de tokens a la mitad en conversaciones largas.
Ad

Sistema de compresión de contexto para agentes de IA

Un desarrollador en r/ClaudeAI compartió una solución al problema de que los agentes de IA pierden contexto después de la compactación de conversaciones. El sistema utiliza una arquitectura de doble modelo donde un modelo pequeño y económico (llamado el "subconsciente") comprime continuamente el historial de conversación en segundo plano.

Detalles de la arquitectura

El sistema tiene cuatro capas:

  • Resumen narrativo (~1K tokens)
  • Factoides comprimidos
  • Citas textuales recuperadas semánticamente
  • Turnos recientes crudos

El modelo principal ("consciente") recibe un contexto curado de ~35K tokens con la misma densidad de información que normalmente requeriría 120K tokens de historial crudo. El modelo principal lee una línea de tiempo coherente y no sabe que existe el sistema de memoria.

Ad

Resultados de rendimiento

El desarrollador simuló 260 turnos en diferentes tipos de conversaciones. Para trabajos de proyecto sostenidos (comenzando con investigación intensiva y cambiando gradualmente a intercambios rápidos a medida que el modelo aprende el dominio), el sistema reduce aproximadamente a la mitad el consumo de tokens.

Herramientas de desarrollo

El sistema fue construido con Claude Code para la simulación y Claude.ai en la etapa de consultoría e investigación. El desarrollador busca a otros que hayan intentado enrutar un modelo más pequeño para gestionar el contexto de uno más grande o hayan encontrado otras soluciones para el problema de compactación.

📖 Read the full source: r/ClaudeAI

Ad

👀 Ver también

OCTO-VEC: Empresa de software virtual de código abierto con 24 agentes de IA.
Herramientas

OCTO-VEC: Empresa de software virtual de código abierto con 24 agentes de IA.

OCTO-VEC es un proyecto de código abierto en TypeScript/SQLite que simula una empresa de software con 9 agentes de IA predeterminados y 15 especialistas contratables. Incluye escaneo de seguridad automatizado, identidades git por agente y soporta más de 22 proveedores de LLM.

OpenClawRadar
Reimplementación de código Claude de código abierto parcheada para compatibilidad con modelos locales
Herramientas

Reimplementación de código Claude de código abierto parcheada para compatibilidad con modelos locales

Un desarrollador parcheó la reimplementación de código abierto de Claude Code para que funcione con Ollama y modelos locales al eliminar las dependencias codificadas del cliente de Anthropic. La CLI ahora detecta automáticamente los proveedores a partir de los nombres de los modelos y las variables de entorno.

OpenClawRadar
Steerling-8B: Un modelo de lenguaje interpretable con atribución a nivel de token
Herramientas

Steerling-8B: Un modelo de lenguaje interpretable con atribución a nivel de token

Guide Labs lanzó Steerling-8B, un modelo de lenguaje de 8 mil millones de parámetros entrenado en 1.35 billones de tokens que puede rastrear cualquier token generado hasta el contexto de entrada, conceptos comprensibles para humanos y fuentes de datos de entrenamiento. El modelo logra un rendimiento competitivo con modelos entrenados con 2-7× más datos.

OpenClawRadar
PeaDB: Base de Datos Compatible con Redis Desarrollada con Asistentes de IA en C++20
Herramientas

PeaDB: Base de Datos Compatible con Redis Desarrollada con Asistentes de IA en C++20

Un desarrollador creó PeaDB, un reemplazo directo de Redis 7.2.5 escrito en C++20 usando Codex, Copilot y Claude, implementando ~147 comandos con persistencia, replicación y soporte de clúster. Los benchmarks muestran un rendimiento cercano a Redis.

OpenClawRadar