CAL: Capa de Optimización de Contexto de Código Abierto para Agentes de LLM

Qué hace CAL
CAL es una biblioteca de Python que se sitúa entre tu código existente y las llamadas a la API de LLM, seleccionando, comprimiendo y ensamblando el contexto de manera inteligente para cada solicitud. Aborda los problemas de costo y contexto en configuraciones de agentes con alto uso de tokens, especialmente relevantes con los cambios recientes en las suscripciones Claude Pro/Max.
Benchmarks de Rendimiento
En producción con Claude Opus 4 y 103 fragmentos de contexto:
- Sin CAL: Cada solicitud envía los 103 fragmentos (~23,000 tokens) a $0.043 por solicitud
- Con CAL: Se reduce a ~6 fragmentos y 4,100 tokens a $0.008 por solicitud
- Resultados: Reducción del 83% en tokens, reducción del 81% en costo
Validado con 5,000 prompts de WildChat (un conjunto de datos académico abierto de conversaciones reales de LLM en 57 idiomas) con un ahorro promedio del 97.6%.
Características Principales
- Selector: La puntuación ponderada por IDF selecciona solo los fragmentos relevantes por consulta. Utiliza prefijo estable + fragmentos dinámicos seleccionados por solicitud.
- Esbozos de Herramientas: Carga perezosa de herramientas de tres niveles con esbozos ligeros hasta que el modelo señala la intención de usar una herramienta específica.
- Motor de Costos: Calculadora de ahorros consciente del proveedor que conoce los 4 niveles de entrada de Anthropic y los precios de almacenamiento en caché de Google.
- Supresión de Ruido: Piso IDF + compuertas require-any para evitar que palabras comunes carguen fragmentos irrelevantes en cada solicitud.
- Ordenación Estable en Caché: Usa puntuaciones solo para selección, luego orden alfabético para posición para mantener los aciertos de caché.
Detalles Técnicos
Manejo de contexto multi-turn: Los esbozos de herramientas son conscientes del historial. Si el modelo usó una herramienta en un turno anterior, el esquema completo permanece cargado para mantener la continuidad de la conversación.
Soporte de proveedores: CAL es agnóstico al proveedor y funciona con cualquier proveedor que tenga un endpoint de finalización de chat. El motor de costos ya maneja los 4 niveles de entrada de Anthropic y los precios de almacenamiento en caché de Google.
Casos límite: Usa pisos IDF y supresión de ruido para consultas ambiguas. La puntuación híbrida de palabras clave+semántica está en la hoja de ruta.
Instalación y Licencia
pip install cal-context
Licencia MIT. PyPI: https://pypi.org/project/cal-context/
GitHub: https://github.com/vjc-lab/context-assembly-layer
📖 Read the full source: r/openclaw
👀 Ver también

Flujo de trabajo de desarrollo guiado por especificaciones para Claude Code: Descomposición, limpieza de contexto y control de costos
Un enfoque de desarrollo guiado por especificaciones para Claude Code que utiliza descomposición bidimensional, limpieza de contexto entre pasos y especificaciones escritas en disco para mejorar el rendimiento del agente y reducir costos.

Flujo de Trabajo del Consejo Multi-Modelo para Agentes de Codificación de IA
Un desarrollador creó una herramienta web que ejecuta tareas de programación a través de tres modelos de IA—GPT-4o como arquitecto, Claude como escéptico y Gemini como sintetizador—antes de pasarlas a agentes de programación. La herramienta genera un PLAN.md con restricciones explícitas y requiere que los usuarios aporten sus propias claves de API.

El servidor MCP de código abierto permite a los agentes de IA manejar pagos L402 a través de la Lightning Network.
Un complemento MCP de Python construido con FastMCP intercepta respuestas HTTP 402 Pago Requerido, paga facturas de la Lightning Network y recupera datos para agentes de IA. El repositorio incluye un agente simulado local para pruebas sin gastar fondos reales.

Code-Graph-MCP: El Servidor MCP de Código Abierto Reduce el Uso de Tokens de Código de Claude en un 40-60%
code-graph-mcp es un servidor MCP que indexa bases de código en un grafo de conocimiento AST, reemplazando múltiples llamadas grep/read con consultas estructuradas únicas. El desarrollador reporta ahorros del 40-60% en tokens de sesión totales y 80% menos llamadas a herramientas por tarea de navegación.