Galadriel: Arnés de caché cálido de código abierto para agentes persistentes de Claude

Un usuario de Reddit ha publicado como código abierto Galadriel, un arnés para agentes persistentes de Claude que logra un ahorro de costos del 87% y una latencia inferior a 3s en contextos de 100K tokens al optimizar el almacenamiento en caché de indicaciones. El proyecto, publicado bajo licencia MIT, aborda los problemas de memoria y costo a menudo llamados el "Problema del Pez Dorado" en agentes de codificación de IA.
Características clave
- Almacenamiento en caché apilado de 3 niveles: Puntos de ruptura de caché separados para definiciones de herramientas, indicaciones del sistema (
CLAUDE.md) e historial de conversación final. Esto evita la invalidación de caché en diferentes segmentos de contexto. - MemPalace integrado: Un sistema de memoria persistente basado en vectores que no rompe el caché de indicaciones, lo que permite un recuerdo permanente.
- Prioridad a la privacidad: Diseñado para subredes privadas: sin intermediarios, sin límites de mensajes, solo tu clave de API y reglas.
- Directrices CLAUDE.md (estilo Karpathy): Reglas integradas para evitar el aumento innecesario de contexto del agente.
Pruebas de rendimiento
Según el autor, probado contra flujos de trabajo de OpenClaw/Cursor:
- Costo: $10 por cada $100 gastados normalmente (reducción del 87%).
- Latencia: El contexto de 100K tokens pasa de 11s a <3s (mejora del 85%).
Para quién es
Desarrolladores que ejecutan agentes persistentes de Claude para tareas como gestión de infraestructura o mantenimiento de código base que están pagando altos costos de API debido a contexto no almacenado en caché.
Configuración
El arnés está actualmente personalizado para Discord (configuración personal del autor), pero la lógica de almacenamiento en caché es genérica. Clona el repositorio y adapta la capa de transporte según tus necesidades.
GitHub
github.com/avasol/galadriel-public (Licencia MIT)
📖 Lee la fuente completa: r/openclaw
👀 Ver también

Flujo de Trabajo de Claude Code Detalles Visuales Jerarquía de Memoria y Sistema de Habilidades
Un usuario de Reddit compartió un diagrama visual que muestra cómo Claude Code organiza la memoria mediante archivos CLAUDE.md en capas e implementa habilidades reutilizables a través de archivos SKILL.md. El flujo de trabajo sugiere usar el modo Plan con aceptación automática y commits frecuentes.

Steerling-8B: Un modelo de lenguaje interpretable con atribución a nivel de token
Guide Labs lanzó Steerling-8B, un modelo de lenguaje de 8 mil millones de parámetros entrenado en 1.35 billones de tokens que puede rastrear cualquier token generado hasta el contexto de entrada, conceptos comprensibles para humanos y fuentes de datos de entrenamiento. El modelo logra un rendimiento competitivo con modelos entrenados con 2-7× más datos.

Feynman: Agente de Investigación de Código Abierto con Herramienta de Auditoría de Base de Código de Artículos
Feynman es un agente de investigación CLI de código abierto que despacha cuatro subagentes en paralelo para responder preguntas de investigación e incluye una herramienta de auditoría única que compara las afirmaciones de los artículos con los repositorios de código reales. Cuenta con instalación de un solo comando, licencia MIT, y se ejecuta en pi para el tiempo de ejecución del agente con alphaxiv para la búsqueda de artículos.

ClawWatcher Alcanza 200 Usuarios, Reporta Ahorros Colectivos de Más de $28K en la API de OpenClaw
ClawWatcher, una herramienta que rastrea los costos de la API de OpenClaw en tiempo real, ha alcanzado los 200 usuarios. Según su creador, los usuarios han ahorrado colectivamente más de $28,000 en costos de API, con una reducción promedio de costos del 45%.