Calmkeep: Una Capa de Continuidad Externa para Contrarrestar la Deriva de LLM en Sesiones Extendidas

✍️ OpenClawRadar📅 Publicado: 17 de marzo de 2026🔗 Source
Calmkeep: Una Capa de Continuidad Externa para Contrarrestar la Deriva de LLM en Sesiones Extendidas
Ad

Abordando la deriva de los LLM en flujos de trabajo profesionales

Calmkeep es una capa de continuidad externa construida específicamente para contrarrestar lo que el creador llama "deriva estructural" en los LLM durante sesiones extendidas. Esta deriva ocurre cuando LLMs como Claude abandonan gradualmente decisiones, patrones o marcos establecidos anteriormente, incluso cuando la ventana de contexto completa aún los contiene—no a través de alucinaciones, sino mediante el abandono sistemático de patrones establecidos.

Resultados y metodología de las pruebas

El creador realizó auditorías adversarias utilizando al propio Claude como sistema evaluador, con metodología ciega y puntuación basada en criterios establecidos en los primeros cinco turnos. Claude calificó consistentemente las transcripciones de Calmkeep más alto que su propia salida.

Prueba de construcción de backend de 25 turnos

  • Claude estándar: 60% de integridad final, 8 violaciones arquitectónicas, 40% de coeficiente de deriva
  • Calmkeep: 85% de integridad, 3 violaciones arquitectónicas, cero retroceso posterior al turno 14

El ejemplo más revelador: Claude introdujo middleware Zod en el turno 14, luego inmediatamente volvió a usar parseInt sin procesar para los siguientes tres módulos como si la actualización nunca hubiera ocurrido.

Ad

Sesión legal/estratégica de 25 turnos

  • Claude estándar: 50% de integridad estratégica, 5 violaciones incluyendo un cambio jurisdiccional que invalidó el marco legal anterior, ~35% de exposición a mala praxis
  • Calmkeep: 100% de integridad, cero violaciones, <5% de riesgo

Implementación técnica

Calmkeep incluye:

  • Conector MCP
  • Plugin Claude Code
  • SDK de Python

El sistema opera únicamente como tiempo de ejecución externo, requiere traer tu propia clave de Anthropic, no tiene memoria oculta y no realiza modificaciones de peso al modelo subyacente.

Disponibilidad y pruebas

Hay disponible una prueba gratuita de 14 días a través de Stripe en https://calmkeep.ai. Los informes completos de pruebas, metodología, clasificaciones AVE, rúbrica de puntuación y desgloses turno por turno están disponibles en:

  • https://calmkeep.ai/codetestreport
  • https://calmkeep.ai/legaltestreport

📖 Read the full source: r/ClaudeAI

Ad

👀 Ver también

YourMemory: Memoria IA con decaimiento biológico alcanza un 59% de recuerdo en LoCoMo-10
Herramientas

YourMemory: Memoria IA con decaimiento biológico alcanza un 59% de recuerdo en LoCoMo-10

YourMemory otorga a los agentes de IA una memoria persistente utilizando la curva de olvido de Ebbinghaus y recuperación mejorada con grafos. Evaluado con un 59% de Recall@5 en LoCoMo-10, 2× mejor que Zep Cloud.

OpenClawRadar
OCTO-VEC: Empresa de software virtual de código abierto con 24 agentes de IA.
Herramientas

OCTO-VEC: Empresa de software virtual de código abierto con 24 agentes de IA.

OCTO-VEC es un proyecto de código abierto en TypeScript/SQLite que simula una empresa de software con 9 agentes de IA predeterminados y 15 especialistas contratables. Incluye escaneo de seguridad automatizado, identidades git por agente y soporta más de 22 proveedores de LLM.

OpenClawRadar
La Extensión Crispy para VS Code Agrega Memoria de Agente y Funciones Multiagente para Claude y Codex
Herramientas

La Extensión Crispy para VS Code Agrega Memoria de Agente y Funciones Multiagente para Claude y Codex

Crispy es una extensión de código abierto para VS Code que envuelve las CLI de Claude Code y Codex con una interfaz gráfica, añadiendo memoria local del agente con búsqueda semántica, sesiones multiagente, bifurcación de conversaciones y vistas de herramientas dedicadas. Se ejecuta en Linux, macOS y Windows bajo licencia MIT.

OpenClawRadar
🦀
Herramientas

Aguja: Un modelo de invocación de herramientas de 26 millones de parámetros construido completamente sin FFN

Needle es un modelo de 26M de parámetros para llamadas a funciones, sin MLPs, que alcanza 6000 tok/s de prefill y 1200 tok/s de decode en dispositivos de consumo. Supera a FunctionGemma-270M, Qwen-0.6B, Granite-350M y LFM2.5-350M en llamadas a herramientas de un solo disparo.

OpenClawRadar