Solución al Ralentizamiento de OpenClaw en Sesiones Largas: contextoInyección continuation-skip para el Caché de llama.cpp

Si tu OpenClaw autoalojado con llama.cpp se vuelve progresivamente más lento a medida que las sesiones superan los 90k tokens, el culpable podría ser una única configuración de OpenClaw que invalida silenciosamente la caché de prompt en cada turno. Un usuario en r/openclaw rastreó el problema y encontró una solución simple.
La Configuración
- Qwen3.6-27B-Q8_0 en dos RTX 3090s (paralelo tensorial)
- llama-server con
--cache-prompt,--ctx-size 400000,--parallel 2 - OpenClaw conectado a través de LAN
Los Síntomas
Los registros de llama-server mostraban en cada turno:
forzando reprocesamiento completo del prompt por falta de datos de caché
punto de control de contexto invalidado eliminado (pos_min = 57172)
punto de control de contexto invalidado eliminado (pos_min = 60139)
punto de control de contexto invalidado eliminado (pos_min = 91076)
tiempo de evaluación del prompt = 130511 ms / 91403 tokens91k tokens reprocesados desde cero cada turno — 130 segundos. La caché estaba habilitada, los puntos de control existían, pero llama.cpp no encontraba coincidencias y recurría al reprocesamiento completo.
La Causa Raíz
La configuración de OpenClaw contextInjection, por defecto always, reinyecta todos los archivos bootstrap del espacio de trabajo (AGENTS.md, SOUL.md, USER.md, TOOLS.md, MEMORY.md, HEARTBEAT.md, ~15kb) en el prompt del sistema en cada turno, incluidos los turnos de continuación. Esto cambia la secuencia de tokens, por lo que la caché de prompt de llama.cpp (que se basa en la coincidencia exacta de prefijos) no puede reutilizarse.
La Solución
openclaw config set agents.defaults.contextInjection continuation-skip --mergeLuego reinicia la puerta de enlace. continuation-skip solo inyecta los archivos bootstrap en mensajes de usuario nuevos, no en turnos de continuación, manteniendo el prompt estable y la caché válida.
Los Resultados
Antes: 91,403 tokens reprocesados por turno, 130s de evaluación del prompt, 0% de reutilización de caché, más de 2 min por respuesta.
Después: 513 tokens nuevos por turno, 1.3s de evaluación del prompt, 99.7% de reutilización de caché, ~5 segundos por respuesta. 100 veces más rápido.
Cómo Diagnosticar
ssh your-server "journalctl -u llama.service --no-pager -n 50 | grep -iE 'cache|re-process|checkpoint'"Señales de caché rota: forzando reprocesamiento completo del prompt por falta de datos de caché, punto de control de contexto invalidado eliminado repetido, procesamiento de prompt de más de 30 segundos. Señales de caché saludable: punto de control de contexto restaurado, f_keep = 0.99+, gráficos reutilizados = número grande, procesamiento de prompt inferior a 5 segundos.
Además, ajusta --ctx-size a 400k (200k por sesión), contextTokens de OpenClaw a 200k y memoryFlush.softThresholdTokens de 30k a 10k para mejoras adicionales.
📖 Lee la fuente original: r/openclaw
👀 Ver también

Configurando OpenClaw para una Comunicación Fluida entre Agentes
Un usuario de Reddit comparte configuraciones específicas para OpenClaw que reducen los tiempos de espera en la comunicación entre agentes, incluyendo ajustes de visibilidad de herramientas, directivas de memoria y soluciones para la limitación ANNOUNCE_SKIP.

Modificando el mensaje predeterminado del sistema de OpenClaw para eludir las restricciones de contenido.
Un usuario modificó el archivo de configuración de OpenClaw para cambiar el mensaje del sistema predeterminado de "Eres un asistente útil, respetuoso y honesto" a un mensaje personalizado que ignora los filtros de seguridad externos, eliminando efectivamente las restricciones de contenido. El proceso implica editar config.js en el directorio de instalación de node-llama-cpp.

Correcciones de Qwen 3.5 en la Llamada de Herramientas para Uso Agéntico: Estado del Servidor y Soluciones en el Lado del Cliente
Un análisis detallado identifica cuatro errores que rompen la llamada a herramientas de Qwen 3.5 en configuraciones agenticas, rastrea las correcciones del servidor hasta abril de 2026 y proporciona una función de Python del lado del cliente para analizar las llamadas a herramientas XML cuando los servidores fallan.

Guía práctica de configuración y puesta en marcha del agente de IA autohospedado OpenClaw
OpenClaw es un agente de IA autoalojado que se integra con aplicaciones de mensajería y mantiene memoria persistente a través de un sistema basado en archivos. Las recomendaciones clave de configuración incluyen comenzar con la interfaz de terminal, conectar solo un canal de mensajería inicialmente y configurar correctamente el archivo SOUL.md para personalidad y reglas de seguridad.