Solución al Ralentizamiento de OpenClaw en Sesiones Largas: contextoInyección continuation-skip para el Caché de llama.cpp

✍️ OpenClawRadar📅 Publicado: 30 de junio de 2026🔗 Source
Solución al Ralentizamiento de OpenClaw en Sesiones Largas: contextoInyección continuation-skip para el Caché de llama.cpp
Ad

Si tu OpenClaw autoalojado con llama.cpp se vuelve progresivamente más lento a medida que las sesiones superan los 90k tokens, el culpable podría ser una única configuración de OpenClaw que invalida silenciosamente la caché de prompt en cada turno. Un usuario en r/openclaw rastreó el problema y encontró una solución simple.

La Configuración

  • Qwen3.6-27B-Q8_0 en dos RTX 3090s (paralelo tensorial)
  • llama-server con --cache-prompt, --ctx-size 400000, --parallel 2
  • OpenClaw conectado a través de LAN

Los Síntomas

Los registros de llama-server mostraban en cada turno:

forzando reprocesamiento completo del prompt por falta de datos de caché
punto de control de contexto invalidado eliminado (pos_min = 57172)
punto de control de contexto invalidado eliminado (pos_min = 60139)
punto de control de contexto invalidado eliminado (pos_min = 91076)
tiempo de evaluación del prompt = 130511 ms / 91403 tokens

91k tokens reprocesados desde cero cada turno — 130 segundos. La caché estaba habilitada, los puntos de control existían, pero llama.cpp no encontraba coincidencias y recurría al reprocesamiento completo.

La Causa Raíz

La configuración de OpenClaw contextInjection, por defecto always, reinyecta todos los archivos bootstrap del espacio de trabajo (AGENTS.md, SOUL.md, USER.md, TOOLS.md, MEMORY.md, HEARTBEAT.md, ~15kb) en el prompt del sistema en cada turno, incluidos los turnos de continuación. Esto cambia la secuencia de tokens, por lo que la caché de prompt de llama.cpp (que se basa en la coincidencia exacta de prefijos) no puede reutilizarse.

Ad

La Solución

openclaw config set agents.defaults.contextInjection continuation-skip --merge

Luego reinicia la puerta de enlace. continuation-skip solo inyecta los archivos bootstrap en mensajes de usuario nuevos, no en turnos de continuación, manteniendo el prompt estable y la caché válida.

Los Resultados

Antes: 91,403 tokens reprocesados por turno, 130s de evaluación del prompt, 0% de reutilización de caché, más de 2 min por respuesta.

Después: 513 tokens nuevos por turno, 1.3s de evaluación del prompt, 99.7% de reutilización de caché, ~5 segundos por respuesta. 100 veces más rápido.

Cómo Diagnosticar

ssh your-server "journalctl -u llama.service --no-pager -n 50 | grep -iE 'cache|re-process|checkpoint'"

Señales de caché rota: forzando reprocesamiento completo del prompt por falta de datos de caché, punto de control de contexto invalidado eliminado repetido, procesamiento de prompt de más de 30 segundos. Señales de caché saludable: punto de control de contexto restaurado, f_keep = 0.99+, gráficos reutilizados = número grande, procesamiento de prompt inferior a 5 segundos.

Además, ajusta --ctx-size a 400k (200k por sesión), contextTokens de OpenClaw a 200k y memoryFlush.softThresholdTokens de 30k a 10k para mejoras adicionales.

📖 Lee la fuente original: r/openclaw

Ad

👀 Ver también

Líneas de Base de Enrutamiento de Modelos para el Uso de Claude y OpenAI
Guías

Líneas de Base de Enrutamiento de Modelos para el Uso de Claude y OpenAI

Un desarrollador comparte su estrategia de enrutamiento de modelos utilizando Claude Haiku 4.5, Sonnet 4.6, Opus 4.6 y ChatGPT 5.3 Codex para diferentes tipos de tareas, con respaldos a GPT-5 Mini y GPT-5.4 cuando sea necesario.

OpenClawRadar
Modificando el mensaje predeterminado del sistema de OpenClaw para eludir las restricciones de contenido.
Guías

Modificando el mensaje predeterminado del sistema de OpenClaw para eludir las restricciones de contenido.

Un usuario modificó el archivo de configuración de OpenClaw para cambiar el mensaje del sistema predeterminado de "Eres un asistente útil, respetuoso y honesto" a un mensaje personalizado que ignora los filtros de seguridad externos, eliminando efectivamente las restricciones de contenido. El proceso implica editar config.js en el directorio de instalación de node-llama-cpp.

OpenClawRadar
Las cadenas de respaldo de OpenClaw preservan el tiempo de actividad pero pueden reducir silenciosamente la fiabilidad
Guías

Las cadenas de respaldo de OpenClaw preservan el tiempo de actividad pero pueden reducir silenciosamente la fiabilidad

El mecanismo de respaldo de modelos de OpenClaw puede ocultar problemas de confiabilidad. Un modelo de respaldo más pequeño puede pasar tareas simples pero fallar en las complejas, costando más en reintentos y revisión.

OpenClawRadar
Comprensión de la Arquitectura de Agentes de IA: Capas Deterministas vs. Probabilísticas
Guías

Comprensión de la Arquitectura de Agentes de IA: Capas Deterministas vs. Probabilísticas

Un usuario de Reddit comparte un modelo mental para sistemas de agentes de IA que separa capas deterministas (scripts, comandos, APIs) de capas probabilísticas (razonamiento y decisiones del LLM). La idea clave: trasladar la mayor cantidad de trabajo posible al lado determinista.

OpenClawRadar