Depuración de Tiempos de Espera en OpenClaw + Modelo Local de Ollama: Cinco Soluciones para Fallos Silenciosos

✍️ OpenClawRadar📅 Publicado: 15 de abril de 2026🔗 Source
Depuración de Tiempos de Espera en OpenClaw + Modelo Local de Ollama: Cinco Soluciones para Fallos Silenciosos
Ad

Problema: Los agentes de OpenClaw fallan en silencio con modelos locales de Ollama

Un desarrollador que depuraba OpenClaw 2026.4.2 con Ollama 0.20.2 y el modelo Gemma 4 26B-A4B Q8_0 en un Mac Studio M4 Max descubrió que los agentes no respondían después de un comando /new, a pesar de que el modelo funcionaba instantáneamente mediante ollama run. No aparecieron errores en los registros, y el agente no mostraba indicador de escritura.

Causas principales y soluciones

  • Causa principal #1: Generador de slugs bloqueante: El hook session-memory de OpenClaw ejecuta un generador de slugs que envía una solicitud a Ollama con un tiempo de espera fijo de 15 segundos. Si el modelo no puede procesar el prompt de sistema de OpenClaw a tiempo, OpenClaw abandona la solicitud, pero Ollama continúa procesándola, bloqueando las solicitudes posteriores del agente.
    Solución: openclaw hooks disable session-memory
  • Causa principal #2: Prompt de sistema extenso: OpenClaw inyecta aproximadamente 38,500 caracteres de prompt de sistema (identidad, herramientas, archivos de arranque) por solicitud. Los modelos locales requieren 40-60 segundos para la fase de prefiltrado.
    Solución: Agregar a la configuración para omitir la inyección de arranque y limitar caracteres:
    { "agents": { "defaults": { "skipBootstrap": true, "bootstrapTotalMaxChars": 500 } } }
    Esto reduce el prompt a ~19K caracteres.
  • Causa principal #3: Tiempo de espera inactivo oculto: OpenClaw tiene un DEFAULT_LLM_IDLE_TIMEOUT_MS de 60 segundos. Si el modelo no produce un primer token dentro de este tiempo, mata la conexión y cambia silenciosamente a un modelo de respaldo (por ejemplo, Claude Sonnet).
    Solución: Establecer una clave de configuración no documentada:
    { "agents": { "defaults": { "llm": { "idleTimeoutSeconds": 300 } } } }
  • Causa principal #4: Procesamiento en serie de Ollama: Ollama procesa las solicitudes en serie, por lo que las solicitudes de generador de slugs abandonadas pueden ocupar espacios de procesamiento.
    Solución: Agregar a la configuración del servicio/plist de Ollama: OLLAMA_NUM_PARALLEL=4
  • Causa principal #5: Retraso del modo de pensamiento: Gemma 4 tiene por defecto una fase de pensamiento/razonamiento que agrega 20-30 segundos antes del primer token.
    Solución: Desactivar en la configuración:
    { "agents": { "defaults": { "thinkingDefault": "off" } } }
Ad

Configuración completa funcional

El desarrollador proporcionó esta configuración completa para una configuración funcional:

{ "agents": { "defaults": { "model": { "primary": "ollama/gemma4:26b-a4b-it-q8_0", "fallbacks": ["anthropic/claude-sonnet-4-6"] }, "thinkingDefault": "off", "timeoutSeconds": 600, "skipBootstrap": true, "bootstrapTotalMaxChars": 500, "llm": { "idleTimeoutSeconds": 300 } } } }

Además, fijar el modelo en memoria para evitar su descarga entre solicitudes:

curl http://localhost:11434/api/generate -d '{"model":"gemma4:26b-a4b-it-q8_0","keep_alive":-1,"options":{"num_ctx":16384}}'

Resultados y compensaciones

Después de aplicar las soluciones, el primer mensaje después de /new tarda unos 60 segundos debido al prefiltrado del prompt de sistema, lo cual se describe como inevitable para modelos locales. Los mensajes posteriores son rápidos porque Ollama almacena en caché el estado KV. La configuración utiliza 31GB de VRAM, 100% de GPU y una ventana de contexto de 16K, funcionando completamente local sin costo de API.

El retraso inicial es la compensación por una operación completamente local, privacidad y sin costo. El desarrollador señala que vale la pena si se priorizan esos factores.

📖 Leer la fuente completa: r/LocalLLaMA

Ad

👀 Ver también

Método para Transferir el Contexto del Usuario de ChatGPT a Claude
Guías

Método para Transferir el Contexto del Usuario de ChatGPT a Claude

Un usuario de Reddit comparte un método de dos prompts para extraer un perfil cognitivo detallado de ChatGPT y crear una constitución de IA portátil para transferir a Claude, abordando la dificultad de migrar entre sistemas de IA.

OpenClawRadar
Trellis 2 se ejecuta con éxito en ROCm 7.11 con AMD RX 9070 XT.
Guías

Trellis 2 se ejecuta con éxito en ROCm 7.11 con AMD RX 9070 XT.

Un desarrollador logró que Trellis 2 funcionara en Linux Mint 22.3 con una AMD RX 9070 XT usando ROCm 7.11, solucionando dos problemas clave: la inestabilidad de ROCm con tensores N altos y una función hipMemcpy2D defectuosa en CuMesh.

OpenClawRadar
Reemplazando la Memoria Predeterminada de OpenClaw con Redis y Qdrant para Sistemas Multi-Agente en Producción
Guías

Reemplazando la Memoria Predeterminada de OpenClaw con Redis y Qdrant para Sistemas Multi-Agente en Producción

Un desarrollador reemplazó la memoria SQLite predeterminada de OpenClaw con Redis para el estado efímero y Qdrant para la memoria vectorial persistente, resolviendo así los problemas de escalabilidad en configuraciones multiagente, implementando búsqueda semántica, intercambio entre agentes y escrituras concurrentes.

OpenClawRadar
AGENTS.md Bien Hecho: Un Aumento del 25% en Precisión — o una Caída del 30%
Guías

AGENTS.md Bien Hecho: Un Aumento del 25% en Precisión — o una Caída del 30%

Augment Code probó de frente los archivos AGENTS.md: los mejores equivalen a una actualización de modelo de Haiku a Opus; los peores perjudican el resultado. Las tablas de decisión, los flujos de trabajo procedimentales y la divulgación progresiva ganan.

OpenClawRadar