Corrección de Tiempo de Espera de OpenClaw LLM para Carga de Modelo Frío

✍️ OpenClawRadar📅 Publicado: 15 de abril de 2026🔗 Source
Corrección de Tiempo de Espera de OpenClaw LLM para Carga de Modelo Frío
Ad

Problema: Tiempos de espera de modelos en frío a los 60 segundos

Los usuarios informaron que los modelos locales cargados en frío en OpenClaw fallaban consistentemente después de aproximadamente 60 segundos, a pesar de tener configurado un tiempo de espera general del agente mucho mayor. Este problema también ocurría con modelos en la nube a través de Ollama y, a veces, con OpenAI Codex.

El patrón típico de fallo:

  • Los modelos funcionan si ya están calientes
  • Los modelos en frío fallan alrededor de los ~60 segundos
  • Los registros mencionan tiempo de espera / conmutación por error embebida / estado: 408
  • El modelo de respaldo toma el control

Configuraciones engañosas

La fuente advierte que varias opciones de configuración obvias NO son la solución real y pueden llevar a los desarrolladores por el camino equivocado:

  • agents.defaults.timeoutSeconds
  • Exportaciones de .zshrc
  • LLM_REQUEST_TIMEOUT
  • Culpar inmediatamente a LM Studio / Ollama
Ad

Causa raíz

El problema surge porque OpenClaw tiene un tiempo de espera de inactividad del LLM del ejecutor embebido separado para el período antes de que el modelo emita el primer token transmitido.

Rastro de la fuente encontrado en:

src/agents/pi-embedded-runner/run/llm-idle-timeout.ts

Valor predeterminado:

DEFAULT_LLM_IDLE_TIMEOUT_MS = 60_000

La ruta de configuración se resuelve desde:

cfg?.agents?.defaults?.llm?.idleTimeoutSeconds

Por lo tanto, el parámetro de configuración real es:

agents.defaults.llm.idleTimeoutSeconds

La solución

Después de las pruebas, la configuración que funciona es:

{
  "agents": {
    "defaults": {
      "llm": {
        "idleTimeoutSeconds": 180
      }
    }
  }
}

Las pruebas mostraron que una llamada en frío a Gemma que antes fallaba alrededor de los 60 segundos sobrevivió más allá de ese umbral y finalmente respondió con éxito sin una conmutación por error inmediata.

Configuración permanente recomendada

{
  "agents": {
    "defaults": {
      "timeoutSeconds": 300,
      "llm": {
        "idleTimeoutSeconds": 300
      }
    }
  }
}

La recomendación de 300 segundos tiene en cuenta que los modelos locales son impredecibles, donde las conmutaciones por error falsas son más problemáticas que esperar más tiempo para modelos genuinamente en frío.

📖 Leer la fuente completa: r/openclaw

Ad

👀 Ver también

Enmarcar Conversaciones de IA en Lugar de Escribir Prompts Perfectos
Consejos

Enmarcar Conversaciones de IA en Lugar de Escribir Prompts Perfectos

Un desarrollador en r/ClaudeAI describe cómo pasó de obsesionarse con redactar prompts perfectos a enmarcar las conversaciones con Claude AI como situaciones, lo que resultó en salidas significativamente mejores.

OpenClawRadar
Los usuarios de Claude informan sesiones más rápidas al solicitar documentos en markdown en lugar de documentos de Word.
Consejos

Los usuarios de Claude informan sesiones más rápidas al solicitar documentos en markdown en lugar de documentos de Word.

Un usuario de Claude descubrió que solicitar documentos en markdown en lugar de documentos de Word reduce significativamente el tiempo de respuesta y el uso de tokens. La IA genera nativamente markdown, mientras que crear archivos .docx requiere activar un entorno Python y ejecutar scripts de conversión.

OpenClawRadar
Orquestración Multi-Agente en OpenClaw: Centralizar Reglas, Generar Sub-Agentes
Consejos

Orquestración Multi-Agente en OpenClaw: Centralizar Reglas, Generar Sub-Agentes

Un usuario de OpenClaw describe cómo pasó de tener instrucciones duplicadas en los espacios de trabajo a un único agente principal que genera subagentes, aplicando reglas arquitectónicas (por ejemplo, persistir datos estructurados como .JSON) en todos los espacios de trabajo de los agentes.

OpenClawRadar
Ejecutando MiniMax M2.7 Q8_0 128K en 2x3090 con descarga de CPU: benchmarks y configuración del mundo real
Consejos

Ejecutando MiniMax M2.7 Q8_0 128K en 2x3090 con descarga de CPU: benchmarks y configuración del mundo real

Un usuario ejecuta con éxito MiniMax M2.7 en Q8_0 con 128K de contexto en dos RTX 3090 más RAM DDR4, logrando ~50 tps en procesamiento de prompt y ~10 tps en generación de tokens, y comparte sus flags de llama-server.

OpenClawRadar