Cómo un agente inactivo quemó 50 millones de tokens al día – y cómo solucionarlo

✍️ OpenClawRadar📅 Publicado: 30 de junio de 2026🔗 Source
Cómo un agente inactivo quemó 50 millones de tokens al día – y cómo solucionarlo
Ad

Un usuario de OpenClaw en Reddit reportó que su uso de API de LLM se disparó de 11M a 51M tokens por día durante seis días, totalizando 196M tokens — la mayoría desperdiciados por un agente inactivo. La causa: un agente olvidado llamado "main" era consultado por el latido de OpenClaw cada 30 minutos, cargando un historial de sesión de 225k tokens solo para responder "HEARTBEAT_OK".

La fuga: Dominio de cacheRead

Dos números resaltaron del análisis de transcripciones:

  • El 95% de los tokens eran cacheRead — el modelo releía el historial de conversación antiguo en lugar de hacer trabajo nuevo.
  • El 56% de todos los tokens provenían de un solo agente llamado "main" que ya ni siquiera se usaba.

El latido se ejecutaba 48 veces al día, cargando cada vez una sesión de meses de antigüedad. Incluso un HEARTBEAT.md vacío — destinado a desactivar el latido — no logró detenerlo en esa versión.

Ad

La solución: Dos pasos

  1. Limpiar la sesión inflada. Borra el archivo de sesión del agente inactivo. El siguiente latido comienza desde cero. Solo elimina sesiones basura, conserva las sesiones reales de DM/chat.
  2. Evitar que se vuelva a llenar. Una limpieza única no es suficiente porque el latido sigue añadiendo a la sesión. Usa cambios de configuración:
    • Establece heartbeat every: "0m" para desactivar el latido por completo si el agente no hace nada, o
    • Establece isolatedSession: true y lightContext: true para que cada latido se ejecute en un contexto nuevo y pequeño (~2-5k tokens) en lugar del historial completo (~100k+).

Bonus: otros agentes reutilizaban una sesión que crecía sin parar porque un ID de sesión no iniciaba realmente de nuevo en esa versión. Reinicia la sesión entre trabajos para mantener cada ejecución limpia.

Conclusiones

  • Los agentes inactivos no son gratis — un latido en una sesión grande puede costar más que trabajo real.
  • Si la mayoría de tokens son cacheRead, estás pagando para releer historial, no por trabajo nuevo.
  • Verifica que "desactivado" esté realmente desactivado — un HEARTBEAT.md vacío no detuvo el latido en la versión reportada.
  • Lee las transcripciones por turno; el uso de tokens se registra allí por entrada/salida/cacheRead.

El usuario redujo su consumo de tokens a más de la mitad con estos cambios de configuración.

📖 Lee la fuente completa: r/openclaw

Ad

👀 Ver también

Perspectivas Prácticas sobre la Configuración de OpenClaw desde la Experiencia con Docker/Windows
Guías

Perspectivas Prácticas sobre la Configuración de OpenClaw desde la Experiencia con Docker/Windows

Un desarrollador comparte lecciones específicas de ejecutar OpenClaw en Docker con Windows 11/WSL2, cubriendo problemas de persistencia, configuración del bot de Discord, enfoques de gestión de memoria y soluciones alternativas para automatización del navegador.

OpenClawRadar
Servidor RTX PRO 6000 4x personalizado vs Dell GB300: Decisión para 30 pipelines ajustados
Guías

Servidor RTX PRO 6000 4x personalizado vs Dell GB300: Decisión para 30 pipelines ajustados

Un análisis profundo de dos arquitecturas on-prem para ejecutar ~30 pipelines de producción afinados: un servidor 4U personalizado con 4-8x RTX PRO 6000 Blackwell (96 GB cada una) vs el appliance NVIDIA GB300 Grace Blackwell con 252 GB HBM3e + 496 GB de memoria unificada.

OpenClawRadar
Consideraciones clave: Mac Mini M4 Pro vs Mac Studio M4 Max para inferencia local de LLM
Guías

Consideraciones clave: Mac Mini M4 Pro vs Mac Studio M4 Max para inferencia local de LLM

Un desarrollador compara Mac Mini M4 Pro (CPU 12C/GPU 16C, 273 GB/s) vs Mac Studio M4 Max (CPU 16C/GPU 40C, 546 GB/s), ambos con 64GB/1TB, para inferencia local con Gemma 4 y Qwen. Pregunta clave: ¿vale la pena el salto de ancho de banda por $600?

OpenClawRadar
Un Solo Sopa, Un Solo Plato: Un Principio Cocinero Japonés para el Agotamiento por IA
Guías

Un Solo Sopa, Un Solo Plato: Un Principio Cocinero Japonés para el Agotamiento por IA

Takuya aplica el principio culinario japonés 'Ichiju Issai' para combatir la fatiga de la IA: simplifica tu stack tecnológico a una herramienta principal y una secundaria, como una comida de arroz, sopa y un plato.

OpenClawRadar