Cómo un agente inactivo quemó 50 millones de tokens al día – y cómo solucionarlo

Un usuario de OpenClaw en Reddit reportó que su uso de API de LLM se disparó de 11M a 51M tokens por día durante seis días, totalizando 196M tokens — la mayoría desperdiciados por un agente inactivo. La causa: un agente olvidado llamado "main" era consultado por el latido de OpenClaw cada 30 minutos, cargando un historial de sesión de 225k tokens solo para responder "HEARTBEAT_OK".
La fuga: Dominio de cacheRead
Dos números resaltaron del análisis de transcripciones:
- El 95% de los tokens eran cacheRead — el modelo releía el historial de conversación antiguo en lugar de hacer trabajo nuevo.
- El 56% de todos los tokens provenían de un solo agente llamado "main" que ya ni siquiera se usaba.
El latido se ejecutaba 48 veces al día, cargando cada vez una sesión de meses de antigüedad. Incluso un HEARTBEAT.md vacío — destinado a desactivar el latido — no logró detenerlo en esa versión.
La solución: Dos pasos
- Limpiar la sesión inflada. Borra el archivo de sesión del agente inactivo. El siguiente latido comienza desde cero. Solo elimina sesiones basura, conserva las sesiones reales de DM/chat.
- Evitar que se vuelva a llenar. Una limpieza única no es suficiente porque el latido sigue añadiendo a la sesión. Usa cambios de configuración:
- Establece
heartbeat every: "0m"para desactivar el latido por completo si el agente no hace nada, o - Establece
isolatedSession: trueylightContext: truepara que cada latido se ejecute en un contexto nuevo y pequeño (~2-5k tokens) en lugar del historial completo (~100k+).
- Establece
Bonus: otros agentes reutilizaban una sesión que crecía sin parar porque un ID de sesión no iniciaba realmente de nuevo en esa versión. Reinicia la sesión entre trabajos para mantener cada ejecución limpia.
Conclusiones
- Los agentes inactivos no son gratis — un latido en una sesión grande puede costar más que trabajo real.
- Si la mayoría de tokens son
cacheRead, estás pagando para releer historial, no por trabajo nuevo. - Verifica que "desactivado" esté realmente desactivado — un
HEARTBEAT.mdvacío no detuvo el latido en la versión reportada. - Lee las transcripciones por turno; el uso de tokens se registra allí por entrada/salida/cacheRead.
El usuario redujo su consumo de tokens a más de la mitad con estos cambios de configuración.
📖 Lee la fuente completa: r/openclaw
👀 Ver también

Optimización de la Configuración de OpenClaw: Patrones e Ideas Prácticas
Los usuarios de OpenClaw comparten patrones de configuración efectivos, como el uso de cron para tareas programadas y la creación de subagentes especializados, para mejorar la funcionalidad y la eficiencia de costos.

Mapas de Flujo: Aprendiendo la Integral de un Modelo de Difusión para un Muestreo más Rápido
Sander Dieleman explica los mapas de flujo — redes neuronales que predicen directamente la integral de la EDO de un modelo de difusión, permitiendo un muestreo más rápido, aprendizaje basado en recompensas y direccionabilidad.

OpenClaw 4.1 con Gemma 4 Stack: Arquitectura Híbrida y Correcciones de Configuración
Una publicación de Reddit detalla una pila de agentes locales optimizada que combina OpenClaw 4.1 con el modelo Gemma 4 de Google, con una arquitectura híbrida, correcciones de configuración específicas para la llamada a herramientas de Ollama y ajustes en la ventana de contexto.

Guía de Automatización de Búsqueda de Empleo de OpenClaw — Preferencias, Cron Jobs y Filtrado
Una guía práctica para usar OpenClaw y automatizar la búsqueda de empleo: define un perfil de preferencias claro, elige una herramienta para obtener ofertas (automatización del navegador, scraping o API estructurada) y valida el flujo antes de configurar un cron job.