Cómo reducir los costos del agente OpenClaw en un 80% con el cambio de modelo

Un usuario de Reddit pasó dos semanas registrando manualmente cada interacción de su agente OpenClaw para averiguar a dónde iba su dinero. Los resultados son un plan claro para optimizar el gasto en agentes de IA.
El desglose
Durante 14 días en un agente de Telegram + Discord, el uso de tokens se desglosó de la siguiente manera:
- Latidos (encuestas cada 30 min) — 38% del uso. Ejecutándose en Opus a ~$6.75/M de tokens. Un desperdicio total para un ping de estado.
- Lecturas y resúmenes de archivos — 29% del uso. También en Opus. Flash maneja estos idénticamente.
- Conversaciones reales — 22% del uso. Aquí la calidad del modelo importa.
- Tareas complejas — 11% del uso. Donde Opus realmente supera a Flash.
En total, el 67% del gasto se destinó a tareas donde DeepSeek V4 Flash ($0.14/M) ofrecería la misma calidad que Opus ($6.75/M efectivo después del tokenizador).
La solución: Flash por defecto, escalar solo cuando sea necesario
Configura tu modelo principal como deepseek/deepseek-v4-flash en openclaw.json:
"agents": {
"defaults": {
"model": {
"primary": "deepseek/deepseek-v4-flash"
}
}
}Luego usa /model anthropic/claude-opus-4-7 a mitad de sesión cuando encuentres algo realmente difícil. El cambio es instantáneo: sin reinicio, misma sesión. Escribe /model deepseek/deepseek-v4-flash cuando termines para volver al económico.
Resultados
Los costos se redujeron de ~$170/mes a ~$35/mes. La diferencia de calidad en latidos, lecturas de archivos y preguntas simples fue literalmente cero.
El usuario señala que el nivel gratuito de BetterClaw (con BYOK) ahora muestra el gasto de API por tarea, lo que habría detectado el desperdicio de latidos de inmediato. Pero la jugada principal —cambiar el modelo principal a Flash y usar /model para subir a Opus solo cuando sea necesario— es la verdadera conclusión.
📖 Lee la fuente completa: r/openclaw
👀 Ver también

Corrección de deriva de OpenClaw: Cuatro habilidades del operador para fortalecer los flujos de trabajo de agentes
Un desarrollador comparte cuatro habilidades de operador — Outcome Guard, Direction Clarifier, Routing Enforcer, Completion Verifier — para evitar que los agentes se desvíen y den tareas por terminadas prematuramente.

Desperdicio de tokens en Claude Code: Una autoauditoría muestra que las correcciones conductuales superan al cambio de modelo
Un usuario midió el uso de tokens en Claude Code y descubrió que usar /clear entre tareas, planificar antes de editar y prohibir la relectura de archivos ya editados ahorraba más tokens que cambiar de modelo. La disciplina práctica supera a los envoltorios.

Construir con Codex, Ejecutar con OpenClaw: Una División Práctica que Funciona
Un desarrollador comparte cómo superó la frustración con OpenClaw al construir la lógica de automatización con Codex y usar OpenClaw puramente como la capa de ejecución, además de cómo Apple Messages vía CarPlay lo acercó a un asistente tipo Jarvis.

La auditoría de tokens de Claude Code revela costos ocultos por la carga predeterminada de herramientas.
Un desarrollador analizó 926 sesiones de Claude Code y encontró 45,000 tokens cargados al inicio de cada sesión, con 20,000 tokens provenientes de definiciones de esquemas de herramientas del sistema. Habilitar la configuración ENABLE_TOOL_SEARCH redujo el contexto inicial de 45k a 20k tokens, ahorrando 14,000 tokens por turno.