Maximizando el valor en las sesiones de Claude Code: Consejos de eficiencia de tokens

Anthropic publicó una guía práctica para aprovechar al máximo cada token gastado en las sesiones de Claude Code. Cubre los mecanismos de fijación de precios de tokens y ofrece seis tácticas concretas para reducir el desperdicio sin cambiar de modelo.
Qué determina el costo del token
Se te cobra por token, pero en realidad estás pagando por el tiempo de inferencia de GPU. Tres factores deciden el precio de un token: tamaño del modelo, entrada vs salida, y almacenamiento en caché. Los tokens de salida cuestan aproximadamente 5 veces más que los de entrada porque la decodificación ejecuta el modelo una vez por token. Los tokens de entrada en caché son más baratos, y el caché de prompt expira después de una hora.
Seis maneras de reducir el desperdicio de tokens
- Ejecuta
/clearentre tareas — evita que el contexto previo irrelevante se envíe al modelo, reduciendo el uso de tokens. - Establece tu modelo y nivel de esfuerzo antes de comenzar — cambiarlos a mitad de la conversación rompe el caché de prompt, aumentando el costo.
- Menciona archivos con @ en lugar de nombrarlos — el archivo se adjunta directamente a tu mensaje, ahorrando una llamada de lectura o una búsqueda en el repositorio.
- Añade banderas silenciosas a comandos ruidosos, o ejecútalos en un subagente — la salida del comando permanece en la conversación durante el resto de la sesión.
- Ejecuta
/contextuna vez en una sesión nueva — muestra lo que está cargado (CLAUDE.md, herramientas MCP), para que puedas eliminar elementos innecesarios. /compactantes de tomar un descanso — el caché de prompt expira después de una hora, y resumir mientras está en caché es más barato.
La guía enfatiza que ser eficiente con los tokens no se trata de usar menos en general, sino de asegurarse de que los que uses vayan dirigidos a la tarea real. Por ejemplo, en una sesión, Claude lee el test y el archivo que cubre, edita y termina en pocas turnos. En otra, busca con grep, lee una docena de archivos para llegar a los mismos dos, y arrastra todo ese contexto a cada turno posterior, costando más y haciendo que el modelo piense en archivos irrelevantes.
📖 Lee la fuente completa: HN AI Agents
👀 Ver también

Ejecutando OmniCoder-9B localmente con detalles de configuración de llama.cpp
Un desarrollador logró un puntaje promedio del 96.7% en HumanEval con OmniCoder-9B en hardware de gama media usando banderas específicas de llama.cpp, incluyendo --reasoning-budget 0 para desactivar la salida de cadena de pensamiento. La configuración utilizó un modelo cuantizado Q6_K ejecutándose en una RTX 3080 con 10GB de VRAM.

Cinco Problemas Comunes de Configuración de OpenClaw que Inflan los Costos de la API
Una publicación de Reddit identifica cinco problemas de configuración en las configuraciones de OpenClaw que conducen a un consumo excesivo de créditos de API, incluido el uso de modelos costosos para tareas rutinarias, límites de presupuesto faltantes, puertas de enlace abiertas, memoria no administrada y habilidades no auditadas.

Actualización de OpenClaw v2.0: Lista de Verificación Crítica Previo a la Actualización para Evitar Cambios Disruptivos
La última actualización de OpenClaw introduce 12 cambios importantes, un nuevo sistema de complementos y más de 30 parches de seguridad. Esta guía describe cinco verificaciones esenciales que realizar antes de actualizar, incluyendo el cambio de nombre de variables de entorno, la migración del directorio de estado y la reconfiguración de la automatización del navegador.

Soluciones prácticas para problemas de confiabilidad de OpenClaw
Un desarrollador comparte ocho técnicas específicas que mejoraron su configuración de OpenClaw, incluyendo un sistema de memoria de 3 niveles con registros diarios y un grafo de conocimiento, gestión de puntuaciones de activación y aplicación de reglas basadas en archivos.