La auditoría de tokens de Claude Code revela costos ocultos por la carga predeterminada de herramientas.

✍️ OpenClawRadar📅 Publicado: 15 de abril de 2026🔗 Source
La auditoría de tokens de Claude Code revela costos ocultos por la carga predeterminada de herramientas.
Ad

Investigación sobre desperdicio de tokens revela sobrecarga significativa

Un desarrollador realizó una auditoría de 926 sesiones de Claude Code después de notar un consumo rápido de tokens tras los cambios en los límites de tasa de Anthropic. La investigación reveló que cada sesión de Claude Code comienza con una carga base de aproximadamente 45,000 tokens antes de cualquier entrada del usuario. Esto incluye indicaciones del sistema, definiciones de herramientas, descripciones de agentes, archivos de memoria, descripciones de habilidades y esquemas MCP.

En la ventana de contexto estándar de 200k, esta carga inicial de 45k representa más del 20% del contexto disponible consumido antes de que comience cualquier conversación. Dado que Claude Code opera como un bucle sin estado, todo este contexto se reconstruye y reenvía con cada turno, haciendo que la sobrecarga inicial sea un costo recurrente.

La carga predeterminada de herramientas consume tokens significativos

La auditoría encontró que 20,000 tokens del contexto inicial provenían de definiciones de esquemas de herramientas del sistema. Por defecto, Claude Code carga el esquema JSON completo para cada herramienta disponible en el contexto al inicio de la sesión, independientemente de si esas herramientas se usarán o no.

El desarrollador descubrió una configuración llamada enable_tool_search que habilita la carga diferida de herramientas. Cuando está habilitada, esta configuración solo carga 6 herramientas principales inicialmente y carga el resto bajo demanda en lugar de volcar todos los esquemas de herramientas de una vez.

Ad

El cambio de configuración produce ahorros inmediatos

Para habilitar la carga diferida de herramientas, agregue esto a su settings.json:

{
  "env": {
    "ENABLE_TOOL_SEARCH": "true"
  }
}

Este único cambio de configuración redujo el contexto inicial de 45,000 a 20,000 tokens, con la sobrecarga de herramientas del sistema cayendo de 20,000 a 6,000 tokens. Esto ahorra 14,000 tokens en cada turno de cada sesión.

Implicaciones de costos de las configuraciones predeterminadas

El desarrollador calculó el impacto de esta configuración en su uso. Con sesiones promediando 22 turnos, los 14,000 tokens adicionales por turno ascendieron a 308,000 tokens innecesarios por sesión. En 858 sesiones, esto totalizó 264 millones de tokens.

A precios de lectura de caché ($0.50/MTok), esto representó $132 en costos innecesarios. Sin embargo, dado que más de la mitad de los turnos alcanzaban cachés expiradas (lo que activa precios completos de entrada a $5/MTok), el costo real se estimó entre $132 y $1,300 solo por esta configuración predeterminada.

Estrategias adicionales de optimización

El desarrollador también implementó otras optimizaciones que redujeron el contexto inicial en 4,000-5,000 tokens:

  • Recortar y reestructurar archivos markdown y de memoria de CLAUDE
  • Consolidar descripciones de habilidades
  • Desactivar servidores MCP no utilizados
  • Ajustar inyecciones de esquemas desde ganchos de memoria

Claude Code almacena conversaciones como archivos JSONL localmente bajo ~/.claude/projects/, aunque no hay una forma incorporada de obtener desgloses detallados por sesión, costo por proyecto o categorías de gastos. Se encontró que el comando incorporado /insights era insuficiente para diagnosticar desperdicio.

📖 Leer la fuente completa: r/ClaudeAI

Ad

👀 Ver también

Enrutamiento de subtareas del agente a modelos más baratos redujo el costo de $18 a $4 en la misma refactorización
Consejos

Enrutamiento de subtareas del agente a modelos más baratos redujo el costo de $18 a $4 en la misma refactorización

Un desarrollador redujo los costos de ejecución de agentes de $18 a $4 al enrutar subtareas rutinarias (lint, renombrar, ediciones de configuración) a modelos baratos como DeepSeek V4 Pro y Tencent Hunyuan Hy3, reservando Opus 4.7 para razonamiento complejo.

OpenClawRadar
Ahorra en las facturas de Claude Code al enrutar los tokens de planificación a modelos más baratos
Consejos

Ahorra en las facturas de Claude Code al enrutar los tokens de planificación a modelos más baratos

Un usuario ahorró $40 en tarifas por exceso al dividir los flujos de trabajo de Claude Code: los pasos de planificación van a Haiku 3.5, las ediciones reales y las decisiones permanecen en Opus/Sonnet. Un envoltorio de 30 líneas maneja el enrutamiento; la configuración tomó unas 2 horas.

OpenClawRadar
Corrección de velocidad de procesamiento de prompts en Llama.cpp usando el parámetro --ubatch-size
Consejos

Corrección de velocidad de procesamiento de prompts en Llama.cpp usando el parámetro --ubatch-size

Un usuario descubrió que ajustar --ubatch-size para que coincida con el tamaño de la caché L3 de la GPU (64MB para Radeon 9070XT) mejoró drásticamente la velocidad de procesamiento de prompts para modelos grandes como Qwen 27B en Llama.cpp, haciendo que la invocación de código Claude sea utilizable.

OpenClawRadar
No asuma que los modelos caros son mejores: un estudio de caso muestra un ahorro de costos de 13 veces al probar
Consejos

No asuma que los modelos caros son mejores: un estudio de caso muestra un ahorro de costos de 13 veces al probar

Un usuario de Reddit reemplazó GPT-5.4 con Gemini 3.1 Flash Lite en una tarea de clasificación, logrando una precisión idéntica del 85% a 1/13 del costo después de ejecutar evaluaciones en 21 modelos.

OpenClawRadar