Analizando el Consumo de Tokens en la Ventana de Contexto de 1 Millón de Claude: Los Datos Muestran Crecimiento Ilimitado y Acumulación de Fallos de Caché

Análisis del Consumo de Tokens a partir de Datos de Uso Real
Un análisis detallado de la implementación de la ventana de contexto de 1 millón de tokens de Claude revela factores técnicos específicos que causan un consumo rápido de tokens. El autor analizó archivos de sesión JSONL a través de múltiples conversaciones para identificar patrones.
Hallazgos Clave a partir de los Datos
Crecimiento Ilimitado del Contexto: Antes de la ventana de contexto de 1 millón de tokens, la compactación automática se activaba aproximadamente a los 160K tokens. Después de la implementación de 1 millón, este límite desaparece, permitiendo que las sesiones alcancen regularmente 500K+ tokens. Cada solicitud reenvía todo el contexto, lo que significa que a 500K tokens, incluso una simple confirmación cuesta 500K tokens. Si Claude realiza 3 llamadas a herramientas para responder a una solicitud, eso son 1.5 millones de tokens para una sola interacción.
Compounding de Fallas de Caché: Anthropic almacena en caché el contexto en el servidor durante aproximadamente 5 minutos. Después de esta ventana, la siguiente solicitud reprocesa el contexto completo a aproximadamente 10 veces el precio en caché. Aunque la tasa de fallas de caché no ha cambiado (permaneciendo en aproximadamente el 2.5% de los turnos), una falla de caché en un contexto de 500K es significativamente más costosa que una en un contexto de 150K.
Herramienta de Análisis
El autor creó un script de Python que analiza los recuentos de tokens de los archivos de sesión JSONL de Claude sin acceder al contenido de la conversación. El script detecta automáticamente tu directorio de datos de Claude y requiere matplotlib y numpy. El script está disponible en: https://github.com/RyanSeanPhillips/cldctrl/blob/master/docs/context_analysis.py
El autor también menciona CLD CTRL (https://github.com/RyanSeanPhillips/cldctrl), un panel de control de terminal para lanzar y monitorear sesiones de Claude Code, uso de tokens y actividad del proyecto.
📖 Read the full source: r/ClaudeAI
👀 Ver también

Agente SDK vs Claude CLI: La perspectiva de un usuario sobre la diferencia práctica
Un usuario de Reddit cuestiona la diferencia práctica entre el nuevo Agent SDK para Claude y usar Claude CLI para conectar Opus 4.7 localmente.

Problemas de Confiabilidad de la Pasarela OpenClaw: Fallos Silenciosos Después de 25 Días de Uso Intenso
Un informe detallado de un usuario de OpenClaw que ejecutó más de 18 trabajos cron con Telegram durante 25 días identifica un patrón crítico donde la puerta de enlace entra en un estado 'zombificado': aparece como en ejecución pero con toda la funcionalidad congelada. El usuario documenta problemas específicos, incluyendo bloqueos de escritura de sesión retenidos indefinidamente, trabajos cron atascados en estados de ejecución fantasma y fallos silenciosos en configuraciones inválidas.

Claude Code fue eliminado del plan Pro de Anthropic, ahora solo está disponible en los planes Max.
Anthropic ha eliminado Claude Code de su plan Pro ($17-20/mes), haciéndolo disponible solo en planes Max a partir de $100/mes. El plan Pro ahora incluye Claude Cowork, proyectos ilimitados, función de investigación y acceso a más modelos Claude.

RTX 5000 PRO 48GB ofrece 4400 tok/s de almacenamiento en caché de precisión para Qwen3.6-27B
Un constructor de PC por primera vez reporta 4400 tok/s de procesamiento de prompt y 80 tok/s de generación con Qwen3.6-27B-FP8, caché KV de precisión completa en una sola RTX 5000 Pro 48GB, usando vLLM y Claude Code.