Ahorra en las facturas de Claude Code al enrutar los tokens de planificación a modelos más baratos

Un usuario de Reddit informa haber ahorrado alrededor de $40 en tarifas por exceso en Claude Code el mes pasado al dividir el uso de tokens entre modelos. La idea clave: los pasos de planificación (especialmente en refactorizaciones de múltiples archivos) pueden consumir hasta el 80% del presupuesto de tokens, pero la mayor parte de la planificación no necesita el modelo más caro.
Cómo funciona
Escribieron un envoltorio de 30 líneas que dirige el trabajo inicial de 'descubrir qué cambiar' a Haiku 3.5, un modelo más barato. Solo las ediciones reales y la toma de decisiones permanecen en Opus o Sonnet. La configuración tomó aproximadamente 2 horas, incluido determinar qué pasos valía la pena delegar.
Resultados
El último ciclo terminó con presupuesto sobrante por primera vez en 4 meses. El usuario evitó la espera habitual de 2 días para la ventana de reinicio. Ahorro: aproximadamente $40 en tarifas por exceso.
# Pseudocódigo de la lógica del envoltorio:
# 1. Enviar el prompt de planificación a haiku-3.5
# 2. Obtener una lista de archivos y cambios
# 3. Pasar el plan + la instrucción a opus/sonnet para las ediciones reales
Advertencias
La calidad de planificación de Haiku es notablemente peor en decisiones de arquitectura. Para flujos de trabajo de refactorización y prueba donde Opus toma las decisiones reales de todos modos, está bien. Para diseño desde cero ('qué debería ser esta aplicación'), el usuario aún deja que Opus planifique desde cero.
El usuario señala que este patrón es 'probablemente obvio para cualquiera que haya mirado las tablas de precios de modelos de OpenRouter', pero la documentación del subagente de Claude Code es escasa sobre este enfoque exacto.
📖 Leer la fuente completa: r/ClaudeAI
👀 Ver también

Logrando que Claude debata de manera adversarial sin ceder: 5 ajustes de instrucciones que funcionan
Cinco técnicas concretas de ingeniería de prompts para evitar que Claude se muestre evasivo, adulador o inventivo cuando actúa como oponente en un debate, basadas en la creación de sparwithai.com.

llama.cpp Reprocesamiento Masivo de Prompts con Agentes de Codificación: Depuración de Caché KV e Intercambio de Contexto
Un usuario informa que llama.cpp reprocesa más de 40k tokens en prompts similares al usar opencode + pi.dev, a pesar de tener una alta similitud LCP. Se comparten detalles de configuración y causas sospechadas.

Asistente de IA extrae datos de sueño del Apple Watch para la clínica: 5 errores comunes
Un asistente de IA extrajo datos de sueño del Apple Watch en un CSV para una clínica. Problemas clave: tiempo en cama vs dormido, zonas horarias, desplazamiento de fechas, noches sin sueño perdidas y valores de HR inventados.

La mayoría usa Claude al 5% de su capacidad – Así es como solucionarlo
Después de más de 60 horas probando prompts en Claude Opus 4.7, un usuario comparte una receta de 5 pasos: asignar rol, cargar contexto específico, establecer restricciones, definir formato de salida y agregar función de forzado.