Deja de quemar tokens de Claude Code en preguntas de chat

Un desarrollador en r/ClaudeAI estaba alcanzando su límite semanal de $20 en Claude Code cada jueves. Después de auditar las últimas 50 indicaciones, se dio cuenta de que la mayoría eran preguntas simples de chat que no necesitaban un agente: "¿qué dice este stack trace?", "regex para coincidir con X", "explica qué hace este one-liner de bash", "convierte este curl a httpie" y "cuál es el jq para extraer el campo Y de esto".
Cada una de esas indicaciones en Claude Code estaba pagando el costo total del agente — carga de contexto, definiciones de herramientas, tokens de planificación — para una respuesta de una línea. La solución: enrutar todas las preguntas tipo chat a una ventana de chat normal usando un modelo barato (Haiku o GPT-mini). Reservar Claude Code para ediciones de múltiples archivos, refactorizaciones y depuración que realmente necesiten leer el código base.
Resultados después de ~3 semanas
- Pasó de alcanzar el límite semanal para el jueves a no alcanzarlo nunca, haciendo la misma cantidad de trabajo.
- Gasto adicional en llamadas a la API de modelos baratos: aproximadamente $3–4 por semana — insignificante.
- Beneficio adicional: las respuestas de modelos baratos llegan más rápido que Claude Code iniciando su bucle de agente, por lo que las preguntas rápidas se sienten más rápidas.
Nota sobre el flujo de trabajo
Para evitar cambiar entre la terminal (Claude Code) y una ventana de chat, ahora usan una terminal llamada yaw.sh que coloca un chat de múltiples proveedores en el indicador junto a Claude Code. Pero cualquier herramienta de chat en otra ventana funciona — el cambio en el flujo de trabajo es lo que ahorra los tokens.
TL;DR: Si estás alcanzando el límite semanal de Claude Code, audita tus últimas 50 indicaciones. Probablemente la mayoría no necesita un agente. Sácalas y probablemente dejarás de alcanzar el límite.
📖 Lee la fuente completa: r/ClaudeAI
👀 Ver también

Directiva del Modo Sigiloso de Claude para la Ejecución Autónoma de IA
Un usuario de Reddit comparte una directiva de 'modo sigiloso' que obliga a Claude a operar en silencio y de forma autónoma, entregando resultados completos de una sola vez sin salida de conversación hasta que el trabajo esté terminado.

Reduciendo el uso de tokens MCP al reemplazar servidores con alternativas CLI
Un desarrollador descubrió que los servidores MCP consumían entre el 30 y el 40% de su ventana de contexto con definiciones de herramientas, por lo que reemplazó cuatro servidores MCP con herramientas CLI donde estaban disponibles, reduciendo de 6 a 2 servidores MCP mientras mantenía la funcionalidad.

Cómo Prompto Modelos de IA en 2026 vs Hace un Año: 3 Cambios Clave
Un desarrollador comparte tres cambios concretos: pasar de plantillas de prompts a habilidades reutilizables, escribir metas en lugar de instrucciones paso a paso, y usar comandos /loop para proyectos de larga duración en Claude Code y Codex.

La investigación del uso del token OpenClaw revela problemas de configuración.
Un desarrollador agotó su suscripción semanal de OpenAI Codex en 1,5 días y utilizó Claude Code para identificar problemas de configuración: bots de Telegram que se activaban en cada mensaje, capturas web que devolvían CSS/JS sin procesar y archivos de sesión huérfanos acumulándose.