Enrutar el tráfico de la API de Claude para controlar costos tras el cambio de suscripción Max

Migración a facturación por API e implicaciones de costos
A partir del mediodía PT, la suscripción Max de Anthropic ya no cubre el uso de herramientas de terceros como OpenClaw. Todos los usuarios de OpenClaw ahora están en facturación por API con estas tarifas:
- Claude Opus 4.6: $5 por millón de tokens de entrada, $25 por millón de tokens de salida
- Claude Sonnet 4.6: $3 por millón de tokens de entrada, $15 por millón de tokens de salida
- Claude Haiku 4.5: $1 por millón de tokens de entrada, $5 por millón de tokens de salida
Una sesión intensa de OpenClaw en Opus puede costar $1-4, mientras que la misma sesión en Sonnet cuesta $0.20-0.80 con resultados similares para la mayoría de las tareas.
La solución de enrutamiento
La mayoría de las operaciones de OpenClaw no requieren Opus: verificaciones de latido, lecturas de archivos, resúmenes, decisiones de enrutamiento y llamadas cortas a herramientas pueden ser manejadas por Sonnet. Sin una capa de enrutamiento, cada solicitud llega a tu modelo predeterminado, potencialmente desperdiciando el presupuesto de Opus en tareas simples.
Un proxy local enruta las solicitudes de Claude por complejidad: las tareas simples van automáticamente a Sonnet, las complejas escalan a Opus. Este enfoque ha reducido significativamente los costos sin pérdida de calidad en tareas importantes.
El proxy es de código abierto y se puede instalar vía npm: npm install -g @relayplane/proxy
La documentación detallada y la discusión están disponibles en r/ClaudeCode, donde la solución ha recibido 52K vistas.
📖 Read the full source: r/openclaw
👀 Ver también

certctl: Plataforma de gestión de ciclo de vida de certificados autohospedada con 78 endpoints API para automatización de agentes de IA
certctl es una plataforma de ciclo de vida de certificados autoalojada desarrollada con Go y TypeScript que expone 78 endpoints de API REST para la gestión de certificados. La plataforma es independiente del emisor y del destino, con un servidor MCP planificado para exponer toda la funcionalidad como herramientas MCP nativas.

context-link v1.0.0: El servidor MCP local reduce el uso de tokens de Claude Code en un 91%
context-link v1.0.0 es un servidor MCP local que indexa bases de código con Tree-sitter para proporcionar a Claude solo los símbolos, dependencias y estructura exactos necesarios, reduciendo el uso de tokens en un 91% en casos específicos y entre un 70-80% en tareas completas.

Storybloq: Un Seguidor de Proyectos que Vive en el Directorio .story/ de tu Repositorio Ahora Tiene una App para Mac
Storybloq, un rastreador de proyectos que almacena tickets, incidencias, fases de hoja de ruta y traspasos de sesión como JSON/markdown dentro de .story/ en tu repositorio, ahora tiene una aplicación gratuita para Mac en la App Store. Se integra con Claude Code a través de CLI y servidor MCP, y fue construido completamente usando Claude Code.

Evaluación comparativa de Nemotron 3 Super 120B con contexto de 1 millón de tokens en M1 Ultra
Un usuario probó Nemotron 3 Super 120B con un modelo cuantizado Q4_K_M usando llama.cpp en un M1 Ultra, logrando una ventana de contexto de 1 millón de tokens que consumió aproximadamente 90 GB de VRAM. Los puntos de referencia de rendimiento muestran velocidades de generación de tokens que van desde 255 t/s en el procesamiento de 512 tokens iniciales hasta 22,37 t/s en un contexto de 100.000 tokens.