RelayPlane Proxy de Código Abierto Muestra una Reducción del 73% en Costos con Enrutamiento del Modelo Claude

✍️ OpenClawRadar📅 Publicado: 7 de abril de 2026🔗 Source
RelayPlane Proxy de Código Abierto Muestra una Reducción del 73% en Costos con Enrutamiento del Modelo Claude
Ad

Proxy de Código Abierto para el Enrutamiento de la API de Claude

RelayPlane es un proxy nativo de npm de código abierto que se sitúa frente a la API de Anthropic. La herramienta fue construida usando Claude Code, lo que aceleró el desarrollo. Es gratuito para autoalojar y está diseñado para manejar el enrutamiento entre diferentes modelos Claude según la complejidad del prompt.

Resultados de Pruebas Comparativas y Configuración

La prueba comparativa utilizó una carga de trabajo mixta con 60% de tareas simples y 40% de tareas complejas. Se compararon dos escenarios:

  • Directo (todo Sonnet): latencia p50 1,55s, costo por 10 solicitudes $0,0323
  • Vía RelayPlane con enrutamiento: latencia p50 0,78s, costo por 10 solicitudes $0,0086

Esto representa una reducción de costos del 73,4%. Con 10.000 solicitudes por día, esto se traduce en aproximadamente $712 de ahorro mensual.

Ad

Configuración de Enrutamiento

La configuración de enrutamiento es sencilla:

{
  "routing": {
    "complexity": {
      "enabled": true,
      "simple": "claude-haiku-4-5",
      "moderate": "claude-sonnet-4-6",
      "complex": "claude-opus-4-6"
    }
  }
}

La lógica de enrutamiento utiliza un clasificador de complejidad que examina el recuento de tokens, indicadores de código y palabras clave analíticas. Los encabezados de respuesta incluyen x-relayplane-routed-model para verificar qué modelo procesó realmente la solicitud.

Precios de Modelos y Lógica de Enrutamiento

El sistema de enrutamiento dirige los prompts a los modelos apropiados según la complejidad:

  • Prompts simples → Haiku ($0,80 por millón de tokens)
  • Prompts moderados → Sonnet ($3 por millón de tokens)
  • Prompts complejos → Opus ($15 por millón de tokens)

El autor señala que el clasificador no es perfecto pero es "suficientemente bueno para capturar la mayor parte del ahorro". La metodología completa de las pruebas comparativas está disponible en un Gist vinculado en el material fuente.

📖 Read the full source: r/ClaudeAI

Ad

👀 Ver también

CostClaw: Panel de Seguimiento de Costos Local Gratuito para Agentes OpenClaw
Herramientas

CostClaw: Panel de Seguimiento de Costos Local Gratuito para Agentes OpenClaw

CostClaw es un complemento local gratuito que captura cada llamada de LLM mediante los enlaces nativos de OpenClaw y proporciona un panel de control que muestra desgloses de modelos, costos por sesión y gráficos de gasto por hora. El desarrollador descubrió que su agente de latido ejecutaba Claude Sonnet cada 3 minutos las 24 horas del día, costando $60 al mes, y cambiarlo a Haiku redujo su factura en aproximadamente un 65%.

OpenClawRadar
🦀
Herramientas

Habilitar SELECT: Ejecutar consultas SQL en resultados de búsqueda web

Keenable SELECT es un servidor MCP que te permite consultar la web con SQL. Una sola llamada puede buscar más de 1,000 páginas, filtrar con cláusulas WHERE exactas y extraer campos mediante LLM, todo en una única sentencia SELECT.

OpenClawRadar
Títulos de artículos de Pokémon Showdown: Agentes de IA creados con APIs de LLM gratuitas y llamadas a herramientas
Herramientas

Títulos de artículos de Pokémon Showdown: Agentes de IA creados con APIs de LLM gratuitas y llamadas a herramientas

Un sistema que usa Llama 3, Qwen, Gemma a través de niveles gratuitos de API para jugar de forma autónoma batallas de Pokémon Showdown con llamadas a herramientas estructuradas, compatible con modos humano vs IA e IA vs IA.

OpenClawRadar
Gestión del contexto de IA con una tienda de conocimiento SQLite y herramientas MCP
Herramientas

Gestión del contexto de IA con una tienda de conocimiento SQLite y herramientas MCP

Un desarrollador creó RunawayContext, un sistema con licencia MIT que almacena lecciones de proyectos en SQLite con FTS5 y sqlite-vec opcional, manteniendo el contexto por sesión por debajo de 3K tokens gracias a herramientas de consulta MCP y límites fijos en el código.

OpenClawRadar