Ruta de puerta de enlace API sin tokens para tráfico de IA entre modelos reduce el gasto a la mitad
Tokenless (YC S26) es una puerta de enlace API lista para usar que reduce el gasto en inferencia de IA al enrutar cada turno de una conversación de agente al modelo adecuado más barato. Los fundadores (Rohit, Andrew, Kev) provienen de Princeton, Google DeepMind y UC Berkeley, y afirman que su enrutador iguala el rendimiento de Claude Fable 5 a la mitad del costo.
Cómo funciona
Tokenless distribuye una solicitud a múltiples modelos simultáneamente y observa su progreso. Una vez que un modelo está claramente en el camino correcto, cancela los demás. Solo pagas por el uso del modelo ganador. La técnica es novedosa: el enrutador consulta varios modelos en paralelo y utiliza sus resultados intermedios para tomar la decisión de enrutamiento. El equipo también señala que cambiar de modelo no destruye la caché si el algoritmo de enrutamiento conoce los estados frío/caliente de la caché.
Benchmarks
En los benchmarks de agentes τ³-Banking, Terminal-Bench 2.1 y DeepSWE 1.1, Tokenless Pro logra una tasa de resolución del 40.2 % a $0.57/tarea, frente a Claude Fable 5 con una tasa de resolución del 24.5 % y $3.32/tarea. El modo Ultra Saver enruta de forma más agresiva y obtiene una tasa de resolución del 30.9 % a $2.25/tarea. Las cifras se presentan como "medidas, no comercializadas" — afirman superar a todos los modelos de frontera en calidad ajustada por costo.
Primeros pasos
Tokenless expone un endpoint compatible con OpenAI y Anthropic. Apuntas tu agente existente a su endpoint, y ellos manejan el enrutamiento. Los nuevos usuarios obtienen $20 en crédito gratuito. El equipo planea agregar Kimi K3, esfuerzos de GPT y más modelos al enrutador.
Proyección de ahorro de costos
Tokenless proporciona una calculadora: para un equipo que gasta $40,000/mes en LLMs, proyectan una nueva factura de $26,000/mes (un ahorro del 34 %, $14,000/mes menos), totalizando $344,000 ahorrados durante el próximo año, asumiendo un crecimiento mensual del gasto del 11 %.
📖 Leer la fuente completa: HN AI Agents
👀 Ver también

LLM-Memory.net: Sistema de Memoria de Código Abierto con Infraestructura Multi-Agente
LLM-Memory.net es un sistema de memoria autoalojable para agentes de IA que proporciona almacenamiento de notas con búsqueda semántica, comunicación en tiempo real por chat/correo entre agentes, discusiones estructuradas con votación e integración de servidor MCP. El código fuente completo está disponible en GitHub con un instalador y playbooks de Ansible.

Servidor MCP de Análisis con Claude Primero: Dando a los Agentes de IA Acceso Directo al Contexto de Analítica Web
Un desarrollador reconstruyó su herramienta de análisis web como un servidor MCP, exponiendo análisis web simples, enlaces rastreables y herramientas de información del producto directamente a Claude, permitiendo que los agentes de IA aprovechen los datos del sitio junto con el contexto de código y base de datos.

Libro Mayor del Proyecto: Sistema de Memoria con Intervención Humana para Agentes de Codificación de IA
Un proyecto de GitHub presenta un sistema de registro basado en YAML donde los humanos curan lo que los agentes de IA recuerdan sobre las bases de código. Incluye una habilidad /ledger, un enlace UserPromptSubmit para inyección automática de contexto y una revisión del auditor Haiku.

osu-mcp: Un servidor MCP que permite a Claude analizar tus estadísticas de osu! en lenguaje sencillo
osu-mcp es un servidor MCP para la API v2 de osu!, ahora en el registro oficial de MCP. Expone 12 herramientas para perfiles de jugadores, historial de puntuaciones, búsqueda de beatmaps, clasificaciones y más. Una demostración mostró a Claude calculando la eficiencia de pp por jugada en cuentas de jugadores para revelar que el volumen, no la precisión, era el cuello de botella.