Ruta de puerta de enlace API sin tokens para tráfico de IA entre modelos reduce el gasto a la mitad
Tokenless (YC S26) es una puerta de enlace API lista para usar que reduce el gasto en inferencia de IA al enrutar cada turno de una conversación de agente al modelo adecuado más barato. Los fundadores (Rohit, Andrew, Kev) provienen de Princeton, Google DeepMind y UC Berkeley, y afirman que su enrutador iguala el rendimiento de Claude Fable 5 a la mitad del costo.
Cómo funciona
Tokenless distribuye una solicitud a múltiples modelos simultáneamente y observa su progreso. Una vez que un modelo está claramente en el camino correcto, cancela los demás. Solo pagas por el uso del modelo ganador. La técnica es novedosa: el enrutador consulta varios modelos en paralelo y utiliza sus resultados intermedios para tomar la decisión de enrutamiento. El equipo también señala que cambiar de modelo no destruye la caché si el algoritmo de enrutamiento conoce los estados frío/caliente de la caché.
Benchmarks
En los benchmarks de agentes τ³-Banking, Terminal-Bench 2.1 y DeepSWE 1.1, Tokenless Pro logra una tasa de resolución del 40.2 % a $0.57/tarea, frente a Claude Fable 5 con una tasa de resolución del 24.5 % y $3.32/tarea. El modo Ultra Saver enruta de forma más agresiva y obtiene una tasa de resolución del 30.9 % a $2.25/tarea. Las cifras se presentan como "medidas, no comercializadas" — afirman superar a todos los modelos de frontera en calidad ajustada por costo.
Primeros pasos
Tokenless expone un endpoint compatible con OpenAI y Anthropic. Apuntas tu agente existente a su endpoint, y ellos manejan el enrutamiento. Los nuevos usuarios obtienen $20 en crédito gratuito. El equipo planea agregar Kimi K3, esfuerzos de GPT y más modelos al enrutador.
Proyección de ahorro de costos
Tokenless proporciona una calculadora: para un equipo que gasta $40,000/mes en LLMs, proyectan una nueva factura de $26,000/mes (un ahorro del 34 %, $14,000/mes menos), totalizando $344,000 ahorrados durante el próximo año, asumiendo un crecimiento mensual del gasto del 11 %.
📖 Leer la fuente completa: HN AI Agents
👀 Ver también

Observación: Una Herramienta de Anotación en Markdown para Flujos de Trabajo de Código en Claude
Remark es una aplicación nativa para macOS que permite a los desarrolladores anotar archivos Markdown en línea para flujos de trabajo de revisión de código en Claude Code. Exporta las anotaciones como JSON para el agente y se integra mediante una habilidad instalada en el directorio .claude/skills/.

AgenticStore MCP: Kit de Herramientas Python para Claude Desktop con 27 Herramientas Locales
AgenticStore MCP es un kit de herramientas de Python de código abierto que reemplaza múltiples servidores MCP con una sola instalación, brindando a Claude Desktop 27 herramientas locales que incluyen memoria persistente, búsqueda web y auditoría de repositorios sin requerir configuración de Docker o Node.js.

Probando MiniMax M2.7 a través de la API en tres flujos de trabajo reales de ML y codificación
Un desarrollador compara MiniMax M2.7 con Claude Opus 4.7 en tres tareas reales: refactorizar un proyecto PyTorch, redactar notas de Obsidian y más. Resultados clave y configuración incluidos.

Beagle SCM: Un Sistema de Gestión de Código Fuente que Almacena Árboles AST
Beagle es un sistema experimental de gestión de código fuente que almacena árboles de sintaxis abstracta en lugar de blobs binarios, utilizando un formato de datos similar a CRDT llamado BASON y respaldando el almacenamiento con bases de datos clave-valor como RocksDB.