Gateway de API sem Token Roteia Tráfego de IA entre Modelos para Reduzir Gastos pela Metade
Tokenless (YC S26) é um gateway de API plugável que reduz gastos com inferência de IA roteando cada turno de uma conversa de agente para o modelo adequado mais barato. Os fundadores (Rohit, Andrew, Kev) vieram de Princeton, Google DeepMind e UC Berkeley, e afirmam que seu roteador iguala o desempenho do Claude Fable 5 pela metade do custo.
Como Funciona
Tokenless distribui uma requisição para vários modelos simultaneamente e monitora seu progresso. Assim que um modelo está claramente no caminho certo, ele cancela os outros. Você paga apenas pelo uso do modelo vencedor. A técnica é inovadora: o roteador consulta múltiplos modelos em paralelo e usa suas saídas intermediárias para tomar a decisão de roteamento. A equipe também observa que trocar de modelo não destrói o cache se o algoritmo de roteamento estiver ciente dos estados quente/frio do cache.
Benchmarks
Nos benchmarks agentivos τ³-Banking, Terminal-Bench 2.1 e DeepSWE 1.1, o Tokenless Pro alcança uma taxa de resolução de 40,2% a $0,57/tarefa, contra Claude Fable 5 com 24,5% de resolução a $3,32/tarefa. O modo Ultra Saver roteia de forma mais agressiva e obtém 30,9% de resolução a $2,25/tarefa. Os números são apresentados como "medidos, não divulgados" — eles afirmam superar todos os modelos de fronteira em qualidade ajustada ao custo.
Primeiros Passos
Tokenless expõe um endpoint compatível com OpenAI e Anthropic. Você aponta seu agente existente para o endpoint deles, e eles cuidam do roteamento. Novos usuários ganham $20 em crédito gratuito. A equipe planeja adicionar Kimi K3, esforços GPT e mais modelos ao roteador.
Projeção de Economia
Tokenless fornece uma calculadora: para uma equipe gastando $40.000/mês com LLMs, eles projetam uma nova conta de $26.000/mês (uma economia de 34%, $14.000/mês a menos), totalizando $344.000 economizados no próximo ano, assumindo um crescimento mensal de 11% nos gastos.
📖 Leia a fonte completa: HN AI Agents
👀 See Also

Análise dos Componentes Reutilizáveis em Go do Ollama para Desenvolvimento Local de LLM
Um desenvolvedor examinou o código-fonte do Ollama e encontrou vários componentes independentes em Go, incluindo um amostrador de tokens puro em Go, leitor/gravador GGUF, ferramentas de conversão de modelos, renderização de templates de chat e transformações de compatibilidade com OpenAI que não estão disponíveis como bibliotecas separadas.

Plataforma ELBO: Treinamento com IA para Habilidades de Pensamento Crítico e Comunicação
ELBO é uma plataforma de treinamento ao vivo desenvolvida com Claude Code que utiliza IA para ajudar os usuários a praticar pensamento crítico, persuasão, negociação e habilidades de oratória por meio de cenários simulados e debates.

Servidor MCP Soul Adiciona Memória Persistente e Segurança para LLMs Locais
Soul é um servidor MCP de código aberto que fornece memória persistente entre sessões para LLMs locais com dois comandos: n2_boot no início e n2_work_end no final. Inclui recursos de segurança Ark que bloqueiam comandos perigosos como rm -rf e DROP DATABASE sem custo de tokens, além de configuração de armazenamento em nuvem.

AgentHandover: Aplicativo da barra de menu do Mac que cria habilidades de agente observando sua tela
AgentHandover é um aplicativo de código aberto para a barra de menus do Mac que utiliza o Gemma 4 rodando localmente via Ollama para monitorar sua tela e transformar fluxos de trabalho repetidos em arquivos de Habilidade estruturados que qualquer agente pode seguir. Ele oferece tanto o Registro Focado para tarefas específicas quanto a Descoberta Passiva que identifica padrões a partir da observação em segundo plano.