Gateway de API sem Token Roteia Tráfego de IA entre Modelos para Reduzir Gastos pela Metade
Tokenless (YC S26) é um gateway de API plugável que reduz gastos com inferência de IA roteando cada turno de uma conversa de agente para o modelo adequado mais barato. Os fundadores (Rohit, Andrew, Kev) vieram de Princeton, Google DeepMind e UC Berkeley, e afirmam que seu roteador iguala o desempenho do Claude Fable 5 pela metade do custo.
Como Funciona
Tokenless distribui uma requisição para vários modelos simultaneamente e monitora seu progresso. Assim que um modelo está claramente no caminho certo, ele cancela os outros. Você paga apenas pelo uso do modelo vencedor. A técnica é inovadora: o roteador consulta múltiplos modelos em paralelo e usa suas saídas intermediárias para tomar a decisão de roteamento. A equipe também observa que trocar de modelo não destrói o cache se o algoritmo de roteamento estiver ciente dos estados quente/frio do cache.
Benchmarks
Nos benchmarks agentivos τ³-Banking, Terminal-Bench 2.1 e DeepSWE 1.1, o Tokenless Pro alcança uma taxa de resolução de 40,2% a $0,57/tarefa, contra Claude Fable 5 com 24,5% de resolução a $3,32/tarefa. O modo Ultra Saver roteia de forma mais agressiva e obtém 30,9% de resolução a $2,25/tarefa. Os números são apresentados como "medidos, não divulgados" — eles afirmam superar todos os modelos de fronteira em qualidade ajustada ao custo.
Primeiros Passos
Tokenless expõe um endpoint compatível com OpenAI e Anthropic. Você aponta seu agente existente para o endpoint deles, e eles cuidam do roteamento. Novos usuários ganham $20 em crédito gratuito. A equipe planeja adicionar Kimi K3, esforços GPT e mais modelos ao roteador.
Projeção de Economia
Tokenless fornece uma calculadora: para uma equipe gastando $40.000/mês com LLMs, eles projetam uma nova conta de $26.000/mês (uma economia de 34%, $14.000/mês a menos), totalizando $344.000 economizados no próximo ano, assumindo um crescimento mensal de 11% nos gastos.
📖 Leia a fonte completa: HN AI Agents
👀 See Also

Claude Cowork vs OpenClaw: Onde a narrativa de substituição se sustenta e onde falha
O Claude Cowork oferece sessões persistentes na área de trabalho com baixa fricção, enquanto o OpenClaw mantém vantagens em automação em nível de sistema, ecossistemas de habilidades e controle de fluxo de trabalho.

O compilador SMELT reduz o uso de tokens do espaço de trabalho OpenClaw em até 95%.
O SMELT compila arquivos markdown do workspace do OpenClaw em um formato de execução mais denso, enviando apenas conteúdo relevante para modelos de IA. Os benchmarks mostram reduções de tokens de 76,1% a 95,5% em consultas, evitando o reprocessamento de arquivos estáticos como USER.md e SOUR.md em cada mensagem.

Forge: Plugin de Código Claude de Código Aberto Adiciona Portões de Governança e Testes
Forge é um plugin de código Claude de código aberto que adiciona bloqueio de arquivos, portões de teste automatizados e 22 agentes de governança para prevenir colisões e desvios em fluxos de trabalho de código gerado por IA. É licenciado sob MIT e é instalado através da loja de plugins do Claude.

O Plugin Godmode Adiciona Loop de Iteração Autônomo ao Claude Code e Outros Agentes de Codificação de IA
Godmode é um plugin de código aberto que adiciona um loop autônomo de medir-modificar-verificar ao Claude Code, com agentes paralelos, memória de falhas e 126 habilidades incluindo otimização, auditorias de segurança e TDD. Funciona com Cursor, Codex, Gemini CLI e OpenCode.