Gateway de API sem Token Roteia Tráfego de IA entre Modelos para Reduzir Gastos pela Metade
Tokenless (YC S26) é um gateway de API plugável que reduz gastos com inferência de IA roteando cada turno de uma conversa de agente para o modelo adequado mais barato. Os fundadores (Rohit, Andrew, Kev) vieram de Princeton, Google DeepMind e UC Berkeley, e afirmam que seu roteador iguala o desempenho do Claude Fable 5 pela metade do custo.
Como Funciona
Tokenless distribui uma requisição para vários modelos simultaneamente e monitora seu progresso. Assim que um modelo está claramente no caminho certo, ele cancela os outros. Você paga apenas pelo uso do modelo vencedor. A técnica é inovadora: o roteador consulta múltiplos modelos em paralelo e usa suas saídas intermediárias para tomar a decisão de roteamento. A equipe também observa que trocar de modelo não destrói o cache se o algoritmo de roteamento estiver ciente dos estados quente/frio do cache.
Benchmarks
Nos benchmarks agentivos τ³-Banking, Terminal-Bench 2.1 e DeepSWE 1.1, o Tokenless Pro alcança uma taxa de resolução de 40,2% a $0,57/tarefa, contra Claude Fable 5 com 24,5% de resolução a $3,32/tarefa. O modo Ultra Saver roteia de forma mais agressiva e obtém 30,9% de resolução a $2,25/tarefa. Os números são apresentados como "medidos, não divulgados" — eles afirmam superar todos os modelos de fronteira em qualidade ajustada ao custo.
Primeiros Passos
Tokenless expõe um endpoint compatível com OpenAI e Anthropic. Você aponta seu agente existente para o endpoint deles, e eles cuidam do roteamento. Novos usuários ganham $20 em crédito gratuito. A equipe planeja adicionar Kimi K3, esforços GPT e mais modelos ao roteador.
Projeção de Economia
Tokenless fornece uma calculadora: para uma equipe gastando $40.000/mês com LLMs, eles projetam uma nova conta de $26.000/mês (uma economia de 34%, $14.000/mês a menos), totalizando $344.000 economizados no próximo ano, assumindo um crescimento mensal de 11% nos gastos.
📖 Leia a fonte completa: HN AI Agents
👀 See Also

Benchmark Mostra que Ferramenta CLI Reduz Custos de Tokens de Código do Claude em 32% por Meio de Navegação Estrutural
Um desenvolvedor criou uma ferramenta CLI em Rust que dá aos agentes Claude Code comandos de navegação estrutural como 'mostre-me um resumo de 180 tokens desta classe de 6.000 tokens'. Benchmarking no Sonnet 4.6 em 54 execuções automatizadas mostrou 32% de custo menor por tarefa e 67% mais edições de código por sessão.

ai-codex: Pré-indexe sua base de código para economizar tokens do Claude
ai-codex é uma ferramenta que gera índices compactos em markdown do seu código, permitindo que o Claude Code pule a fase inicial de exploração que normalmente consome 30-50K tokens por conversa. Ele cria cinco arquivos que cobrem rotas, páginas, bibliotecas, esquemas e componentes.

Sala de Agentes: Aplicativo de Desktop para Visualização de Equipes de Agentes de Código Claude
Agents Room é um aplicativo de desktop Electron que escaneia pastas .claude/agents/, lê frontmatter e visualiza relacionamentos entre agentes em uma tela com linhas de conexão automáticas. Permite criar/editar agentes, habilidades e comandos diretamente na interface, em vez de editar arquivos markdown.

Cortex v1.2 adiciona enriquecimento com LLM, perguntas e respostas com citações e resolução de conflitos.
Cortex, uma camada de memória local para agentes OpenClaw, lançou a versão 1.2 com enriquecimento aumentado por LLM ativado por padrão, um comando de perguntas e respostas com citações, e melhorias na deduplicação e resolução de conflitos. A ferramenta agora inclui gerenciamento de configuração unificado e pré-filtragem de busca baseada em intenção.