Passerelle API sans jeton achemine le trafic IA entre modèles pour réduire les coûts de moitié
Tokenless (YC S26) est une passerelle API enfichable qui réduit les dépenses d'inférence IA en routant chaque tour d'une conversation d'agent vers le modèle adéquat le moins cher. Les fondateurs (Rohit, Andrew, Kev) viennent de Princeton, Google DeepMind et UC Berkeley, et affirment que leur routeur atteint les performances de Claude Fable 5 pour la moitié du coût.
Comment ça marche
Tokenless envoie une requête à plusieurs modèles simultanément et surveille leur progression. Dès qu'un modèle est clairement sur la bonne voie, il annule les autres. Vous ne payez que pour l'utilisation du modèle gagnant. La technique est inédite : le routeur interroge plusieurs modèles en parallèle et utilise leurs sorties intermédiaires pour prendre la décision de routage. L'équipe note également que le changement de modèle ne détruit pas le cache si l'algorithme de routage connaît l'état chaud/froid du cache.
Benchmarks
Sur les benchmarks agentiques τ³-Banking, Terminal-Bench 2.1 et DeepSWE 1.1, Tokenless Pro atteint un taux de résolution de 40,2 % pour 0,57 $/tâche, contre 24,5 % et 3,32 $/tâche pour Claude Fable 5. Le mode Ultra Saver route plus agressivement et obtient un taux de résolution de 30,9 % pour 2,25 $/tâche. Les chiffres sont présentés comme « mesurés, non marketés » — ils prétendent surpasser tous les modèles de pointe en termes de qualité ajustée au coût.
Pour commencer
Tokenless expose un endpoint compatible OpenAI et Anthropic. Vous pointez votre agent existant vers leur endpoint, et ils gèrent le routage. Les nouveaux utilisateurs bénéficient de 20 $ de crédit gratuit. L'équipe prévoit d'ajouter Kimi K3, les efforts GPT, et d'autres modèles au routeur.
Projection d'économies
Tokenless fournit un calculateur : pour une équipe dépensant 40 000 $/mois en LLM, ils prévoient une nouvelle facture de 26 000 $/mois (une économie de 34 %, soit 14 000 $/mois), totalisant 344 000 $ économisés sur l'année suivante en supposant une croissance mensuelle de 11 % des dépenses.
📖 Lire la source complète : HN AI Agents
👀 See Also

Utiliser Claude pour extraire des données d'un jeu Football Manager de 1997
Ben Nuttall a utilisé Claude pour extraire les données des joueurs, équipes et stades de FIFA Soccer Manager 97. L'IA a analysé le fichier SM97.DAT, exporté en CSV et construit un site web consultable. Tout le code Python est sur GitHub.

L'outil GrapeRoot MCP réduit l'utilisation de tokens de code Claude de 50 à 70 %.
Un développeur a créé GrapeRoot, un outil MCP utilisant Claude Code, qui suit les fichiers explorés et évite de relire le contenu inchangé, réduisant l'utilisation de tokens de 50 à 70 % et permettant aux abonnements Claude Code à 20 $ de durer 2 à 3 fois plus longtemps.

Plugin OpenClaw Context Meter affiche le pourcentage d'utilisation du jeton Telegram
Un nouveau plugin OpenClaw affiche le pourcentage d'utilisation des tokens après chaque réponse du bot Telegram, montrant des valeurs comme '45k / 200k (22%)' et détectant les événements de compaction. Le plugin évite les problèmes de mémoire insuffisante en codant en dur les fenêtres de contexte au lieu d'utiliser execSync.

Rival-Review : Une boucle d'évaluation croisée pour les plans d'agents IA
Rival-review est un outil sous licence MIT qui utilise un second modèle d'IA pour auditer les plans d'un agent d'IA de codage principal avant leur exécution, détectant des problèmes tels que des plans de retour arrière défectueux, des failles de sécurité et des décisions basées sur des états obsolètes.