Passerelle API sans jeton achemine le trafic IA entre modèles pour réduire les coûts de moitié
Tokenless (YC S26) est une passerelle API enfichable qui réduit les dépenses d'inférence IA en routant chaque tour d'une conversation d'agent vers le modèle adéquat le moins cher. Les fondateurs (Rohit, Andrew, Kev) viennent de Princeton, Google DeepMind et UC Berkeley, et affirment que leur routeur atteint les performances de Claude Fable 5 pour la moitié du coût.
Comment ça marche
Tokenless envoie une requête à plusieurs modèles simultanément et surveille leur progression. Dès qu'un modèle est clairement sur la bonne voie, il annule les autres. Vous ne payez que pour l'utilisation du modèle gagnant. La technique est inédite : le routeur interroge plusieurs modèles en parallèle et utilise leurs sorties intermédiaires pour prendre la décision de routage. L'équipe note également que le changement de modèle ne détruit pas le cache si l'algorithme de routage connaît l'état chaud/froid du cache.
Benchmarks
Sur les benchmarks agentiques τ³-Banking, Terminal-Bench 2.1 et DeepSWE 1.1, Tokenless Pro atteint un taux de résolution de 40,2 % pour 0,57 $/tâche, contre 24,5 % et 3,32 $/tâche pour Claude Fable 5. Le mode Ultra Saver route plus agressivement et obtient un taux de résolution de 30,9 % pour 2,25 $/tâche. Les chiffres sont présentés comme « mesurés, non marketés » — ils prétendent surpasser tous les modèles de pointe en termes de qualité ajustée au coût.
Pour commencer
Tokenless expose un endpoint compatible OpenAI et Anthropic. Vous pointez votre agent existant vers leur endpoint, et ils gèrent le routage. Les nouveaux utilisateurs bénéficient de 20 $ de crédit gratuit. L'équipe prévoit d'ajouter Kimi K3, les efforts GPT, et d'autres modèles au routeur.
Projection d'économies
Tokenless fournit un calculateur : pour une équipe dépensant 40 000 $/mois en LLM, ils prévoient une nouvelle facture de 26 000 $/mois (une économie de 34 %, soit 14 000 $/mois), totalisant 344 000 $ économisés sur l'année suivante en supposant une croissance mensuelle de 11 % des dépenses.
📖 Lire la source complète : HN AI Agents
👀 See Also

Memento v1.0 : Serveur MCP à Mémoire Persistante pour Claude Code avec 17 Outils
Memento v1.0 est un serveur MCP de mémoire persistante pour Claude Code qui propose 17 outils, une recherche hybride, une détection de contradictions et un graphe de mémoire visuel. Il s'exécute localement sans dépendances cloud et prend en charge plusieurs IDE, dont Claude Code, Cursor, Windsurf et OpenCode.

Soyez Mon Majordome : Pipeline Multi-Agent pour la Vérification de Code IA
Be My Butler est un pipeline multi-agents open-source où différents modèles d'IA examinent mutuellement leur code par vérification aveugle. Le système résout le problème des agents d'IA qui signalent incorrectement leur propre code comme fonctionnel.

L'extension Claude Toolbox ajoute des signets au niveau des messages et une recherche en texte intégral
Claude Toolbox est une extension Chrome qui permet de marquer des messages individuels, de rechercher en texte intégral dans toutes les conversations et d'exporter au format TXT ou JSON. Le niveau gratuit couvre 2 conversations ; le niveau payant est à 5 $/mois ou 49 $ à vie.

Atelier v0.3 ajoute des révisions ciblées de markdown avec Claude Code.
Atelier v0.3 est une extension gratuite pour VS Code qui vous permet de surligner des sections de documents markdown et de les envoyer à Claude Code pour révision. L'agent répond avec des modifications ciblées dans l'éditeur, et vous pouvez suivre quel retour chaque révision adresse.