Passerelle API sans jeton achemine le trafic IA entre modèles pour réduire les coûts de moitié

✍️ OpenClawRadar📅 Publié: July 30, 2026🔗 Source
Ad

Tokenless (YC S26) est une passerelle API enfichable qui réduit les dépenses d'inférence IA en routant chaque tour d'une conversation d'agent vers le modèle adéquat le moins cher. Les fondateurs (Rohit, Andrew, Kev) viennent de Princeton, Google DeepMind et UC Berkeley, et affirment que leur routeur atteint les performances de Claude Fable 5 pour la moitié du coût.

Comment ça marche

Tokenless envoie une requête à plusieurs modèles simultanément et surveille leur progression. Dès qu'un modèle est clairement sur la bonne voie, il annule les autres. Vous ne payez que pour l'utilisation du modèle gagnant. La technique est inédite : le routeur interroge plusieurs modèles en parallèle et utilise leurs sorties intermédiaires pour prendre la décision de routage. L'équipe note également que le changement de modèle ne détruit pas le cache si l'algorithme de routage connaît l'état chaud/froid du cache.

Ad

Benchmarks

Sur les benchmarks agentiques τ³-Banking, Terminal-Bench 2.1 et DeepSWE 1.1, Tokenless Pro atteint un taux de résolution de 40,2 % pour 0,57 $/tâche, contre 24,5 % et 3,32 $/tâche pour Claude Fable 5. Le mode Ultra Saver route plus agressivement et obtient un taux de résolution de 30,9 % pour 2,25 $/tâche. Les chiffres sont présentés comme « mesurés, non marketés » — ils prétendent surpasser tous les modèles de pointe en termes de qualité ajustée au coût.

Pour commencer

Tokenless expose un endpoint compatible OpenAI et Anthropic. Vous pointez votre agent existant vers leur endpoint, et ils gèrent le routage. Les nouveaux utilisateurs bénéficient de 20 $ de crédit gratuit. L'équipe prévoit d'ajouter Kimi K3, les efforts GPT, et d'autres modèles au routeur.

Projection d'économies

Tokenless fournit un calculateur : pour une équipe dépensant 40 000 $/mois en LLM, ils prévoient une nouvelle facture de 26 000 $/mois (une économie de 34 %, soit 14 000 $/mois), totalisant 344 000 $ économisés sur l'année suivante en supposant une croissance mensuelle de 11 % des dépenses.

📖 Lire la source complète : HN AI Agents

Ad

👀 See Also

Memento v1.0 : Serveur MCP à Mémoire Persistante pour Claude Code avec 17 Outils
Tools

Memento v1.0 : Serveur MCP à Mémoire Persistante pour Claude Code avec 17 Outils

Memento v1.0 est un serveur MCP de mémoire persistante pour Claude Code qui propose 17 outils, une recherche hybride, une détection de contradictions et un graphe de mémoire visuel. Il s'exécute localement sans dépendances cloud et prend en charge plusieurs IDE, dont Claude Code, Cursor, Windsurf et OpenCode.

OpenClawRadar
Soyez Mon Majordome : Pipeline Multi-Agent pour la Vérification de Code IA
Tools

Soyez Mon Majordome : Pipeline Multi-Agent pour la Vérification de Code IA

Be My Butler est un pipeline multi-agents open-source où différents modèles d'IA examinent mutuellement leur code par vérification aveugle. Le système résout le problème des agents d'IA qui signalent incorrectement leur propre code comme fonctionnel.

OpenClawRadar
L'extension Claude Toolbox ajoute des signets au niveau des messages et une recherche en texte intégral
Tools

L'extension Claude Toolbox ajoute des signets au niveau des messages et une recherche en texte intégral

Claude Toolbox est une extension Chrome qui permet de marquer des messages individuels, de rechercher en texte intégral dans toutes les conversations et d'exporter au format TXT ou JSON. Le niveau gratuit couvre 2 conversations ; le niveau payant est à 5 $/mois ou 49 $ à vie.

OpenClawRadar
Atelier v0.3 ajoute des révisions ciblées de markdown avec Claude Code.
Tools

Atelier v0.3 ajoute des révisions ciblées de markdown avec Claude Code.

Atelier v0.3 est une extension gratuite pour VS Code qui vous permet de surligner des sections de documents markdown et de les envoyer à Claude Code pour révision. L'agent répond avec des modifications ciblées dans l'éditeur, et vous pouvez suivre quel retour chaque révision adresse.

OpenClawRadar