Passerelle API sans jeton achemine le trafic IA entre modèles pour réduire les coûts de moitié
Tokenless (YC S26) est une passerelle API enfichable qui réduit les dépenses d'inférence IA en routant chaque tour d'une conversation d'agent vers le modèle adéquat le moins cher. Les fondateurs (Rohit, Andrew, Kev) viennent de Princeton, Google DeepMind et UC Berkeley, et affirment que leur routeur atteint les performances de Claude Fable 5 pour la moitié du coût.
Comment ça marche
Tokenless envoie une requête à plusieurs modèles simultanément et surveille leur progression. Dès qu'un modèle est clairement sur la bonne voie, il annule les autres. Vous ne payez que pour l'utilisation du modèle gagnant. La technique est inédite : le routeur interroge plusieurs modèles en parallèle et utilise leurs sorties intermédiaires pour prendre la décision de routage. L'équipe note également que le changement de modèle ne détruit pas le cache si l'algorithme de routage connaît l'état chaud/froid du cache.
Benchmarks
Sur les benchmarks agentiques τ³-Banking, Terminal-Bench 2.1 et DeepSWE 1.1, Tokenless Pro atteint un taux de résolution de 40,2 % pour 0,57 $/tâche, contre 24,5 % et 3,32 $/tâche pour Claude Fable 5. Le mode Ultra Saver route plus agressivement et obtient un taux de résolution de 30,9 % pour 2,25 $/tâche. Les chiffres sont présentés comme « mesurés, non marketés » — ils prétendent surpasser tous les modèles de pointe en termes de qualité ajustée au coût.
Pour commencer
Tokenless expose un endpoint compatible OpenAI et Anthropic. Vous pointez votre agent existant vers leur endpoint, et ils gèrent le routage. Les nouveaux utilisateurs bénéficient de 20 $ de crédit gratuit. L'équipe prévoit d'ajouter Kimi K3, les efforts GPT, et d'autres modèles au routeur.
Projection d'économies
Tokenless fournit un calculateur : pour une équipe dépensant 40 000 $/mois en LLM, ils prévoient une nouvelle facture de 26 000 $/mois (une économie de 34 %, soit 14 000 $/mois), totalisant 344 000 $ économisés sur l'année suivante en supposant une croissance mensuelle de 11 % des dépenses.
📖 Lire la source complète : HN AI Agents
👀 See Also

Serveur de Compétence OpenClaw pour l'Analyse et le Trading du Marché Indien
Un terminal de trading open-source pour les marchés indiens a été intégré en tant que serveur de compétences OpenClaw, permettant aux agents de récupérer des données de marché et d'exécuter des analyses multi-agents via HTTP. Le système fournit des plans de trading structurés avec des prix d'entrée, des stop-loss et des objectifs pour trois profils de risque.

Déployer les artefacts de design Claude sur des sites Web en direct avec Teenyapp
Teenyapp fournit un service d'hébergement que Claude Design peut utiliser directement depuis le chat via un lien de jeton d'agent, permettant le déploiement autonome d'artefacts avec support backend.

Développeur solo crée un agent IA de bureau multiplateforme avec contrôle à distance mobile en 3 semaines, expédié dans plus de 40 pays
Un développeur solo a créé Skales, un agent IA natif pour ordinateur avec plus de 139 outils et une application mobile compagnon pour le contrôle à distance — le tout en 3 semaines en utilisant Claude. L'application fonctionne sur macOS, Windows et Linux, est locale et gratuite, et compte déjà des utilisateurs actifs dans plus de 40 pays.

osu-mcp : Un serveur MCP qui permet à Claude d'analyser vos statistiques osu! en anglais simple
osu-mcp est un serveur MCP pour l'API v2 d'osu!, désormais sur le registre officiel MCP. Il expose 12 outils pour les profils, l'historique des scores, la recherche de beatmaps, les classements et plus. Une démonstration a montré Claude calculant l'efficacité pp-par-partie entre comptes pour révéler que le volume, pas la précision, était le goulot d'étranglement.