Routerly : Passerelle LLM auto-hébergée avec politiques de routage en temps réel et contrôle budgétaire

Routerly est une passerelle LLM auto-hébergée conçue pour combler les lacunes des solutions existantes. Le développeur l'a créée parce qu'OpenRouter est basé sur le cloud, et il voulait quelque chose d'exécutable sur sa propre infrastructure, tandis que le routage de LiteLLM semblait trop manuel malgré une bonne gestion du budget.
Fonctionnalités principales
Au lieu de coder en dur un modèle spécifique dans votre application, Routerly vous permet de définir des politiques de routage qui déterminent la sélection du modèle en temps réel. Les politiques disponibles incluent :
- Le moins cher
- Le plus rapide
- Le plus performant
- Des combinaisons de ces politiques
Le contrôle budgétaire fonctionne au niveau du projet avec un suivi réel par token, offrant une gestion granulaire des coûts.
Compatibilité et utilisation
Routerly est compatible OpenAI, ce qui signifie qu'elle peut s'intégrer dans des flux de travail existants sans modification de code. Les outils compatibles spécifiquement mentionnés incluent :
- Cursor
- LangChain
- Open WebUI
Elle fonctionne avec "tout autre outil" qui utilise le format d'API OpenAI.
État actuel
Le développeur reconnaît qu'il reste des imperfections et sollicite les retours de la communauté sur :
- Ce qui ne fonctionne pas
- Ce qui manque
- Si la logique de routage est pertinente en pratique
- Si cela résout un vrai problème que les gens rencontrent
L'outil est entièrement gratuit et open source, sans argumentaire commercial. Le développeur se concentre sur les retours pratiques de la communauté technique.
Ressources
- Dépôt GitHub : https://github.com/Inebrio/Routerly
- Site web : https://www.routerly.ai
📖 Lire la source complète : r/LocalLLaMA
👀 See Also

Extension Claude Pulse : Affichage des compteurs de jetons, minuteries de cache et limites de taux sur Claude.ai
Claude Pulse est une extension Chrome côté client qui ajoute un tableau de bord en temps réel à Claude.ai, affichant le nombre de tokens par message, l'utilisation totale du contexte, le minuteur d'expiration du cache de prompt et une barre de progression des limites de taux. Inclut également l'exportation de conversations en Markdown.

mentionné.to vs outils de surveillance plus larges : une comparaison des flux de travail centrés sur Reddit
mentioned.to est un outil de surveillance spécialement conçu pour les flux de travail Reddit, se concentrant sur le suivi des publications pertinentes, la mise en avant des opportunités de réponse, l'analyse du contenu performant et la rédaction de réponses, plutôt que sur une surveillance générale de la marque sur plusieurs canaux.

Gemma4 26B-A4B Offre des Performances Locales Rapides avec Recherche Web et Prise en Charge des Images
Le modèle gemma-4-26B-A4B atteint environ 145 tokens par seconde sur une RTX 4090 et inclut la recherche web MCP et la prise en charge d'images pour les applications de chat. Un article de blog détaille la configuration et l'utilisation multiplateforme sur Mac et iPhone.

Claude-Code v2.1.76 ajoute l'élicitation MCP, des optimisations de worktree et de nombreuses corrections.
Claude-Code v2.1.76 introduit la prise en charge de la sollicitation MCP pour les entrées structurées en cours de tâche, ajoute worktree.sparsePaths pour l'efficacité des monorepos, et corrige plus de 20 problèmes incluant la perte de schéma d'outils différés, les problèmes de commandes slash et la stabilité des sessions de Contrôle à Distance.