Routerly: Selbst gehostetes LLM-Gateway mit Laufzeit-Routingrichtlinien und Budgetkontrolle

Routerly ist ein selbst gehostetes LLM-Gateway, das entwickelt wurde, um Lücken in bestehenden Lösungen zu schließen. Der Entwickler hat es erstellt, weil OpenRouter cloudbasiert ist und er etwas wollte, das auf eigener Infrastruktur läuft, während das Routing von LiteLLM trotz guter Budgetverwaltung zu manuell erschien.
Kernfunktionen
Anstatt ein bestimmtes Modell in Ihrer Anwendung fest zu kodieren, ermöglicht Routerly Ihnen, Routing-Richtlinien zu definieren, die die Modellauswahl zur Laufzeit bestimmen. Verfügbare Richtlinien umfassen:
- Günstigste
- Schnellste
- Leistungsfähigste
- Kombinationen dieser Richtlinien
Die Budgetkontrolle erfolgt auf Projektebene mit tatsächlicher Token-für-Token-Nachverfolgung, was eine detaillierte Kostenverwaltung ermöglicht.
Kompatibilität und Nutzung
Routerly ist OpenAI-kompatibel, was bedeutet, dass es in bestehende Arbeitsabläufe ohne Codeänderungen integriert werden kann. Speziell erwähnte kompatible Tools sind:
- Cursor
- LangChain
- Open WebUI
Es funktioniert mit „allen anderen“ Tools, die das OpenAI-API-Format verwenden.
Aktueller Status
Der Entwickler räumt ein, dass es noch Unausgereiftes gibt und sucht Feedback der Community zu:
- Was kaputt ist
- Was fehlt
- Ob die Routing-Logik in der Praxis sinnvoll ist
- Ob es ein echtes Problem löst, das Menschen haben
Das Tool ist völlig kostenlos und quelloffen, ohne kommerzielle Verkaufsabsicht. Der Entwickler konzentriert sich auf praktisches Feedback aus der technischen Community.
Ressourcen
- GitHub-Repository: https://github.com/Inebrio/Routerly
- Website: https://www.routerly.ai
📖 Read the full source: r/LocalLLaMA
👀 Siehe auch

Entwickler erstellt ein WordPress-MCP-Plugin mit Lese-/Schreibfunktionen und 28 Fähigkeiten
Ein Entwickler hat ein WordPress-Plugin erstellt, das 28 MCP-Fähigkeiten über die WordPress Abilities API registriert und damit vollständigen Lese-/Schreibzugriff für KI-Codierungsagenten ermöglicht. Das Plugin übernimmt Inhaltsverwaltung, Qualitätsprüfung und Sicherheitsfunktionen und konvertiert automatisch zwischen Markdown und Gutenberg-Blöcken.

singularity-claude: Eine selbstentwickelnde Fähigkeits-Engine für Claude Code
singularity-claude ist ein Open-Source-Claude-Code-Plugin, das eine rekursive Evolutionsschleife hinzufügt, um den Verfall von Fähigkeiten zu verhindern. Es bewertet die Ausführung von Fähigkeiten, repariert automatisch schlecht bewertete Fähigkeiten, kristallisiert hochleistungsfähige Versionen und erkennt Fähigkeitslücken.

Das feinabgestimmte Qwen3.5-2B-Modell mit RAG-Engram-Architektur verbessert die Genauigkeit fundierter Antworten von 50 % auf 93 % bei einem Kontext von 8K.
Ein Entwickler hat Qwen3.5-2B mit einer benutzerdefinierten RAG-Engram-Architektur feinabgestimmt, um das 'Lost-in-the-Middle'-Phänomen anzugehen, und verbesserte korrekte Antworten bei 8K Token von 50 % auf 93 % bei realen Abfragen. Das System verwendet einen zweistufigen Ansatz mit statischen Entitäts-Einbettungen und dynamischer Chunk-Navigation.

Ausführen von OpenClaw in einer isolierten Mikro-VM mit Void-Box
OpenClaw kann als Dienst innerhalb einer isolierten Mikro-VM mit Void-Box ausgeführt werden, einer fähigkeitsbeschränkten Laufzeitumgebung, die Workflows in KVM-Mikro-VMs ausführt und eine saubere Ausführungsgrenze ohne Container-Laufzeitumgebung bietet.