Orkestra: Kostenbewusste LLM-Routing-Schicht für OpenClaw reduziert API-Kosten um 60–80 %

✍️ OpenClawRadar📅 Veröffentlicht: 28. Februar 2026🔗 Source
Orkestra: Kostenbewusste LLM-Routing-Schicht für OpenClaw reduziert API-Kosten um 60–80 %
Ad

Was Orkestra tut

Orkestra ist eine kostenbewusste LLM-Routing-Schicht für OpenClaw, die API-Kosten um 60-80 % reduziert. Es handelt sich um eine modulare Architektur, die vor Modellaufrufen sitzt und basierend auf semantischer Ähnlichkeit entscheidet, welche Stufe jede Anfrage bearbeiten soll.

Wie es funktioniert

Wenn ein Prompt eingeht, wird er eingebettet und durch einen leichten KNN-Klassifikator geleitet, der auf zuvor gelabelten Workloads trainiert wurde. Basierend auf semantischer Ähnlichkeit kategorisiert der Router ihn als budget, balanced oder premium und leitet den Aufruf entsprechend weiter.

Es gibt keine Prompt-Umschreibung und keinen komplexen Regelbaum – nur semantische Klassifizierung zum Zeitpunkt des Aufrufs. Die Reduzierung der API-Kosten kommt hauptsächlich dadurch zustande, dass einfachere Prompts nicht standardmäßig an die teuersten Modelle weitergeleitet werden.

Ad

Integration mit OpenClaw

Orkestra wird als OpenClaw-Skill über einen lokalen Proxy eingebunden, sodass bestehende Pipelines vollständig intakt bleiben. Der Agent ruft es über bash/curl an einen OpenAI-kompatiblen Endpunkt unter 127.0.0.1:8765 auf.

Die Antwort enthält vollständige Kostentransparenz mit den Feldern _orkestra.cost und _orkestra.savings_percent.

Unterstützte Anbieter und Konfiguration

  • Unterstützte Anbieter: Google (Gemini), Anthropic (Claude), OpenAI
  • Routing über Budget-/Balanced-/Premium-Stufen innerhalb jedes Anbieters
  • Unterstützt Multi-Provider-Modus über alle drei Anbieter
  • Repository und OpenClaw-Integration verfügbar unter: github.com/imperativelabs/orkestra
  • Siehe integrations/openclaw/ für die Skill-Dateien, Proxy und Konfigurationsbeispiele

📖 Read the full source: r/openclaw

Ad

👀 Siehe auch

Effizientes Token-Management mit Open-Source-MCP-Servern: Pare
Werkzeuge

Effizientes Token-Management mit Open-Source-MCP-Servern: Pare

Pare MCP-Server reduzieren Token-Abfälle und verbessern die Effizienz, wenn KI-Coding-Agenten Entwicklertools nutzen, indem sie strukturierte Ausgaben bereitstellen.

OpenClawRadar
CAP: Claude Code-Statusleisten-Plugin, das mit /plugin install installiert wird
Werkzeuge

CAP: Claude Code-Statusleisten-Plugin, das mit /plugin install installiert wird

CAP (Claude Allowance Pulse) ist ein Statuszeilen-Plugin für Claude Code, das sich über /plugin install ohne npm, curl oder jq installiert. Es zeigt die Modellnutzung, Sitzungs- und Wochenlimits, Kontextfensternutzung und Sitzungskosten im Terminal an.

OpenClawRadar
jsongrep: Ein DFA-basiertes JSON-Abfragewerkzeug, das jq in Benchmarks übertrifft
Werkzeuge

jsongrep: Ein DFA-basiertes JSON-Abfragewerkzeug, das jq in Benchmarks übertrifft

jsongrep ist ein Rust-basiertes Kommandozeilen-Tool zum Abfragen von JSON-Dokumenten mithilfe einer regulären Sprachsyntax, die in deterministische endliche Automaten (DFA) kompiliert wird und in Benchmarks schnellere Suchzeiten als jq, jmespath, jsonpath-rust und jql erreicht.

OpenClawRadar
docvault: Lokale API-Dokumentation generieren, um KI-Halluzinationen zu reduzieren
Werkzeuge

docvault: Lokale API-Dokumentation generieren, um KI-Halluzinationen zu reduzieren

docvault ist ein Tool, das Markdown-API-Referenzen aus Quellcode generiert, um Claude und anderen LLMs dabei zu helfen, das Halluzinieren von Funktionssignaturen zu stoppen. Es funktioniert für Rust-Crates und Python-Pakete, erzeugt eine zweistufige Markdown-Datei und enthält ein Claude Code-Plugin für den automatisierten Betrieb.

OpenClawRadar