RelayPlane Open Source Proxy zeigt 73 % Kostensenkung durch Claude-Modell-Routing

✍️ OpenClawRadar📅 Veröffentlicht: 7. April 2026🔗 Source
RelayPlane Open Source Proxy zeigt 73 % Kostensenkung durch Claude-Modell-Routing
Ad

Open-Source-Proxy für Claude-API-Routing

RelayPlane ist ein Open-Source-, npm-nativer Proxy, der vor der Anthropic API sitzt. Das Tool wurde mit Claude Code entwickelt, was die Entwicklung beschleunigte. Es ist kostenlos selbst zu hosten und dafür ausgelegt, das Routing zwischen verschiedenen Claude-Modellen basierend auf der Eingabeaufforderungskomplexität zu handhaben.

Benchmark-Ergebnisse und Konfiguration

Der Benchmark verwendete eine gemischte Arbeitslast mit 60 % einfachen und 40 % komplexen Aufgaben. Zwei Szenarien wurden verglichen:

  • Direkt (alle Sonnet): p50-Latenz 1,55 s, Kosten pro 10 Anfragen 0,0323 $
  • Über RelayPlane mit Routing: p50-Latenz 0,78 s, Kosten pro 10 Anfragen 0,0086 $

Dies entspricht einer Kostensenkung von 73,4 %. Bei 10.000 Anfragen pro Tag entspricht dies etwa 712 $ monatlicher Einsparungen.

Ad

Routing-Konfiguration

Die Routing-Konfiguration ist unkompliziert:

{
  "routing": {
    "complexity": {
      "enabled": true,
      "simple": "claude-haiku-4-5",
      "moderate": "claude-sonnet-4-6",
      "complex": "claude-opus-4-6"
    }
  }
}

Die Routing-Logik verwendet einen Komplexitätsklassifikator, der Tokenanzahl, Code-Indikatoren und analytische Schlüsselwörter prüft. Antwort-Header enthalten x-relayplane-routed-model, um zu überprüfen, welches Modell die Anfrage tatsächlich verarbeitet hat.

Modellpreise und Routing-Logik

Das Routing-System leitet Eingabeaufforderungen basierend auf der Komplexität an geeignete Modelle weiter:

  • Einfache Eingabeaufforderungen → Haiku (0,80 $ pro Million Token)
  • Mittlere Eingabeaufforderungen → Sonnet (3 $ pro Million Token)
  • Komplexe Eingabeaufforderungen → Opus (15 $ pro Million Token)

Der Autor merkt an, dass der Klassifikator nicht perfekt ist, aber "gut genug, um den größten Teil der Einsparungen zu erfassen". Die vollständige Benchmark-Methodik ist in einem Gist verfügbar, der im Quellmaterial verlinkt ist.

📖 Read the full source: r/ClaudeAI

Ad

👀 Siehe auch

Claude Usage Bar Colorizer Browser-Erweiterung, erstellt mit Claude Code
Werkzeuge

Claude Usage Bar Colorizer Browser-Erweiterung, erstellt mit Claude Code

Ein Entwickler hat eine Browser-Erweiterung erstellt, die die Nutzungsbalken von Claude basierend auf Prozentgrenzwerten von Grün über Gelb nach Rot einfärbt, ein Popup mit Live-Nutzungsdaten hinzufügt und die Anpassung von Grenzwerten und Farben ermöglicht. Die Erweiterung läuft nur auf Claudes Nutzungsseite, speichert Einstellungen lokal und stellt keine externen Netzwerkanfragen.

OpenClawRadar
Außerhalb des Stromnetzes: Nutzung von Telefonhardware für Offline-AI-Anwendungen
Werkzeuge

Außerhalb des Stromnetzes: Nutzung von Telefonhardware für Offline-AI-Anwendungen

Off Grid ist eine Open-Source-App, die die Hardware Ihres Telefons für Offline-AI-Aufgaben wie Textgenerierung und Spracherkennung nutzt.

OpenClawRadar
**Claude Code Routines: Planen und Ausführen von Agenten-Aufgaben wie mit Cron, inkl. logischer Entscheidungsfindung**

Oder kürzer und prägnanter:

**Claude Code Routines: Agenten-Aufgaben wie mit Cron planen – mit logischer Entscheidungsfindung**
Werkzeuge

**Claude Code Routines: Planen und Ausführen von Agenten-Aufgaben wie mit Cron, inkl. logischer Entscheidungsfindung** Oder kürzer und prägnanter: **Claude Code Routines: Agenten-Aufgaben wie mit Cron planen – mit logischer Entscheidungsfindung**

Mit Claude Code Routines können Sie Agentenaufgaben planen, ohne eine Sitzung offen halten zu müssen. Ein Reddit-Nutzer teilt konkrete Beispiele: nächtliche Commit-Überprüfung, wöchentlicher Abhängigkeitscheck, tägliche Fehlerlog-Analyse – mit KI-Schlussfolgerungen statt roher Skriptausgabe.

OpenClawRadar
Ausnutzen des verborgenen Agentursignals (Â) von LLMs für besseres Tool Calling
Werkzeuge

Ausnutzen des verborgenen Agentursignals (Â) von LLMs für besseres Tool Calling

Ein Entwickler entdeckte, dass LLMs eine linear trennbare Richtung im verborgenen Zustand namens  haben, die Werkzeugaufrufe mit einem AUC > 0,94 vorhersagt. Die Nutzung dieses Signals, um Werkzeugaufrufe zu erzwingen, verbesserte die Leistung von Qwen3-1.7B von 26,7 % auf 85 % (+58 % Gewinn) und reduzierte Fehler ohne Werkzeugaufruf von 43 % auf 2,6 %.

OpenClawRadar