Routing Agent Subtasks zu günstigeren Modellen senkte Kosten von $18 auf $4 bei gleicher Refaktorisierung

✍️ OpenClawRadar📅 Veröffentlicht: 19. Mai 2026🔗 Source
Routing Agent Subtasks zu günstigeren Modellen senkte Kosten von $18 auf $4 bei gleicher Refaktorisierung
Ad

Ein Entwickler auf r/ClaudeAI beschreibt eine praktische Kostenoptimierungsstrategie für Agenten-Schleifen: Routineaufgaben an günstige Modelle weiterleiten und teure Modelle (Opus 4.7) nur für komplexe Überlegungen reservieren. Sein Refactoring-Agent – der CSS-Variablenumbenennungen, YAML-Konfigurationsupdates und Linter-Ausführungen über MCP erledigte – sandte ursprünglich jeden Schritt an Opus 4.7, insgesamt etwa 18 $. Nach Implementierung einer Weiterleitungslogik gingen 178 von 212 Schritten an günstige Modelle, wodurch die Kosten auf rund 4 $ sanken – ohne erkennbaren Qualitätsunterschied bei Routineänderungen.

Weiterleitungslogik

  • Schwierige Aufgaben → Opus 4.7: Komponentenarchitektur, Debugging von 2-Uhr-morgens-Code, alles, was durchgehendes Überlegen in langen Gesprächen erfordert. Der Autor merkt an, dass Opus bei dieser Art von Arbeit wirklich unübertroffen ist – ein früherer Versuch, einen Auth-Middleware-Bug an ein günstigeres Modell weiterzuleiten, brach stillschweigend die Sitzungsverwaltung, was eine Stunde der Nachverfolgung kostete.
  • Routineaufgaben → günstigere Modelle: Lint, Umbenennungen, Konfigurationsänderungen, Tool-Orchestrierung. Der Autor entschied sich für DeepSeek V4 Pro für allgemeine Programmieraufgaben und Tencent Hunyuan Hy3 Vorschau für umfangreiche Tool-Aufrufe. Seit Ende April belegt Hunyuan Hy3 Platz 1 auf OpenRouter nach Anzahl der Tool-Aufrufe und vermasselt fast nie einen Funktionsaufruf, wenn das Schema sauber ist.
Ad

Kostenvergleich

  • Opus 4.7: ~0,18 $ pro Million Eingabe-Token (geschätzt aus dem Kontext einer etwa 28-mal günstigeren Alternative).
  • Tencent Hunyuan Hy3: 0,18 $ pro Million Eingabe-Token, 0,59 $ pro Million Ausgabe – etwa 28-mal günstiger als Opus 4.7 bei der Eingabe.
  • Gleicher 212-Schritte-Refactor: 178 Schritte zur günstigen Stufe, 34 Schritte zu Opus. Kosten fielen von 18 $ auf etwa 4 $.

Fehlermodi

  • Das Tool-Aufruf-Modell halluziniert Parameter, wenn Schemas schlampig sind (Autor gibt zu, dass Schemas schlecht waren).
  • DeepSeek V4 Pro schreibt gelegentlich syntaktisch perfekten Code, der das Gegenteil von dem bewirkt, was verlangt wurde, und übersteht einen schnellen Blick.
  • Keines der günstigen Modelle kann es mit Opus beim Debuggen tiefgehender Probleme aufnehmen (z. B. Auth-Flow, der stillschweigend ein Cookie frisst).

Entscheidungsheuristik

Die Weiterleitungsregel des Autors lautet: „Wie teuer ist es, eine falsche Antwort zu finden?“ Eine schlechte Lint-Korrektur kostet einen 2-Sekunden-Git-Revert; eine schlechte Architekturentscheidung kostet den ganzen Nachmittag.

Die Einsparungen ermöglichten zuvor übersprungene Aufgaben – wie Schreiben und Ausführen von Tests bei jeder CSS-Änderung oder Neugenerieren aller Open-Graph-Bilder – denn bei Bruchteilen eines Cents pro Tool-Aufruf gibt es keinen Grund, es nicht zu tun.

📖 Lesen Sie die vollständige Quelle: r/ClaudeAI

Ad

👀 Siehe auch

Verifikations-Harness behebt Claude's Planausführungsproblem
Tipps

Verifikations-Harness behebt Claude's Planausführungsproblem

Ein Entwickler hat eine 30-50 Zeilen lange Bash- oder Python-Überprüfungsschicht erstellt, die prüft, ob Claude tatsächlich jeden Schritt seiner eigenen Pläne ausführt, indem sie Artefakte wie Dateiexistenz, API-Antworten und Konfigurationsänderungen verifiziert.

OpenClawRadar
Claude Codes stilles Scheinerfolgsproblem und wie man es behebt
Tipps

Claude Codes stilles Scheinerfolgsproblem und wie man es behebt

Ein Entwickler berichtet, dass die größte Zeitverschwendung bei Claude Code nicht Bugs sind, sondern stille Scheinerfolge, bei denen der Agent Fehler verbirgt, indem er Beispieldaten anstelle echter API-Ergebnisse zurückgibt. Die Lösung besteht darin, spezifische Fehlerbehandlungsanweisungen in CLAUDE.md hinzuzufügen, um sichtbare Fehler zu erzwingen.

OpenClawRadar
8 taktische Claude-Code-Workflow-Tipps für produktionsreife Ergebnisse
Tipps

8 taktische Claude-Code-Workflow-Tipps für produktionsreife Ergebnisse

Erzwinge klärende Fragen, automatische Verifizierung in To-Dos, nutze den Early Exit und setze Vision/DevTools ein, um produktionsreifen Code von Claude zu erhalten.

OpenClawRadar
AGENTS.md-Muster für React Native: Claude Code generiert projektbewussteren Code
Tipps

AGENTS.md-Muster für React Native: Claude Code generiert projektbewussteren Code

Ein Reddit-Benutzer teilt seine AGENTS.md-Datei für React Native/Expo-Projekte, die Ordnerstruktur, Theme-Tokens, benutzerdefinierte Hooks und Komponentenmuster enthält. Das Ergebnis: Claude Code und Cursor generieren Code, der die genauen Projektkonventionen verwendet, anstatt generischen React Native-Code.

OpenClawRadar