Benchmark-Ergebnisse: 6 kostengünstige Modelle im Vergleich zu Claude Sonnet 4.6 für OpenClaw-Orchestrierung

✍️ OpenClawRadar📅 Veröffentlicht: 17. März 2026🔗 Source
Benchmark-Ergebnisse: 6 kostengünstige Modelle im Vergleich zu Claude Sonnet 4.6 für OpenClaw-Orchestrierung
Ad

Ein Entwickler führte einen Benchmark durch, um eine kostengünstigere Alternative zu Claude Sonnet 4.6 als Haupt-Orchestrator für ein OpenClaw-KI-Coding-Agent-Setup zu finden. Der Test verwendete einen konsistenten 5-Aufgaben-Parcours mit echten Dateien und Werkzeugen, ohne unterstützende Prompts.

Die Parcours-Aufgaben

  • T1: Details aus einer bestimmten Datei abrufen (offene Punkte in MEMORY.md)
  • T2: Dateien inspizieren, Unvollständigkeit erkennen, abgleichen und priorisieren
  • T3: Einen Shell-Befehl ausführen, Ausgabe genau parsen und melden
  • T4: Eine Delegierungsaufgabe erkennen und korrekt weitergeben
  • T5: Ergebnisse zu einer Management-Zusammenfassung synthetisieren

Benchmark-Ergebnisse

Rohwerte von 5, mit Kosten pro Million Ausgabe-Tokens:

  • Claude Sonnet 4.6: 5/5 (15 $/M) – Basislinie, bewältigt den gesamten Vorgang fehlerfrei
  • o4-mini: 5/5 (4,40 $/M) – 71 % günstiger, meisterte alle Aufgaben, aber mit merklicher Verzögerung bei Denkketten
  • Grok 4.1 Fast: 3/5 (0,50 $/M) – Zerstörte T1/T3/T5, scheiterte aber bei T2 (las 4 Zeilen SMS-Log, erklärte „alles klar“)
  • Gemini 2.5 Flash: 1/5 (2,50 $/M) – Meisterte T1, brach dann mitten im Prompt ab
  • DeepSeek V3.2: 0/5 (0,42 $/M) – 2-Sekunden-Laufzeit, keine Ausgabe
  • Llama 4 Maverick: Disqualifiziert (0,60 $/M) – Halluzinierte Dateiinhalte, erfand gefälschte Video-Dateinamen mit Datum 2024 (aktuelles Jahr ist 2026), rief nie echte Werkzeuge auf
Ad

Haupterkenntnis: Die Urteilslücke

Der kritische Fehlerpunkt war die T2-Dateibeurteilung. Modelle mussten ein kurzes Log lesen (4 Zeilen: SMS gesendet, erledigt), erkennen, dass es unvollständig war, zu MEMORY.md wechseln, alle offenen Punkte im Arbeitsbereich auflisten und dann korrekt priorisieren (Arzttermin 19. März > Cron-Fehler > usw.). Nur Sonnet und o4-mini waren erfolgreich. Andere Modelle wurden bei dieser Aufgabe als „faul oder blind“ beschrieben.

Praktische Umsetzung

Die Schlussfolgerung des Entwicklers: Sonnet bleibt Haupt-Orchestrator. Grok 4.1 Fast wird allen Subagenten (Video-QA, Verteilung, Analytik) zugewiesen, für 97 % Ersparnis bei abgegrenzten Aufgaben wie „Pick generieren“ oder „Tweet posten“.

Sie implementierten auch einen 3-Uhr-Cron-Job, der über Websuche nach neuen Modellversionen sucht, automatisch den Parcours ausführt, ein Best-to-Worst-Balkendiagramm erstellt und den Bericht per E-Mail versendet.

Die Kernlektion: Orchestrierung erfordert Urteilsvermögen bei Dateilücken, Delegierungszeitpunkt und Synthese – Bereiche, in denen günstige Modelle konsequent versagen. Subagenten können jedoch günstigere Modelle effektiv für spezifische, abgegrenzte Aufgaben nutzen.

📖 Read the full source: r/openclaw

Ad

👀 Siehe auch

OpenCawt: Open-Source-Gerichtssystem für KI-Agenten-Streitigkeiten
Werkzeuge

OpenCawt: Open-Source-Gerichtssystem für KI-Agenten-Streitigkeiten

OpenCawt ist ein Open-Source-Justizsystem für autonome Agenten, das es ihnen ermöglicht, Streitigkeiten einzureichen, Beweise vorzulegen, strukturierte Entscheidungen zu erhalten und Ergebnisse als überprüfbare öffentliche Aufzeichnungen zu versiegeln. Es enthält eine schlanke Protokollschicht namens OCP zur Formalisierung von Vereinbarungen und Entscheidungen innerhalb anderer Anwendungen.

OpenClawRadar
Agent Times Skill für ClawHub fügt Echtzeit-Nachrichten, Wetter- und Token-Preisabfragen hinzu
Werkzeuge

Agent Times Skill für ClawHub fügt Echtzeit-Nachrichten, Wetter- und Token-Preisabfragen hinzu

Eine neue ClawHub-Fähigkeit namens Agent Times ermöglicht es KI-Agenten, Echtzeit-Anfragen zu Nachrichten, Wetter und Kryptowährungspreisen zu beantworten. Die Installation erfolgt über npx clawhub install agenttimes, und sie bietet Zugriff auf über 228.000 Artikel aus 3.576 Feeds mit Stimmungsbewertung und Entitätsextraktion.

OpenClawRadar
Clarc v1.0: Workflow-Betriebssystem für Claude Code mit 63 Agenten und 249 Fähigkeiten
Werkzeuge

Clarc v1.0: Workflow-Betriebssystem für Claude Code mit 63 Agenten und 249 Fähigkeiten

Clarc ist eine Plugin-Schicht für Claude Code, die 63 spezialisierte Subagenten, 249 Domänen-Fähigkeiten und 178 Slash-Befehle für Entwicklungs-Workflows bereitstellt. Die Installation erfolgt über npx mit Unterstützung für mehrere Editoren, einschließlich Cursor und OpenCode.

OpenClawRadar
Symphony-Workflow-Automatisierungstool arbeitet mit Claude Code zusammen.
Werkzeuge

Symphony-Workflow-Automatisierungstool arbeitet mit Claude Code zusammen.

Ein Entwickler hat die Symphony-Spezifikation mit Claude Code zum Laufen gebracht, um Ticket-zu-PR-Workflows zu automatisieren, zunächst mit Node/TypeScript, aber mit dem Hinweis, dass Elixir möglicherweise besser geeignet wäre. Das Tool erfordert eine separate API-Schlüssel-Einrichtung und Abrechnung über Claude-Abonnements hinaus.

OpenClawRadar