Benchmark-Ergebnisse: 6 kostengünstige Modelle im Vergleich zu Claude Sonnet 4.6 für OpenClaw-Orchestrierung

Ein Entwickler führte einen Benchmark durch, um eine kostengünstigere Alternative zu Claude Sonnet 4.6 als Haupt-Orchestrator für ein OpenClaw-KI-Coding-Agent-Setup zu finden. Der Test verwendete einen konsistenten 5-Aufgaben-Parcours mit echten Dateien und Werkzeugen, ohne unterstützende Prompts.
Die Parcours-Aufgaben
- T1: Details aus einer bestimmten Datei abrufen (offene Punkte in MEMORY.md)
- T2: Dateien inspizieren, Unvollständigkeit erkennen, abgleichen und priorisieren
- T3: Einen Shell-Befehl ausführen, Ausgabe genau parsen und melden
- T4: Eine Delegierungsaufgabe erkennen und korrekt weitergeben
- T5: Ergebnisse zu einer Management-Zusammenfassung synthetisieren
Benchmark-Ergebnisse
Rohwerte von 5, mit Kosten pro Million Ausgabe-Tokens:
- Claude Sonnet 4.6: 5/5 (15 $/M) – Basislinie, bewältigt den gesamten Vorgang fehlerfrei
- o4-mini: 5/5 (4,40 $/M) – 71 % günstiger, meisterte alle Aufgaben, aber mit merklicher Verzögerung bei Denkketten
- Grok 4.1 Fast: 3/5 (0,50 $/M) – Zerstörte T1/T3/T5, scheiterte aber bei T2 (las 4 Zeilen SMS-Log, erklärte „alles klar“)
- Gemini 2.5 Flash: 1/5 (2,50 $/M) – Meisterte T1, brach dann mitten im Prompt ab
- DeepSeek V3.2: 0/5 (0,42 $/M) – 2-Sekunden-Laufzeit, keine Ausgabe
- Llama 4 Maverick: Disqualifiziert (0,60 $/M) – Halluzinierte Dateiinhalte, erfand gefälschte Video-Dateinamen mit Datum 2024 (aktuelles Jahr ist 2026), rief nie echte Werkzeuge auf
Haupterkenntnis: Die Urteilslücke
Der kritische Fehlerpunkt war die T2-Dateibeurteilung. Modelle mussten ein kurzes Log lesen (4 Zeilen: SMS gesendet, erledigt), erkennen, dass es unvollständig war, zu MEMORY.md wechseln, alle offenen Punkte im Arbeitsbereich auflisten und dann korrekt priorisieren (Arzttermin 19. März > Cron-Fehler > usw.). Nur Sonnet und o4-mini waren erfolgreich. Andere Modelle wurden bei dieser Aufgabe als „faul oder blind“ beschrieben.
Praktische Umsetzung
Die Schlussfolgerung des Entwicklers: Sonnet bleibt Haupt-Orchestrator. Grok 4.1 Fast wird allen Subagenten (Video-QA, Verteilung, Analytik) zugewiesen, für 97 % Ersparnis bei abgegrenzten Aufgaben wie „Pick generieren“ oder „Tweet posten“.
Sie implementierten auch einen 3-Uhr-Cron-Job, der über Websuche nach neuen Modellversionen sucht, automatisch den Parcours ausführt, ein Best-to-Worst-Balkendiagramm erstellt und den Bericht per E-Mail versendet.
Die Kernlektion: Orchestrierung erfordert Urteilsvermögen bei Dateilücken, Delegierungszeitpunkt und Synthese – Bereiche, in denen günstige Modelle konsequent versagen. Subagenten können jedoch günstigere Modelle effektiv für spezifische, abgegrenzte Aufgaben nutzen.
📖 Read the full source: r/openclaw
👀 Siehe auch

Claude Code fügt automatischen Modus für Berechtigungsentscheidungen hinzu
Claude Code verfügt jetzt über einen Automatikmodus, der Claude Entscheidungen über Berechtigungen überlässt, anstatt für jeden Dateischreibvorgang und jeden Bash-Befehl eine manuelle Genehmigung zu erfordern. Dieser Modus enthält Sicherheitsvorkehrungen, die jede Aktion vor der Ausführung überprüfen, wobei ein Klassifikator Werkzeugaufrufe auf potenziell zerstörerische Aktionen hin untersucht.

LystBot: Ein MCP-Server für Claude zur Verwaltung von Listen und Aufgaben
LystBot ist eine Listenverwaltungs-App mit einem nativen MCP-Server, der es Claude ermöglicht, direkt mit Einkaufslisten, To-Do-Listen und Packlisten zu interagieren. Hauptsächlich mit Claude Code entwickelt, umfasst es eine Flutter-Mobile-App, REST-API, CLI und einen Open-Source-Node.js-MCP-Server.

Qwen3.6:27b + Custom Go-Agent: Eine lokale Alternative zu Claude Code
Ein Entwickler testet Qwen3.6:27b bei Q8 auf einer RTX 6000 (96 GB), behauptet, dass es für die tägliche Programmierung mit Claude Code mithalten kann, und veröffentlicht einen minimalen Go-Agenten ohne Plugins oder MCP als Open Source.

Agent-Xray: Open-Source-Tool zum Debuggen von KI-Agent-Fehlern aus Trace-Logs
Agent-Xray ist ein unter MIT-Lizenz stehendes Open-Source-Tool, das AI-Agenten-Trace-Protokolle analysiert, um Fehler in Kategorien wie Spin, Tool-Bug und Early-Abort zu klassifizieren, und enthält einen Enforcement-Modus, um Korrekturen gegen adversarische Herausforderungen zu testen.