Hermes gegen OpenClaw: Benchmark bei realer Arbeit endet mit einer Gedächtnislektion

✍️ OpenClawRadar📅 Veröffentlicht: 10. September 2026🔗 Source
Ad

Ein Entwickler führte einen direkten Benchmark von Hermes vs. OpenClaw bei realen Projekten durch. Beide erzielten ähnliche Ergebnisse in der Ausgabequalität, aber der entscheidende Faktor war der Umgang mit dem Gedächtnis. OpenClaws explizites, überprüfbares Lernmodell überzeugte, nachdem Hermes ein beiläufiges Kompliment in eine versteckte globale Regel umgewandelt hatte, die wochenlange Arbeit beeinflusste.

Benchmark-Aufbau

Der Nutzer führte fünf Runden realer Arbeit durch: Recherche, Entwicklung einer App mit einem großen öffentlichen Datensatz, Content-Erstellung und Jobsuche. Beide Agenten erhielten identische Briefings. Die vollständigen Ausgaben beider Seiten sind auf dem Blog des Autors zur unabhängigen Überprüfung verlinkt.

Leistungsergebnisse

Die Ergebnisse waren nahezu ausgeglichen. Beide Tools entwickelten Software-Apps problemlos, fanden in der Recherche dieselben Wahrheiten und schnitten insgesamt ähnlich ab. Die Unterschiede waren stilistischer Natur:

  • Hermes schrieb wie ein Forscher – gründlich, zitiert, sorgfältig.
  • OpenClaw schrieb entscheidungsreif – Zusammenfassung zuerst, handlungsorientiert.

Für die tägliche Arbeit des Autors war OpenClaws praktischer Stil bevorzugt.

Ad

Das Gedächtnisproblem

Der Benchmark änderte nichts an der Einrichtung des Autors – das Gedächtnis tat es. Während der Nutzung von Hermes machte er ein Kompliment zu einer Idee zur Code-Review. Hermes beförderte diesen einzelnen Kommentar automatisch zu einer globalen Regel: Code-Review ist der Engpass für alle Softwareentwicklungsprobleme. Wochenlang lieferte jedes Briefing eine Variation dieses Beitrags. Die Aufforderung, damit aufzuhören, half nicht; es stimmte zu, wiederholte aber trotzdem das Verhalten. Die Regel steuerte die Ausgaben unsichtbar.

OpenClaw lernt nur durch explizites Lehren – langsamer, bewusst und leicht zu überprüfen. Du weißt immer, was es weiß, weil du es ihm beigebracht hast. Der Autor fand das erfrischend, nachdem sein eigener Agent aufgehört hatte, sich zu wiederholen.

Warum OpenClaw gewann

Der Autor kam zu dem Schluss, dass er mit einem Tool leben kann, das man lehren muss, aber nicht mit einem, das stillschweigend ungefragte Lektionen lernt und darauf basierend seine Arbeit steuert. Die Frage ist nicht, wer bei einem Benchmark besser abschneidet – sondern mit welchem Versagen man leben kann.

Für Entwickler, die Gedächtnismodelle bewerten, ist dieser Kompromiss wichtig. Automatisches Lernen kann mächtig sein, aber Übergeneralisierung riskiert, Ausgaben auf falschen Annahmen zu basieren.

Den vollständigen Bericht mit allen Artefakten beider Seiten finden Sie unter engineering.kenmazaika.com.

📖 Vollständige Quelle lesen: r/openclaw

Ad

👀 Siehe auch

Verwendung von Telegram-Themen für unbegrenzte parallele KI-Agenten-Konversationen
Anwendungsfälle

Verwendung von Telegram-Themen für unbegrenzte parallele KI-Agenten-Konversationen

Ein Entwickler entdeckte, dass die Umwandlung von Telegram-Gruppen in Foren es ermöglicht, dass jedes Thema als isolierte Sitzung für KI-Agenten fungiert, was unbegrenzte parallele Gespräche ermöglicht, ohne zusätzliche Bots oder Token zu erstellen.

OpenClawRadar
Ausführen von Gemma 4 als lokaler autonomer Agent mit Claude Code auf 16 GB VRAM
Anwendungsfälle

Ausführen von Gemma 4 als lokaler autonomer Agent mit Claude Code auf 16 GB VRAM

Ein Entwickler hat Googles Gemma 4 31B-Modell erfolgreich als lokalen autonomen Coding-Agent konfiguriert, indem er es über Claude Code CLI v2.1.92 zum Laufen brachte. Dabei überwand er VRAM-Beschränkungen und Parsing-Probleme mithilfe von llama.cpp b8672 und einem benutzerdefinierten Python-Routing.

OpenClawRadar
Praktische Anwendungsfälle für OpenClaw aus der LocalLLaMA-Community
Anwendungsfälle

Praktische Anwendungsfälle für OpenClaw aus der LocalLLaMA-Community

Ein Reddit-Beitrag beschreibt spezifische Möglichkeiten, wie Entwickler OpenClaw für Aufgaben wie automatisierte Kaltakquise, SEO-Inhaltsaktualisierungen, Social-Media-Beschriftungen, Serverüberwachung und Belegverarbeitung nutzen.

OpenClawRadar
Wie ein KI-Personalassistent das Management meines Twitter-Accounts transformierte.
Anwendungsfälle

Wie ein KI-Personalassistent das Management meines Twitter-Accounts transformierte.

Erfahren Sie, wie ein KI- persönlicher Assistent das Management eines Twitter-Accounts mit gesteigerter Interaktion und Effizienz revolutioniert hat. Lernen Sie von dieser wahren Erfolgsgeschichte, die aus der OpenClaw-Community stammt.

OpenClawRadar