Hermes対OpenClaw:実際の作業でのベンチマークが記憶の教訓で終わる
ある開発者が実際のプロジェクトでHermesとOpenClawの直接比較ベンチマークを実施しました。出力品質はほぼ互角でしたが、決定的だったのはメモリの扱い方です。Hermesが何気ない褒め言葉を暗黙のグローバルルールに変えて数週間の作業を左右したのに対し、OpenClawの明示的で監査可能な学習モデルが勝ちました。
ベンチマークの設定
ユーザーは実際の作業を5ラウンド実施しました:リサーチ、大規模な公開データセットを使ったアプリ構築、コンテンツ作成、転職活動です。両エージェントには同じブリーフを与えました。両者の完全な出力は著者のブログにリンクされており、独立したレビューが可能です。
性能の結果
結果はほぼ互角でした。両ツールとも問題なくソフトウェアアプリを構築し、リサーチでは同じ真実を見つけ、総合スコアも同程度でした。違いはスタイルにありました:
- Hermesは研究者のように書きました——厳密で、引用があり、慎重でした。
- OpenClawは意思決定がすぐできるように書きました——要約を先に、行動指向で。
著者の日常業務では、OpenClawの実用的なスタイルが好まれました。
メモリの問題
ベンチマークは著者の設定を変えませんでした——変わったのはメモリです。Hermesを使っているとき、著者はコードレビューに関するアイデアを褒めました。Hermesはその一度のコメントを自動的にグローバルルールに昇格させました:コードレビューはすべてのソフトウェアエンジニアリング問題のボトルネックである。数週間、すべてのブリーフがその主張のバリエーションを返しました。止めるように言っても効果はなく、同意するものの同じ行動を繰り返しました。そのルールは出力を不可視的に左右しました。
OpenClawは明示的な教示によってのみ学習します——ゆっくりで、意図的で、監査が簡単です。自分が教えたから、何を知っているか常にわかります。著者は、自分のエージェントが繰り返しをやめた後、これを新鮮だと感じました。
なぜOpenClawが勝ったか
著者は、教えなければならないツールなら我慢できるが、要求されていない教訓を静かに学習し、それに基づいて作業を左右するツールは我慢できないと結論づけました。問題はベンチマークでどちらが高いスコアかではなく、どちらの失敗を許容できるかです。
メモリモデルを評価する開発者にとって、このトレードオフは重要です。自動学習は強力ですが、過度の一般化は誤った仮定に基づいて出力を歪めるリスクがあります。
両者のすべての成果物を含む完全なレポートはこちらでご覧いただけます:engineering.kenmazaika.com。
📖 完全なソースを読む: r/openclaw
👀 See Also

1人のSaaS創業者がClaudeのプロジェクト知識を活用して毎日20~30分を節約する方法
インドの中小企業向けCRMを一人で運営する創業者(月商$11.2K)が、ClaudeのProject Knowledge機能によって、毎日のコンテキスト設定を不要にし、プロダクト、カスタマー、グロースの各領域にわたる永続的なキュレーション知識に置き換えた方法を紹介します。

消費者向けAIゲームがB2Bへ:Opus 4.7とHaiku 4.5によるClaude Codeワークフロー
ある開発者が、B2B営業トレーニングツールにおいて、バックエンドのリファクタリングにOpus 4.7を活用したClaude Code、ライブチャットにHaiku 4.5を使用した方法を詳述し、CLAUDE.md/SPLIT_NOTES.mdのワークフローを共有しています。

ClaudeとTickTick MCPサーバーを活用した自主学習の体系化
開発者がYouTubeのトランスクリプトからClaudeを使って自習カリキュラムを作成し、ticktick-mcp GitHubリポジトリを介してTickTickに接続し、プロジェクトタスクとカレンダービューを自動生成しました。

OpenClawオーケストレーターのルーティング問題:委任失敗時の対応
開発者が報告したところによると、OpenClawのメインオーケストレーターは、明示的なルーティングテーブルと委任ルールを使用しているにもかかわらず、リクエストの約40〜50%を専門サブエージェントにルーティングせずに自ら処理してしまうという問題が発生しています。このセットアップには、Gmail、Todoist、Notion、天気などのサービス用の7つの専門エージェントが含まれています。