ベンチマーク結果:メモリシステム搭載のClaudeエージェントスウォームで、30〜43%のトークンコスト削減を実現

✍️ OpenClawRadar📅 公開日: March 8, 2026🔗 Source
ベンチマーク結果:メモリシステム搭載のClaudeエージェントスウォームで、30〜43%のトークンコスト削減を実現
Ad

Claudeエージェントスウォームのメモリシステムベンチマーク

ある開発者が9ヶ月間、Stompyと呼ばれるメモリシステムを構築してきました。これはファイルベースからSQLite、PostgreSQLへと進化してきたもので、Claudeエージェントスウォームを実行する際のトークン使用量を最小限に抑えることを目的としています。彼らは、メモリシステムを使用した場合と使用しない場合のパフォーマンスを比較するベンチマークを実施しました。

テスト設定

このベンチマークでは、バックエンド、フロントエンド、テストを含む完全な予約機能を必要とする40ポイントのコーディングタスクを使用しました。6エージェントのスウォームを、リードモデルとしてSonnet 4.6、Opus 4.6、Haiku 4.5の3つの異なるClaudeモデルでテストしました。すべてのテストは同じコードベース、同じチームメイト、同じ採点システムを使用しています。チームメイトのエージェントは、リードモデルに関わらず常にOpusを実行しました。

ベンチマーク結果

  • Sonnet 4.6 + メモリ: 40/40, $3.98, 6.5分, 2ターン
  • Sonnet 4.6 メモリなし: 40/40, $7.04, 9.6分, 4ターン
  • Opus 4.6 + メモリ: 40/40, $4.34, 9.6分, 29ターン
  • Opus 4.6 メモリなし: 40/40, $7.65, 10.0分, 70ターン
  • Haiku 4.5 + メモリ: 39/40, $4.95, 7.5分, 2ターン
  • Haiku 4.5 メモリなし: 0/40, $3.97, 5.8分, 3ターン
Ad

主な発見

OpusとSonnetは、メモリを使用することで、メモリなしで実行する場合と比較して約43%のコスト削減を実現しました。開発者は、これらのモデルはメモリなしでもタスクを完了できるほど賢いが、メモリシステムが排除するコードベースの探索にトークンを浪費してしまうと指摘しています。

Haikuの結果は予想外でした:メモリなしでは0/40のスコアでしたが、メモリを使用すると39/40を獲得しました。開発者は、Haikuはプロジェクト構造を理解せずにOpusのチームメイトエージェントを調整できなかったが、メモリアクセスを持つことで有能なリードモデルになったと観察しています。

メモリを使用したSonnetは全体的に最良の構成であり、メモリなしのOpusをすべての指標で約半額のコストで上回りました。重要な教訓は、高価なモデルを使用することよりも、プロジェクトの知識をモデルに利用可能にすることが重要だということです。

技術的詳細

このメモリシステムはStompyと呼ばれ、MCP/API/CLIベースで、Claude Codeと連携します。ベンチマークの設定はGitHubで公開されており、他の人が使用したり改善したりできます。開発者は、これまで各条件でn=1(1回の実行)であるため、さらなる実行を計画していると述べています。

📖 完全なソースを読む: r/ClaudeAI

Ad

👀 See Also

エージェント観測:Claudeコードエージェントチーム監視のリアルタイムダッシュボード
Tools

エージェント観測:Claudeコードエージェントチーム監視のリアルタイムダッシュボード

Agents Observeは、OTELの代わりにフックを使用してClaude Codeエージェントセッションのリアルタイム可観測性を提供するローカルダッシュボードです。すべてのツール呼び出し、エージェント階層、イベントをフィルタリングおよび検索機能付きでキャプチャし、Claudeセッションと共に自動起動するDockerコンテナとして動作します。

OpenClawRadar
Claude APIのトラフィックをルーティングして、Maxサブスクリプション変更後のコストを管理する
Tools

Claude APIのトラフィックをルーティングして、Maxサブスクリプション変更後のコストを管理する

AnthropicのMaxサブスクリプションはサードパーティツールの利用をカバーしなくなり、OpenClawユーザーはAPI課金に移行。ルーティングプロキシは単純なタスクをClaude Sonnet(入力100万トークンあたり3ドル、出力100万トークンあたり15ドル)に、複雑なタスクをOpus(入力100万トークンあたり5ドル、出力100万トークンあたり25ドル)に振り分け、品質を損なわずにコスト削減。

OpenClawRadar
AIが翻訳層を侵食:エージェント時代の組織図
Tools

AIが翻訳層を侵食:エージェント時代の組織図

Ajey Gore氏は、AIが職種を置き換えたのではなく、翻訳タスクを奪ったと主張する。エンジニアリングマネージャー、スクラムマスター、テックリードなどの中間層が縮小し、エージェントが要件を直接コードに変換するようになった。

OpenClawRadar
7つのスラッシュコマンド、0.45ドル/記事:このClaude CodeパイプラインがSEOコンテンツ運用全体を実行
Tools

7つのスラッシュコマンド、0.45ドル/記事:このClaude CodeパイプラインがSEOコンテンツ運用全体を実行

ある開発者が、SEO調査、ライティング、最適化、公開を処理する7コマンドのClaude Codeパイプラインをオープンソース化しました。コストは1投稿あたり0.45ドル(Perplexity API)、1日15分で実行可能。結果:12ヵ月で月間インプレッション数が18倍に。

OpenClawRadar