ルーティングによりOpenClaw Maxの利用コストが85%削減:APIルーティングで月額200ドルから30ドルへ

あるOpenClaw Maxユーザーが計算したところ、毎日のトークン使用量のうち、約15%しかOpusのようなフロンティアモデルを必要としないことがわかりました。残り——ファイル読み取り、git status、プロジェクトコンテキストスキャン、テスト生成、スキャフォールディング、フォーマット、リネーム、単純なリファクタリング——は、Sonnetのようなより安価なモデルや、さらに低コストの代替品で処理できます。
トークン使用量の内訳
- 約40% — ファイル読み取り、git status、プロジェクトコンテキストスキャン:Opusは不要
- 約25% — テスト生成、スキャフォールディング、ボイラープレート:Sonnetで同等に処理可能
- 約20% — フォーマット、リネーム、単純なリファクタリング:どのモデルでも可
- 約15% — 実際の高度な推論、ファイル間アーキテクチャ:唯一Opusが必要な部分
月額200ドルのMaxサブスクリプションから、ルーティングルール付きのAPIに切り替えることで、ユーザーはルーチンタスクにSonnetを、ファイル間の推論にのみOpusを使用するよう設定しました。月額料金は約30ドルに低下——85%の削減——し、難易度の高いタスクには引き続きOpusが使用されるため、出力品質に変化は感じられませんでした。
ユーザーは、サブスクリプションモデルがこの非効率性を意図的に隠蔽していると指摘しています。トークンの内訳も、タスクごとのコストの可視性もなく、ただ不可解に減少するクォータだけです。
プレミアムプランを支払っているチームや個人にとって、API経由のルーティングは、実際にトップクラスのモデルが必要なタスクのパフォーマンスを犠牲にすることなく、大幅な節約をもたらす可能性があります。
📖 ソース全文を読む: r/openclaw
👀 See Also

2x3090でCPUオフロードを使用したMiniMax M2.7 Q8_0 128Kの実行 – 実世界のベンチマークと設定
あるユーザーがMiniMax M2.7(Q8_0量子化)を128Kコンテキストで2枚のRTX 3090とDDR4 RAM上で正常に実行し、プロンプト処理で約50 tps、トークン生成で約10 tpsを達成し、llama-serverのフラグを共有しています。

Codexで構築、OpenClawで実行:実用的な分割が機能する
ある開発者が、OpenClawのフラストレーションを突破した方法を共有。自動化ロジックはCodexで構築し、OpenClawは純粋に実行レイヤーとして使用。さらに、Apple MessagesをCarPlay経由で使うことで、まるでJarvisのようなアシスタントに近づいたと語る。

Claudeの/btwコマンドは、タスク実行中に並行してコミュニケーションを可能にします
Claude AIは現在、AIがタスクを積極的に処理している間にユーザーがAIと通信できる /btw コマンドをサポートしています。これにより、現在のワークフローを中断することなく、質問、追加の指示、または明確化を行うことができます。

思考力を高めるオープンクロー:方向確認スキルで誤った前提に挑む
OpenClawの新しいスキルがAGENTS.mdに意思決定品質のガイドラインを追加。エージェントはコストのかかる変更の前に、ユーザーの前提を検証します。