ローカルLLMをClaudeコードサブエージェントとして使用してコンテキスト使用量を削減する

Claude Codeは、Claudeのサブエージェントを使用する方法と同様に、ローカルLLMにタスクを委譲することで作業を調整できます。このアプローチにより、ファイルの内容はClaudeのコンテキストから除外され、ローカルモデルの要約と洞察のみが返されます。
仕組み
小さなPythonスクリプト(約120行、標準ライブラリのみ)がエージェントループを実行します:
- ファイルの内容なしでClaudeにタスクの説明を渡します
- スクリプトは
read_fileとlist_dirツール定義を含めて、LM Studioの/v1/chat/completionsエンドポイントに送信します - ローカルモデルは必要なファイルを読み取るためにそれらのツールを自ら呼び出します
- 最終的な回答が生成されるまでループが続きます
- Claudeは結果のみを確認します
コマンド例:
python3 agent_lm.py --dir /path/to/project "summarize solar-system.html"
これにより以下が生成されます:
- [ターン1] →
read_file({'path': 'solar-system.html'}) - [ターン2] → このHTMLファイルはインタラクティブなアニメーション太陽系を作成します...
ファイルの内容はClaudeのコンテキストではなく、ローカルモデルのコンテキスト(Qwenのコンテキストでテスト済み)に入ります。
ユースケースと制限事項
Apple Silicon上のMLXを介したQwen3.5 35B 4-bitでのテストに基づくと、このアプローチは以下に適しています:
- コードの要約と説明
- バグの発見
- ボイラープレート/初稿の生成
- テキストの変換と翻訳(ヘブライ語でテスト済み)
- 論理タスクと推論(難しい問題には
--thinkフラグを使用)
以下には適していません:
- Claudeの完全なコンテキストを必要とするタスク
- 関係性が重要なマルチファイル理解
- 現在の会話履歴を必要とするタスク
- 正確性が重要なもの
これをClaudeの代替ではなく、Haikuレベルのアシスタントと考えてください。
セットアップ要件
- APIサーバーが有効な状態でローカルで実行されているLM Studio
- エージェントループ用のPythonスクリプト1つ、シンプルなプロンプトのみのクエリ用のスクリプト1つ
- 両方をグローバルな
~/.claude/CLAUDE.mdに接続し、Claude Codeが関連する時に委譲を提供するようにします - MCPサーバー、pip依存関係、プラグインインフラは不要です
設定のヒント:Jinjaテンプレートの先頭に{%- set enable_thinking = false %}を追加します。ほとんどのタスクでは、ローカルモデルに推論させる必要はなく、これにより時間とトークンを節約し、速度を向上させ、そのようなタスクでは品質の低下はほとんどありません。
📖 完全なソースを読む: r/ClaudeAI
👀 See Also

OpenClawクライアント、ライブAPIコスト追跡、支出上限、詳細なエージェント制御を追加
OpenClaw Clientにライブ使用状況UIが搭載され、円形プログレスバー、エージェントごとの支出上限、サブエージェント管理、スキルの切り替え、異なるプロバイダからのモデル切り替えが可能になりました。
対立クロードチャットを活用し、キックオフの曖昧さをコスト発生前に発見する方法
ある開発者は、Claude Codeに送るキックオフ仕様を敵対的にレビューするための2つ目のClaudeチャットを追加し、プロジェクトフェーズ全体でClaude Codeのやり直しにかかるコストを推定150〜400ドル削減した。

Visdiff: Claudeのフロントエンドコード生成のための視覚的フィードバックループ
Visdiffは、Claudeのフロントエンドコード生成における視覚的な精度のギャップに対処します。レンダリングされた出力をFigmaデザインとピクセル単位で比較し、差異をループにフィードバックして一致するまで繰り返します。

ビーグルSCM:ASTツリーを保存するソースコード管理システム
Beagleは、バイナリブロブではなく抽象構文木を格納する実験的なソースコード管理システムで、BASONと呼ばれるCRDT風のデータ形式を使用し、RocksDBなどのキーバリュー型データベースをバックエンドストレージとして利用します。