開発者が共有するハイブリッドAIコーディングワークフロー:計画にはClaude、実行にはローカルモデル

ハイブリッドAIコーディングワークフローでクラウドコストを削減
r/LocalLLaMAの開発者が、クラウドとローカルのAIモデルを組み合わせてトークンコストを削減しながらコーディング品質を維持する詳細なワークフローを共有しました。このアプローチは、多くのコーディングタスクが高価なクラウドモデルを必要としないという認識に対応しています。
ワークフローのアーキテクチャ
このシステムは「クラウドで推論、ローカルで実行」というロジックに従います:
- プランナー(Claude 3.5 Sonnet):タスクを受け取り、指示、ファイルパス、ロジックを含む正確な
task_context.mdファイルを生成します。これには約300〜500トークンのコストがかかります。 - コーダー(Ollama経由のローカルQwen2.5-Coder 30B):仕様と実際のファイル内容を受け取り、コードを記述します。これはローカルで実行され、コストはゼロです。
- バリデーター:単純なBashスクリプトが
tsc --noEmitまたはmypyを実行して型チェックを行います。 - レビュアー(ローカルQwen2.5-Coder 7B):並行して実行され、明らかな論理の欠陥をチェックします。
- 自動修正:ビルドが失敗した場合、エラーログはローカルコーダーに戻され、2〜3回の反復が行われます。
実装の詳細
パイプライン全体は、Ollama APIとの通信にjqとcurlのみを使用する一連のBashスクリプトにラップされています。このシステムは、プランナーの出力に基づいて言語標準(TypeScript、Python、C++など)を自動検出し、重いPython/Nodeランタイムを必要としません。
開発者は、ローカルモデル(30Bのものでさえ)は複雑なアーキテクチャの推論ではしばしば失敗するが、非常に明確な仕様が与えられた場合の実行は驚くほど優れていると指摘しています。
結果と節約効果
12のファイルが変更された最近のTypeScriptプロジェクトでは:
- Claudeの使用は初期計画フェーズのみに限定されました
- ローカルモデルがその他すべてを処理:12ファイルの記述、リンティング、レビュー
- 総節約額:Claude Code CLI内ですべてを行う場合と比較して約85%のトークン削減
開発者は、実装の詳細に興味がある人のために、GitHubのai-orchestratorリポジトリ(ユーザー名:Mybono)でスクリプトを公開しています。
📖 Read the full source: r/LocalLLaMA
👀 See Also

NexQuant: エッジデプロイメント向けRustネイティブ3ビットKVキャッシュエンジン
NexQuantは、生産環境で実証済みのRustエンジンであり、通常はメモリ制約に悩まされるコンシューマーハードウェア上で高コンテキストモデルを実行可能にし、3〜5倍のメモリ削減を実現します。Metal、CUDA、Vulkan、CPUバックエンドをサポートしています。

SMELTコンパイラは、OpenClawワークスペースのトークン使用量を最大95%削減します。
SMELTは、OpenClawワークスペースのマークダウンファイルをより高密度なランタイム形式にコンパイルし、AIモデルに送信するコンテンツを関連するものだけに絞ります。ベンチマークでは、クエリごとのトークン数が76.1%から95.5%削減され、USER.mdやSOUR.mdなどの静的ファイルをメッセージごとに再処理する必要がなくなります。

HuggingFaceエージェントスキル:コーディングエージェントのための標準化されたAIタスク定義
HuggingFace Skillsは、YAMLフロントマターとガイダンスを含む自己完結型フォルダで、データセット作成、モデルトレーニング、評価などの特定のMLタスクをAIエージェントが実行するためのものです。これらはOpenAI Codex、AnthropicのClaude Code、Google Gemini CLI、Cursorと相互運用可能です。

コスト効率の高いAIタスクルーティングのためのRouteLLMセットアップ
Redditユーザーが、OllamaのローカルQwen3.5:4bモデルとGitHub CopilotをOpenWire経由で組み合わせたDocker Compose構成を共有しています。RouteLLMを使用して複雑なタスクはGPT-4oにルーティングし、単純なタスクはローカルで処理します。