開発者が共有するハイブリッドAIコーディングワークフロー:計画にはClaude、実行にはローカルモデル

ハイブリッドAIコーディングワークフローでクラウドコストを削減
r/LocalLLaMAの開発者が、クラウドとローカルのAIモデルを組み合わせてトークンコストを削減しながらコーディング品質を維持する詳細なワークフローを共有しました。このアプローチは、多くのコーディングタスクが高価なクラウドモデルを必要としないという認識に対応しています。
ワークフローのアーキテクチャ
このシステムは「クラウドで推論、ローカルで実行」というロジックに従います:
- プランナー(Claude 3.5 Sonnet):タスクを受け取り、指示、ファイルパス、ロジックを含む正確な
task_context.mdファイルを生成します。これには約300〜500トークンのコストがかかります。 - コーダー(Ollama経由のローカルQwen2.5-Coder 30B):仕様と実際のファイル内容を受け取り、コードを記述します。これはローカルで実行され、コストはゼロです。
- バリデーター:単純なBashスクリプトが
tsc --noEmitまたはmypyを実行して型チェックを行います。 - レビュアー(ローカルQwen2.5-Coder 7B):並行して実行され、明らかな論理の欠陥をチェックします。
- 自動修正:ビルドが失敗した場合、エラーログはローカルコーダーに戻され、2〜3回の反復が行われます。
実装の詳細
パイプライン全体は、Ollama APIとの通信にjqとcurlのみを使用する一連のBashスクリプトにラップされています。このシステムは、プランナーの出力に基づいて言語標準(TypeScript、Python、C++など)を自動検出し、重いPython/Nodeランタイムを必要としません。
開発者は、ローカルモデル(30Bのものでさえ)は複雑なアーキテクチャの推論ではしばしば失敗するが、非常に明確な仕様が与えられた場合の実行は驚くほど優れていると指摘しています。
結果と節約効果
12のファイルが変更された最近のTypeScriptプロジェクトでは:
- Claudeの使用は初期計画フェーズのみに限定されました
- ローカルモデルがその他すべてを処理:12ファイルの記述、リンティング、レビュー
- 総節約額:Claude Code CLI内ですべてを行う場合と比較して約85%のトークン削減
開発者は、実装の詳細に興味がある人のために、GitHubのai-orchestratorリポジトリ(ユーザー名:Mybono)でスクリプトを公開しています。
📖 Read the full source: r/LocalLLaMA
👀 See Also

TinySearch v0.2.0: 軽量なローカルLLM用ウェブ検索、SearXNG対応に
TinySearch v0.2.0は検索バックエンドをDuckDuckGoからSearXNGに切り替えました。ウェブ検索、ページクロールを行い、Qwen3.5-9BなどのローカルLLM向けにコンパクトなコンテキスト(8kトークン)を提供します。

Agent-Desktop: OSアクセシビリティツリーによる構造化デスクトップ自動化
Agent-desktopは、OSのアクセシビリティAPIを通じてネイティブアプリを検査・操作するための53のコマンドを持つクロスプラットフォームCLI(Rustバイナリ、約15MB)で、JSON出力を提供します。スクリーンショットやビジョンモデルは不要です。段階的なスケルトントラバーサルにより、SlackやVS Codeのような高密度アプリではトークン使用量を78〜96%削減します。

開発者がClaude CodeでGALAプログラミング言語を構築、強い型付けがAI生成コードの信頼性を向上させると指摘
開発者は、Claude Codeを広範囲に使用して、Goにトランスパイルする関数型プログラミング言語GALAを構築しました。この言語は、封印型、網羅的パターンマッチング、デフォルトでの不変性、モナドを特徴としており、Claudeが型推論、パターンマッチング変換器の実装、40以上のバグ修正を支援しました。

モバイルハーネス: Claudeエージェント向けモバイルアプリにブラウザ使用スキルをもたらす
Mobile Harnessは、Claude/エージェントがMobAIを実行レイヤーとして使用し、再利用可能なモバイルアプリスキル(Reddit、Instagram、TikTok)を提供します。実際のデバイス、エミュレータ、シミュレータで動作し、無料の日次クォータがあります。