ローカルLLMエージェントとComfyUIの統合による自然言語バッチ画像生成

r/LocalLLaMAの開発者が、ローカルのOpenClawエージェントとComfyUIを統合し、自然言語によるバッチ画像生成を可能にした方法を共有しました。このセットアップにより、ユーザーは平易な英語で画像リクエストを記述でき、エージェントが手動のUI操作なしにComfyUIパイプライン全体を処理します。
統合の仕組み
フローは以下の順序で進行します:
- エージェントが画像リクエストを受信
- 意図を構造化された入力(プロンプト、寸法、ステップ数、シード値)に解析
- ツールとしてcomfyuiスキルを呼び出し
- スキルが入力からComfyUIワークフローJSONを構築
- ローカルのComfyUI HTTP API(/prompt)にPOST送信
- 2秒ごとに/historyをポーリングしてレンダリング完了を確認
- /viewから出力パスを取得
- 結果をエージェントに返却
- エージェントがユーザーに確認
技術的な実装詳細
この統合では、ComfyUIのノードIDベースのJSONワークフロー形式を使用しています。スキルは、エージェントの入力をベースワークフローテンプレート(KSampler、CLIPTextEncodeなど)内の特定のノードIDにマッピングします。これは「ワークフローのノード構造に依存するため、統合の中で最も脆弱な部分ですが、標準的なセットアップでは確実に動作します」と説明されています。
スキルには、ジョブを受け付ける前に/object_infoにpingを送信してComfyUIが実際に準備完了状態(単に到達可能なだけでなく)であることを確認する起動検証が含まれています。これにより、チェックポイントがまだ読み込み中のときにジョブが実行されずにキューイングされるのを防ぎます。
エラー処理の改善
すべてのAPI呼び出しは、生のHTTPエラーではなく、エージェントが読み取り可能なエラーを返すようにラップされています。例えば、「127.0.0.1:8188で接続が拒否されました」は「ComfyUIが実行されていないようです。--listenを付けて起動し、再度お試しください」に変換されます。これにより、特にリモート作業時にデバッグが容易になります。
現在の制限事項
この統合では、以下の機能はまだサポートされていません:
- 高度なマルチノードワークフロー(ControlNet、LoRAスタッキング)
- WebSocketを介したリアルタイム進捗ストリーミング
- Windows以外のプラットフォームでのクロスプラットフォームテスト
このスタック全体は、OpenClaw(セルフホスト型エージェントフレームワーク)+ ComfyUI + Node.jsスキルスクリプトを使用してローカルで実行され、クラウドコンポーネントは一切使用されていません。
📖 Read the full source: r/LocalLLaMA
👀 See Also

オープンクローで持続可能なAI知識インフラを構築する
開発者がAIセットアップで一般的なステートレス問題に対処するため、OpenClaw上に「Brain」という完全な知識インフラストラクチャシステムを構築しました。このシステムは、Ollama、Postgres、MongoDB、Qdrant、Memgraphを使用し、完全にローカルハードウェア上で動作します。

Claude CodeはToolSearchでツールスキーマを遅延読み込みし、トークンを節約する
Claude Codeはツールスキーマの読み込みを遅延させ、最初にツール名のみを送信し、使用前にToolSearch呼び出しでスキーマを取得する。この設計によりトークン消費を大幅に削減する。

OpenClawユーザー、ツールのアーキテクチャと安全性のギャップを批判
Redditユーザーは、OpenClawを「この種のエージェント自動化をこれほど手軽に実現する唯一のツール」と評しながらも、試用後に幻滅を表明し、その体験を不十分に保守されたSAPシステムに例えています。

歯櫛:Claude OpusとSonnet APIで構築されたオープンソースのリアルタイム音声ファクトチェッカー
Toothcombは、音声の文字起こしを取得し、主張のファクトチェック、論理的誤謬や操作的な言語の検出をClaude Opus APIを使用して行い、リアルタイムのマイクストリーミングをサポートするオープンソースツールです。