Intégration d'Agents LLM Locaux avec ComfyUI pour la Génération d'Images par Lots en Langage Naturel

✍️ OpenClawRadar📅 Publié: April 2, 2026🔗 Source
Intégration d'Agents LLM Locaux avec ComfyUI pour la Génération d'Images par Lots en Langage Naturel
Ad

Un développeur sur r/LocalLLaMA a partagé son intégration entre un agent OpenClaw local et ComfyUI qui permet la génération d'images par lots en langage naturel. La configuration permet aux utilisateurs de décrire leurs demandes d'images en anglais simple, l'agent gérant l'intégralité du pipeline ComfyUI sans interaction manuelle avec l'interface.

Fonctionnement de l'intégration

Le flux suit cette séquence :

  • L'agent reçoit une demande d'image
  • Analyse l'intention en entrées structurées (prompt, dimensions, étapes, seed)
  • Appelle la compétence comfyui comme outil
  • La compétence construit un JSON de flux de travail ComfyUI à partir des entrées
  • Envoie une requête POST à l'API HTTP locale de ComfyUI (/prompt)
  • Interroge /history toutes les 2 secondes jusqu'à la fin du rendu
  • Récupère le chemin de sortie depuis /view
  • Renvoie le résultat à l'agent
  • L'agent confirme avec l'utilisateur

Détails techniques de l'implémentation

L'intégration utilise le format JSON de flux de travail basé sur les ID de nœuds de ComfyUI. La compétence mappe les entrées de l'agent sur des ID de nœuds spécifiques dans un modèle de flux de travail de base (KSampler, CLIPTextEncode, etc.). Ceci est décrit comme "la partie la plus fragile de l'intégration car elle dépend de la structure des nœuds de votre flux de travail, mais pour les configurations standards, cela fonctionne de manière fiable."

La compétence inclut une vérification au démarrage en envoyant un ping à /object_info pour s'assurer que ComfyUI est réellement prêt (pas seulement accessible) avant d'accepter des tâches. Cela empêche les tâches de s'accumuler sans s'exécuter lorsque les checkpoints sont encore en cours de chargement.

Ad

Améliorations de la gestion des erreurs

Chaque appel API est encapsulé pour renvoyer des erreurs compréhensibles par l'agent plutôt que des échecs HTTP bruts. Par exemple, "Connection refused at 127.0.0.1:8188" devient "ComfyUI ne semble pas être en cours d'exécution. Démarrez-le avec --listen et réessayez." Cela facilite le débogage, notamment lors d'un travail à distance.

Limitations actuelles

L'intégration ne prend pas encore en charge :

  • Les flux de travail multi-nœuds avancés (ControlNet, empilement LoRA)
  • Le streaming de progression en temps réel via WebSocket
  • Les tests multiplateformes au-delà de Windows

L'ensemble de la pile fonctionne localement en utilisant OpenClaw (framework d'agent auto-hébergé) + ComfyUI + un script de compétence Node.js, sans composants cloud.

📖 Read the full source: r/LocalLLaMA

Ad

👀 See Also

Arrêtez de réapprendre à Claude Code chaque session : utilisez une configuration persistante
Tools

Arrêtez de réapprendre à Claude Code chaque session : utilisez une configuration persistante

Un utilisateur de Reddit explique comment il a économisé 20 minutes par session en écrivant une config persistante pour Claude Code, éliminant les réorientations répétitives et obtenant des complétions 33 % plus rapides.

OpenClawRadar
Codeset améliore les agents de codage avec un contexte spécifique au dépôt provenant de l'historique git.
Tools

Codeset améliore les agents de codage avec un contexte spécifique au dépôt provenant de l'historique git.

Codeset génère des fichiers statiques à partir de l'historique git qui fournissent du contexte comme les bugs passés, les causes racines et les relations de co-changement. Les tests ont montré une amélioration de 5,3 points de pourcentage sur codeset-gym-python et de 2 points sur SWE-Bench Pro avec OpenAI Codex.

OpenClawRadar
Serveur MCP d'analytique Claude-First : Donner aux agents IA un accès direct au contexte d'analytique web
Tools

Serveur MCP d'analytique Claude-First : Donner aux agents IA un accès direct au contexte d'analytique web

Un développeur a reconstruit son outil d'analyse web en tant que serveur MCP, exposant des analyses web simples, des liens traçables et des outils d'information produit directement à Claude, permettant aux agents IA de tirer parti des données du site aux côtés du code et du contexte de la base de données.

OpenClawRadar
DeepSeek V4 Flash offre une qualité proche d'Opus pour les LLM locaux sur site
Tools

DeepSeek V4 Flash offre une qualité proche d'Opus pour les LLM locaux sur site

Un utilisateur de Reddit rapporte que DeepSeek 4 Flash atteint des performances proches d'Opus pour les agents IA locaux sur des données confidentielles, permettant un déploiement sur site sans AWS. Fonctionnant localement avec des GPU NVIDIA, mais encore lent à 1M tokens.

OpenClawRadar