Integration lokaler LLM-Agenten mit ComfyUI für die Stapelbildgenerierung mit natürlicher Sprache

Ein Entwickler auf r/LocalLLaMA hat seine Integration zwischen einem lokalen OpenClaw-Agenten und ComfyUI geteilt, die natürliche Sprach-Batch-Bildgenerierung ermöglicht. Das Setup erlaubt es Benutzern, Bildanfragen in einfachem Englisch zu beschreiben, wobei der Agent den gesamten ComfyUI-Pipeline ohne manuelle UI-Interaktion handhabt.
Wie die Integration funktioniert
Der Ablauf folgt dieser Sequenz:
- Agent empfängt Bildanfrage
- Parst Absicht in strukturierte Eingaben (Prompt, Abmessungen, Schritte, Seed)
- Ruft comfyui-Fähigkeit als Werkzeug auf
- Fähigkeit erstellt einen ComfyUI-Workflow-JSON aus den Eingaben
- Sendet POST an lokale ComfyUI-HTTP-API (/prompt)
- Pollt /history alle 2 Sekunden bis Render abgeschlossen ist
- Ruft Ausgabepfad von /view ab
- Gibt Ergebnis an Agent zurück
- Agent bestätigt mit Benutzer
Technische Implementierungsdetails
Die Integration nutzt ComfyUIs knoten-ID-basiertes JSON-Workflow-Format. Die Fähigkeit ordnet Agenteneingaben bestimmten Knoten-IDs in einer Basis-Workflow-Vorlage zu (KSampler, CLIPTextEncode, etc.). Dies wird als "der fragilste Teil der Integration beschrieben, da es von der Knotenstruktur Ihres Workflows abhängt, aber für Standard-Setups funktioniert es zuverlässig."
Die Fähigkeit enthält eine Startverifizierung durch Ping von /object_info, um sicherzustellen, dass ComfyUI tatsächlich bereit ist (nicht nur erreichbar), bevor Jobs angenommen werden. Dies verhindert, dass Jobs sich ohne Ausführung anstellen, während Checkpoints noch laden.
Verbesserungen der Fehlerbehandlung
Jeder API-Aufruf ist verpackt, um agentenlesbare Fehler statt roher HTTP-Fehler zurückzugeben. Zum Beispiel wird "Connection refused at 127.0.0.1:8188" zu "ComfyUI scheint nicht zu laufen. Starten Sie es mit --listen und versuchen Sie es erneut." Dies erleichtert das Debuggen, besonders bei Remote-Arbeit.
Aktuelle Einschränkungen
Die Integration unterstützt noch nicht:
- Fortgeschrittene Multi-Knoten-Workflows (ControlNet, LoRA-Stacking)
- Echtzeit-Fortschritts-Streaming via WebSocket
- Plattformübergreifendes Testen über Windows hinaus
Der gesamte Stack läuft lokal mit OpenClaw (selbstgehostetes Agenten-Framework) + ComfyUI + einem Node.js-Fähigkeits-Skript, ohne Cloud-Komponenten.
📖 Read the full source: r/LocalLLaMA
👀 Siehe auch

Mímir: Ein Python-Speichersystem basierend auf 21 neurowissenschaftlichen Mechanismen
Mímir ist ein Python-Gedächtnissystem für KI-Agenten, das 21 Mechanismen aus der kognitiven Wissenschaft implementiert, wie Flashbulb-Memory und retrievalinduziertes Vergessen. Es verwendet einen hybriden BM25 + semantischen + Datumsindex und zeigt Benchmark-Verbesserungen, einschließlich einer um 13 % höheren Tool-Genauigkeit auf Mem2ActBench im Vergleich zu VividnessMem.

Claude-voice: Lokale TTS mit Wort-Hervorhebung für Claude Code
Claude-voice ist ein Python-Tool, das lokale Text-zu-Sprache mit Echtzeit-Worthervorhebung zum Sprachmodus von Claude Code hinzufügt. Es verwendet Kokoro TTS (82 Millionen Parameter) und läuft vollständig lokal ohne API-Schlüssel.

Manifest Router fügt ZAI-Abonnementunterstützung für OpenClaw-Modellverwaltung hinzu
Der Manifest-Router unterstützt jetzt ZAI-Abonnements, sodass alle ZAI-Modelle in den Routing-Ebenen erscheinen und automatisch pro Anfrage das passende Modell ausgewählt wird. Das Tool befindet sich in der Beta-Phase, ist kostenlos, Open Source und enthält ein Dashboard zur Kostenverfolgung pro Agent, Nachricht und Modell.

OpenClaw Outlook-Add-in verbindet lokalen Agent mit E-Mail-Sidebar
Ein Entwickler hat ein Outlook-Add-in erstellt, das über WebSocket mit einem lokalen OpenClaw Gateway verbindet und vollen Agentenzugriff mit Tools und Automatisierungen direkt in der E-Mail-Seitenleiste bietet. Das Tool liest ausgewählte E-Mails als Kontext, verwaltet Chat-Sitzungen pro E-Mail und funktioniert mit Outlook Desktop und Web.