Integration lokaler LLM-Agenten mit ComfyUI für die Stapelbildgenerierung mit natürlicher Sprache

Ein Entwickler auf r/LocalLLaMA hat seine Integration zwischen einem lokalen OpenClaw-Agenten und ComfyUI geteilt, die natürliche Sprach-Batch-Bildgenerierung ermöglicht. Das Setup erlaubt es Benutzern, Bildanfragen in einfachem Englisch zu beschreiben, wobei der Agent den gesamten ComfyUI-Pipeline ohne manuelle UI-Interaktion handhabt.
Wie die Integration funktioniert
Der Ablauf folgt dieser Sequenz:
- Agent empfängt Bildanfrage
- Parst Absicht in strukturierte Eingaben (Prompt, Abmessungen, Schritte, Seed)
- Ruft comfyui-Fähigkeit als Werkzeug auf
- Fähigkeit erstellt einen ComfyUI-Workflow-JSON aus den Eingaben
- Sendet POST an lokale ComfyUI-HTTP-API (/prompt)
- Pollt /history alle 2 Sekunden bis Render abgeschlossen ist
- Ruft Ausgabepfad von /view ab
- Gibt Ergebnis an Agent zurück
- Agent bestätigt mit Benutzer
Technische Implementierungsdetails
Die Integration nutzt ComfyUIs knoten-ID-basiertes JSON-Workflow-Format. Die Fähigkeit ordnet Agenteneingaben bestimmten Knoten-IDs in einer Basis-Workflow-Vorlage zu (KSampler, CLIPTextEncode, etc.). Dies wird als "der fragilste Teil der Integration beschrieben, da es von der Knotenstruktur Ihres Workflows abhängt, aber für Standard-Setups funktioniert es zuverlässig."
Die Fähigkeit enthält eine Startverifizierung durch Ping von /object_info, um sicherzustellen, dass ComfyUI tatsächlich bereit ist (nicht nur erreichbar), bevor Jobs angenommen werden. Dies verhindert, dass Jobs sich ohne Ausführung anstellen, während Checkpoints noch laden.
Verbesserungen der Fehlerbehandlung
Jeder API-Aufruf ist verpackt, um agentenlesbare Fehler statt roher HTTP-Fehler zurückzugeben. Zum Beispiel wird "Connection refused at 127.0.0.1:8188" zu "ComfyUI scheint nicht zu laufen. Starten Sie es mit --listen und versuchen Sie es erneut." Dies erleichtert das Debuggen, besonders bei Remote-Arbeit.
Aktuelle Einschränkungen
Die Integration unterstützt noch nicht:
- Fortgeschrittene Multi-Knoten-Workflows (ControlNet, LoRA-Stacking)
- Echtzeit-Fortschritts-Streaming via WebSocket
- Plattformübergreifendes Testen über Windows hinaus
Der gesamte Stack läuft lokal mit OpenClaw (selbstgehostetes Agenten-Framework) + ComfyUI + einem Node.js-Fähigkeits-Skript, ohne Cloud-Komponenten.
📖 Read the full source: r/LocalLLaMA
👀 Siehe auch

Anchormd: Ein Werkzeug zur Verwaltung von Kontext über Claude AI-Sitzungen hinweg
Anchormd ist ein Open-Source-Tool, das den Kontextverlust in Claude-AI-Sitzungen behebt, indem es kuratierte Markdown-Pläne in einen durchsuchbaren Wissensgraphen indexiert. Es ermöglicht Agenten, Projektübersichten zu Sitzungsbeginn zu laden und bei Bedarf nach spezifischen Details zu suchen.

NerfGuard: Ein Klassifikator, der Codierungsanfragen an günstigere Modelle weiterleitet und die Kosten um das Dreifache senkt
NerfGuard verwendet einen schnellen Klassifizierer, um Anfragen von Codierungsagenten an das günstigste Modell und die erforderliche Reasoning-Tiefe weiterzuleiten, was eine dreifache Nutzung bei gleichen Kosten ermöglicht. Inklusive Token-Optimierungen.

SWE-CI: Neuer Benchmark testet KI-Agenten auf langfristige Code-Wartung via CI
SWE-CI ist ein Repository-Level-Benchmark, der KI-gestützte Agenten bei der Wartung von Codebasen über Continuous-Integration-Zyklen hinweg bewertet. Dabei verlagert er den Fokus von statischer Fehlerbehebung auf langfristige Wartbarkeit über 100 realitätsnahe Aufgaben hinweg.

Destillerie: Ein Claude-Code-Plugin für beständigen Team-Kontext
Distillery ist ein Plugin für Claude Code, das Teams gemeinsamen, persistenten Kontext über Sitzungen und Personen hinweg bietet. Version 0.2.0 fügt Hybridsuche, Authentifizierungs-Überwachungsprotokollierung und UV-Unterstützung hinzu.