Integrando Agentes LLM Locais com ComfyUI para Geração de Lotes de Imagens em Linguagem Natural

✍️ OpenClawRadar📅 Publicado: April 2, 2026🔗 Source
Integrando Agentes LLM Locais com ComfyUI para Geração de Lotes de Imagens em Linguagem Natural
Ad

Um desenvolvedor no r/LocalLLaMA compartilhou sua integração entre um agente OpenClaw local e o ComfyUI que permite a geração de imagens em lote por linguagem natural. A configuração permite que os usuários descrevam solicitações de imagem em inglês simples, com o agente lidando com todo o pipeline do ComfyUI sem interação manual com a interface.

Como a Integração Funciona

O fluxo segue esta sequência:

  • Agente recebe a solicitação de imagem
  • Analisa a intenção em entradas estruturadas (prompt, dimensões, passos, seed)
  • Chama a habilidade comfyui como uma ferramenta
  • A habilidade constrói um JSON de fluxo de trabalho do ComfyUI a partir das entradas
  • Faz POST para a API HTTP local do ComfyUI (/prompt)
  • Verifica /history a cada 2 segundos até a renderização ser concluída
  • Recupera o caminho de saída de /view
  • Retorna o resultado para o agente
  • Agente confirma com o usuário

Detalhes da Implementação Técnica

A integração usa o formato JSON de fluxo de trabalho baseado em ID de nó do ComfyUI. A habilidade mapeia as entradas do agente para IDs de nó específicos em um modelo de fluxo de trabalho base (KSampler, CLIPTextEncode, etc.). Isso é descrito como "a parte mais frágil da integração, pois depende da estrutura de nós do seu fluxo de trabalho, mas para configurações padrão funciona de forma confiável".

A habilidade inclui verificação de inicialização fazendo ping em /object_info para garantir que o ComfyUI esteja realmente pronto (não apenas acessível) antes de aceitar trabalhos. Isso evita que os trabalhos fiquem na fila sem executar quando os checkpoints ainda estão carregando.

Ad

Melhorias no Tratamento de Erros

Cada chamada de API é encapsulada para retornar erros legíveis pelo agente em vez de falhas HTTP brutas. Por exemplo, "Connection refused at 127.0.0.1:8188" se torna "O ComfyUI parece não estar em execução. Inicie-o com --listen e tente novamente." Isso facilita a depuração, especialmente ao trabalhar remotamente.

Limitações Atuais

A integração ainda não suporta:

  • Fluxos de trabalho avançados com múltiplos nós (ControlNet, empilhamento LoRA)
  • Transmissão de progresso em tempo real via WebSocket
  • Testes multiplataforma além do Windows

Toda a pilha é executada localmente usando OpenClaw (framework de agente auto-hospedado) + ComfyUI + um script de habilidade Node.js, sem componentes na nuvem.

📖 Leia a fonte completa: r/LocalLLaMA

Ad

👀 See Also

DeepSeek V4 Flash Oferece Qualidade Quase-Ópus para LLMs Locais On-Premises
Tools

DeepSeek V4 Flash Oferece Qualidade Quase-Ópus para LLMs Locais On-Premises

Usuário do Reddit relata que DeepSeek 4 Flash se aproxima do desempenho do Opus para agentes de IA locais com dados confidenciais, permitindo implantação on-premise sem AWS. Executando localmente com GPUs NVIDIA, mas ainda lento com 1M de tokens.

OpenClawRadar
O Hollow AgentOS reduz o uso de tokens do Claude Code em 68,5% com um sistema operacional nativo em JSON para agentes de IA
Tools

O Hollow AgentOS reduz o uso de tokens do Claude Code em 68,5% com um sistema operacional nativo em JSON para agentes de IA

Hollow AgentOS é um sistema operacional nativo em JSON projetado especificamente para agentes de IA que reduz o uso de tokens no Claude Code em 68,5%, eliminando a sobrecarga ineficiente de comandos de shell.

OpenClawRadar
PromptFlow Voz: Fale Hindi, Obtenha Prompts Estruturados do Claude Code
Tools

PromptFlow Voz: Fale Hindi, Obtenha Prompts Estruturados do Claude Code

Um desenvolvedor usou Claude Code e Codex para criar o PromptFlow Voice — um aplicativo desktop que converte fala natural em Hindi em prompts de desenvolvimento estruturados para o Claude Code, ou e-mails prontos para envio no Gmail. A demonstração mostra um pedido por voz em Hindi gerando um prompt em Inglês para o Claude Code sobre lógica de reconexão de socket com backoff exponencial.

OpenClawRadar
Ferramenta de Voz para Texto Offline para macOS Usando Whisper Local via MLX
Tools

Ferramenta de Voz para Texto Offline para macOS Usando Whisper Local via MLX

Um desenvolvedor disponibilizou em código aberto o whisper-dictate, uma ferramenta para macOS que oferece transcrição de voz para texto totalmente offline com capacidades de tradução em tempo real, utilizando o Whisper rodando localmente através do MLX em Apple Silicon. A transcrição leva cerca de 500ms após o término da fala.

OpenClawRadar