로컬 LLM 에이전트를 ComfyUI와 통합하여 자연어 기반 배치 이미지 생성하기

✍️ OpenClawRadar📅 게시일: April 2, 2026🔗 Source
로컬 LLM 에이전트를 ComfyUI와 통합하여 자연어 기반 배치 이미지 생성하기
Ad

r/LocalLLaMA의 한 개발자가 로컬 OpenClaw 에이전트와 ComfyUI 간의 통합을 공유했으며, 이를 통해 자연어로 배치 이미지 생성을 가능하게 했습니다. 이 설정은 사용자가 일반 영어로 이미지 요청을 설명할 수 있게 하며, 에이전트가 수동 UI 상호작용 없이 전체 ComfyUI 파이프라인을 처리합니다.

통합 작동 방식

흐름은 다음과 같은 순서를 따릅니다:

  • 에이전트가 이미지 요청을 수신
  • 의도를 구조화된 입력(프롬프트, 크기, 단계, 시드)으로 파싱
  • 도구로서 comfyui 스킬 호출
  • 스킬이 입력에서 ComfyUI 워크플로우 JSON 생성
  • 로컬 ComfyUI HTTP API(/prompt)에 POST 요청
  • 렌더링이 완료될 때까지 2초마다 /history 폴링
  • /view에서 출력 경로 검색
  • 결과를 에이전트에 반환
  • 에이전트가 사용자에게 확인

기술 구현 세부사항

이 통합은 ComfyUI의 노드-ID 기반 JSON 워크플로우 형식을 사용합니다. 스킬은 에이전트 입력을 기본 워크플로우 템플릿(KSampler, CLIPTextEncode 등)의 특정 노드 ID에 매핑합니다. 이는 "워크플로우의 노드 구조에 의존하기 때문에 통합의 가장 취약한 부분이지만, 표준 설정에서는 안정적으로 작동한다"고 설명됩니다.

스킬은 작업을 수락하기 전에 /object_info를 핑하여 ComfyUI가 실제로 준비되었는지(단순히 접근 가능한지가 아닌) 확인하는 시작 검증을 포함합니다. 이는 체크포인트가 아직 로딩 중일 때 작업이 실행되지 않고 대기열에 쌓이는 것을 방지합니다.

Ad

오류 처리 개선

모든 API 호출은 원시 HTTP 실패 대신 에이전트가 읽을 수 있는 오류를 반환하도록 래핑됩니다. 예를 들어, "127.0.0.1:8188에서 연결이 거부되었습니다"는 "ComfyUI가 실행 중인 것 같지 않습니다. --listen으로 시작하고 다시 시도하세요."가 됩니다. 이는 특히 원격으로 작업할 때 디버깅을 더 쉽게 만듭니다.

현재 제한사항

이 통합은 아직 다음을 지원하지 않습니다:

  • 고급 다중 노드 워크플로우(ControlNet, LoRA 스태킹)
  • WebSocket을 통한 실시간 진행률 스트리밍
  • Windows 이외의 플랫폼 간 테스트

전체 스택은 OpenClaw(자체 호스팅 에이전트 프레임워크) + ComfyUI + Node.js 스킬 스크립트를 사용하여 로컬에서 실행되며, 클라우드 구성 요소는 없습니다.

📖 Read the full source: r/LocalLLaMA

Ad

👀 See Also

Mymir: MCP를 통한 코딩 에이전트용 오픈소스 프로젝트 그래프
Tools

Mymir: MCP를 통한 코딩 에이전트용 오픈소스 프로젝트 그래프

Mymir는 MCP를 통해 에이전트에게 의존성, 결정 사항, 승인 기준, 이전 실행 노트가 포함된 그래프 기반 프로젝트 맵을 제공하여 세션 간에 상태를 다시 설명할 필요가 없게 합니다.

OpenClawRadar
에이전트 브라우저 프로토콜: AI 에이전트용 오픈소스 Chrome 포크, Mind2Web 벤치마크에서 90% 달성
Tools

에이전트 브라우저 프로토콜: AI 에이전트용 오픈소스 Chrome 포크, Mind2Web 벤치마크에서 90% 달성

에이전트 브라우저 프로토콜(ABP)은 각 작업 후 JavaScript와 시간을 정지시켜 웹 브라우징을 AI 에이전트용 멀티모달 채팅으로 변환하는 오픈소스 Chrome 포크입니다. Online Mind2Web 벤치마크에서 90.53%를 달성했으며, 단일 명령어로 Claude Code에 추가할 수 있습니다.

OpenClawRadar
Intuno: AI 에이전트 발견 및 통신을 위한 오픈 소스 네트워크
Tools

Intuno: AI 에이전트 발견 및 통신을 위한 오픈 소스 네트워크

Intuno는 AI 에이전트가 기능을 등록하고, 의미론적 검색을 통해 서로를 발견하며, 3줄의 Python 코드로 함수를 호출할 수 있는 오픈소스 네트워크입니다. Claude Desktop 또는 Cursor에서 사용할 수 있는 MCP 통합을 포함하고 있습니다.

OpenClawRadar
OpenClaw 스킬은 로컬 ComfyUI 지원과 큐레이팅된 프롬프트를 통한 AI 이미지 생성 기능을 추가합니다.
Tools

OpenClaw 스킬은 로컬 ComfyUI 지원과 큐레이팅된 프롬프트를 통한 AI 이미지 생성 기능을 추가합니다.

새로운 OpenClaw 스킬이 터미널 내에서 직접 AI 이미지 생성 기능을 제공하며, 1,300개 이상의 큐레이팅된 프롬프트, 로컬 ComfyUI 통합 및 프롬프트 향상 워크플로우를 특징으로 합니다.

OpenClawRadar