로컬 LLM 에이전트를 ComfyUI와 통합하여 자연어 기반 배치 이미지 생성하기

r/LocalLLaMA의 한 개발자가 로컬 OpenClaw 에이전트와 ComfyUI 간의 통합을 공유했으며, 이를 통해 자연어로 배치 이미지 생성을 가능하게 했습니다. 이 설정은 사용자가 일반 영어로 이미지 요청을 설명할 수 있게 하며, 에이전트가 수동 UI 상호작용 없이 전체 ComfyUI 파이프라인을 처리합니다.
통합 작동 방식
흐름은 다음과 같은 순서를 따릅니다:
- 에이전트가 이미지 요청을 수신
- 의도를 구조화된 입력(프롬프트, 크기, 단계, 시드)으로 파싱
- 도구로서 comfyui 스킬 호출
- 스킬이 입력에서 ComfyUI 워크플로우 JSON 생성
- 로컬 ComfyUI HTTP API(/prompt)에 POST 요청
- 렌더링이 완료될 때까지 2초마다 /history 폴링
- /view에서 출력 경로 검색
- 결과를 에이전트에 반환
- 에이전트가 사용자에게 확인
기술 구현 세부사항
이 통합은 ComfyUI의 노드-ID 기반 JSON 워크플로우 형식을 사용합니다. 스킬은 에이전트 입력을 기본 워크플로우 템플릿(KSampler, CLIPTextEncode 등)의 특정 노드 ID에 매핑합니다. 이는 "워크플로우의 노드 구조에 의존하기 때문에 통합의 가장 취약한 부분이지만, 표준 설정에서는 안정적으로 작동한다"고 설명됩니다.
스킬은 작업을 수락하기 전에 /object_info를 핑하여 ComfyUI가 실제로 준비되었는지(단순히 접근 가능한지가 아닌) 확인하는 시작 검증을 포함합니다. 이는 체크포인트가 아직 로딩 중일 때 작업이 실행되지 않고 대기열에 쌓이는 것을 방지합니다.
오류 처리 개선
모든 API 호출은 원시 HTTP 실패 대신 에이전트가 읽을 수 있는 오류를 반환하도록 래핑됩니다. 예를 들어, "127.0.0.1:8188에서 연결이 거부되었습니다"는 "ComfyUI가 실행 중인 것 같지 않습니다. --listen으로 시작하고 다시 시도하세요."가 됩니다. 이는 특히 원격으로 작업할 때 디버깅을 더 쉽게 만듭니다.
현재 제한사항
이 통합은 아직 다음을 지원하지 않습니다:
- 고급 다중 노드 워크플로우(ControlNet, LoRA 스태킹)
- WebSocket을 통한 실시간 진행률 스트리밍
- Windows 이외의 플랫폼 간 테스트
전체 스택은 OpenClaw(자체 호스팅 에이전트 프레임워크) + ComfyUI + Node.js 스킬 스크립트를 사용하여 로컬에서 실행되며, 클라우드 구성 요소는 없습니다.
📖 Read the full source: r/LocalLLaMA
👀 See Also

Mike: 오픈소스 법률 AI, 자체 호스팅 및 멀티 모델 지원
Mike는 Harvey와 Legora의 오픈소스 대안으로, 문서 채팅, 테이블 추출 및 워크플로우 템플릿을 제공합니다. 모두 자체 호스팅이 가능하며, 자체 Claude 또는 Gemini API 키를 사용합니다.

개발자가 AI 에이전트 정착, 평판 및 소액 결제를 위한 10개 이상의 MCP 서버를 공유합니다
한 개발자가 Claude Code에서 100개 이상의 에이전트를 가진 BlindOracle을 구축하고, 결제, 평판, 소액 결제를 위한 10개 이상의 MCP 서버를 만들었습니다. 이 아키텍처에는 비공개 커밋-공개 예측, 온체인 점수 매기기, 요청별 소액 결제, 검증 가능한 에이전트 증명이 포함됩니다.

로컬 미팅 녹음을 위한 OpenClaw 스킬과 Whisper
ghostmeet이라는 새로운 OpenClaw 스킬이 Whisper를 사용하여 로컬 회의 녹취를 제공합니다. Chrome 확장 프로그램을 통해 브라우저 탭의 오디오를 캡처하며, Claude를 사용하여 요약을 생성할 수 있고, 모든 오디오와 녹취는 사용자의 기기에서 로컬로 처리됩니다.

클로드 코드 스킬이 스티치 디자인을 제로 픽셀 드리프트로 Next.js로 변환합니다
Claude Code 스킬은 Google Stitch AI 디자인을 Next.js 컴포넌트로 변환하며, 픽셀 드리프트를 방지하기 위한 필수 검증 체크포인트를 포함하여 정확한 값을 보존하고 에셋을 처리합니다.