로컬 모델을 사용한 OpenClaw에서 맞춤형 이미지 분석 기술 구축

한 개발자가 API 비용 없이 완전히 무료인 로컬 도구만을 사용하여 OpenClaw용 맞춤형 이미지 분석 스킬을 만드는 과정을 문서화했습니다.
설정 및 초기 어려움
개발자는 Windows 11에서 Ubuntu WSL을 통해 OpenClaw를 실행하며 Ollama를 LLM 백엔드로 사용합니다. WebUI의 이미지 처리에 한계를 발견했는데, 업로드 폴더를 만들었지만 시스템이 파일 정보만 읽을 수 있고 이미지 내용을 분석할 수는 없었습니다. 이로 인해 유료 API 솔루션(Claude, Gemini, OpenAI)이나 하드웨어 구매를 넘어선 대안을 모색하게 되었습니다.
솔루션 개발
context7mcp를 설치한 후, 로컬 언어 모델을 평가하고 Qwen2.5 VL을 선택했습니다. 내장 스킬을 사용한 초기 시도는 모델 이름 수용 문제와 Ollama 통합 문제에 직면했습니다. 돌파구는 체계적인 테스트를 통해 찾았습니다: API 호출을 통해 이미지를 Ollama로 전송하고, 응답을 읽으며, 이 과정을 처리하는 bash 및 Python 스크립트를 모두 만드는 방식이었습니다.
구현 세부사항
- 환경: Ubuntu WSL이 설치된 Windows 11
- LLM 백엔드: Ollama
- 선택한 모델: Qwen2.5 VL
- 통합 방법: Ollama에 대한 API 호출
- 생성된 스크립트: Bash 및 Python 버전
이 맞춤형 스킬은 OpenClaw에 기본적으로 등록되며 "이 이미지를 분석해줘" 또는 "이 사진을 봐줘"와 같은 명령어로 호출되어 상세하고 정확한 응답을 반환합니다. 개발자는 향후 더 작은 Qwen3/3.5VL 모델을 사용한 개선이 성능을 더욱 향상시킬 수 있다고 언급했습니다.
여러 번의 재설치와 불완전한 오픈소스 도구에 대한 좌절감을 포함한 어려움에도 불구하고, 개발자는 이 경험을 "자체 수정 및 자체 개선이 가능한 유기체"를 만드는 것이라고 묘사하며, OpenClaw의 맞춤형 스킬 개발 잠재력에 여전히 감탄하고 있습니다.
📖 Read the full source: r/openclaw
👀 See Also

픽셀 아트 JRPG 제작하기: Claude Code를 활용한 개발자의 워크플로우와 기술 스택
한 개발자가 Claude Code(Opus 4.6)를 사용하여 일본어 학습용 픽셀 아트 JRPG인 '바케마치(Bakemachi)'를 제작하고 플레이 가능한 데모를 공개했습니다. 기술 스택은 Vite, React, Phaser 3, TypeScript, Zustand로 구성되어 있으며, 대부분의 코드 구현은 Claude가 담당했습니다.

클로드 코드, 신입 개발자가 실시간 멀티플레이어 게임을 혼자 제작할 수 있게 하다
공식 SWE 경험이 없는 신입 졸업생이 Claude Code를 사용하여 imageclash.net을 구축했습니다. 이 게임은 서버리스 GPU 자동 확장, 모바일 우선 컨트롤러 UX, R2 기반 이미지 수명 주기 관리를 갖춘 실시간 멀티플레이어 파티 게임입니다.

개발자, 15개의 사이드 프로젝트 관리를 위해 6개의 클로드 AI 에이전트 구축
풀타임 엔지니어링 직업을 가진 한 개발자가 15개의 사이드 프로젝트 일상 운영을 처리하기 위해 여섯 개의 전문화된 Claude 에이전트를 만들어냈습니다. 이는 맞춤형 플랫폼 없이 Claude Code, 마크다운 파일, 그리고 git worktrees를 활용합니다.

클로드 코드로 코딩 없이 AI 에이전트 구축하기: 세 가지 실용적인 예시
레딧 사용자가 Claude Code를 사용하여 AI 에이전트를 만드는 개인 설정을 공유하며, 이메일, 할 일, 캘린더에서 정보를 가져오는 자동화된 아침 브리핑 에이전트, Substack 기사를 캡처하기 위한 tmux 기반 파이프라인, 회의 요약 에이전트 등 세 가지 구체적인 구현 사례를 설명합니다.