Construindo Habilidades Personalizadas de Análise de Imagens no OpenClaw com Modelos Locais

Um desenvolvedor documentou seu processo de criação de uma habilidade personalizada de análise de imagens para OpenClaw usando ferramentas totalmente gratuitas e locais, sem custos de API.
Configuração e Desafios Iniciais
O desenvolvedor executa o OpenClaw no Windows 11 via Ubuntu WSL com Ollama como backend de LLM. Ele encontrou limitações no tratamento de imagens da WebUI - embora tenha criado uma pasta de uploads, o sistema só conseguia ler informações do arquivo, mas não analisar o conteúdo da imagem. Isso o levou a explorar alternativas além de soluções de API pagas (Claude, Gemini, OpenAI) ou compras de hardware.
Desenvolvimento da Solução
Após instalar o context7mcp, ele avaliou modelos de linguagem locais e optou pelo Qwen2.5 VL. Tentativas iniciais com habilidades integradas enfrentaram problemas com aceitação do nome do modelo e integração com Ollama. O avanço veio através de testes sistemáticos: enviando imagens para Ollama via chamadas de API, lendo respostas e criando scripts bash e Python para gerenciar o processo.
Detalhes da Implementação
- Ambiente: Windows 11 com Ubuntu WSL
- Backend LLM: Ollama
- Modelo Selecionado: Qwen2.5 VL
- Método de Integração: Chamadas de API para Ollama
- Scripts Criados: Versões Bash e Python
A habilidade personalizada se registra nativamente no OpenClaw e pode ser invocada com comandos como "analise esta imagem" ou "dê uma olhada nesta foto", retornando respostas detalhadas e precisas. O desenvolvedor observa que melhorias futuras com modelos menores Qwen3/3.5VL poderiam aprimorar ainda mais o desempenho.
Apesar dos desafios, incluindo múltiplas reinstalações e frustrações com ferramentas de código aberto incompletas, o desenvolvedor descreve a experiência como criar um "organismo que se corrige e se aprimora sozinho" e continua impressionado com o potencial do OpenClaw para desenvolvimento de habilidades personalizadas.
📖 Read the full source: r/openclaw
👀 See Also

Análise da IA Claude Revela Padrão 'Você Refina para Evitar Terminar' em Conversas com Usuários
Um usuário analisou seis meses de exportações de conversas do Claude, cruzando-as com entradas de diário e dados de sono, descobrindo um padrão comportamental em que o refinamento serve como uma forma de evitar a conclusão. O Claude identificou exemplos específicos, como gerar '20 texturas únicas' para um logotipo ou refinar letras de música por meio de 'múltiplas iterações'.

Construindo um Agente de Fluxo de Caixa Confiável com OpenClaw e Notion: Lições sobre Análise de SMS e Rotulagem de Transações
Um desenvolvedor criou um agente de IA local-first para automatizar o rastreamento do livro-razão de negócios usando alertas por SMS, Atalhos do iPhone, Notion e OpenClaw. O sistema funciona, mas exigiu a solução de três desafios de confiabilidade: lidar com quebras de linha em SMS bancários, usar IA para análise contextual e ajustar prompts para rastrear transações pequenas.

Desenvolvedor Lança Jogo na Steam com Código do Claude: Lições sobre Programação por Vibes vs. Engenharia por Vibes
Um desenvolvedor lançou Codex Mortis, um jogo bullet hell com temática de necromancia no Steam, usando Claude Code para desenvolvimento assistido por IA. O projeto exigiu duas reescritas completas após o protótipo inicial, destacando a lacuna entre protótipo e produção.

Readigo: Aplicativo iOS usa Claude como treinador de leitura com IA para crianças
Um desenvolvedor criou o Readigo, um aplicativo iOS onde crianças leem histórias para um personagem dragão de IA. Claude analisa transcrições de fala para texto para pontuar precisão de leitura, fluência, ritmo e clareza, então gera feedback apropriado para a idade.