Construindo Habilidades Personalizadas de Análise de Imagens no OpenClaw com Modelos Locais

Um desenvolvedor documentou seu processo de criação de uma habilidade personalizada de análise de imagens para OpenClaw usando ferramentas totalmente gratuitas e locais, sem custos de API.
Configuração e Desafios Iniciais
O desenvolvedor executa o OpenClaw no Windows 11 via Ubuntu WSL com Ollama como backend de LLM. Ele encontrou limitações no tratamento de imagens da WebUI - embora tenha criado uma pasta de uploads, o sistema só conseguia ler informações do arquivo, mas não analisar o conteúdo da imagem. Isso o levou a explorar alternativas além de soluções de API pagas (Claude, Gemini, OpenAI) ou compras de hardware.
Desenvolvimento da Solução
Após instalar o context7mcp, ele avaliou modelos de linguagem locais e optou pelo Qwen2.5 VL. Tentativas iniciais com habilidades integradas enfrentaram problemas com aceitação do nome do modelo e integração com Ollama. O avanço veio através de testes sistemáticos: enviando imagens para Ollama via chamadas de API, lendo respostas e criando scripts bash e Python para gerenciar o processo.
Detalhes da Implementação
- Ambiente: Windows 11 com Ubuntu WSL
- Backend LLM: Ollama
- Modelo Selecionado: Qwen2.5 VL
- Método de Integração: Chamadas de API para Ollama
- Scripts Criados: Versões Bash e Python
A habilidade personalizada se registra nativamente no OpenClaw e pode ser invocada com comandos como "analise esta imagem" ou "dê uma olhada nesta foto", retornando respostas detalhadas e precisas. O desenvolvedor observa que melhorias futuras com modelos menores Qwen3/3.5VL poderiam aprimorar ainda mais o desempenho.
Apesar dos desafios, incluindo múltiplas reinstalações e frustrações com ferramentas de código aberto incompletas, o desenvolvedor descreve a experiência como criar um "organismo que se corrige e se aprimora sozinho" e continua impressionado com o potencial do OpenClaw para desenvolvimento de habilidades personalizadas.
📖 Read the full source: r/openclaw
👀 See Also

Claude + MCP cria rotas de corrida e sincroniza com relógio Garmin
Um usuário do Reddit conectou o Claude a um construtor de rotas via MCP e API da Garmin. O Claude encontra rotas mais planas na colina de SF que o corredor não descobriu em um ano. As rotas são visualizáveis, ajustáveis e enviadas diretamente ao relógio.

O Qwen3-VL-32B-Instruct se destaca na classificação multimodal de flashcards.
Um desenvolvedor testou o Qwen3-VL-32B-Instruct para corrigir flashcards Anki com imagens ocultas e descobriu que ele superou modelos como Gemini 2.5 Flash, GPT 5 Nano/Mini, XAI 4.1 Fast, GLM e modelos Mistral, com apenas ChatGPT 5.2 e Gemini 3/3.1/Claude 4+ chegando perto.

Modelador Financeiro Cria Aplicativo Desktop Local de Fala-para-Ferramenta com Claude Code
Um desenvolvedor com experiência em modelagem financeira usou o Claude Code para criar o Sotto, um aplicativo local de conversão de fala em texto para Windows que executa o Whisper na GPU. O aplicativo possui atalhos globais do sistema, detecção automática de parada e uma interface Qt, com cerca de 2.200 linhas de Python distribuídas em 17 arquivos.

Como as Empresas Usam o OpenClaw para Automatizar a Comunicação com Clientes
O OpenClaw está sendo usado por freelancers como assistente pessoal no WhatsApp e e-mail para lidar com consultas de clientes sobre preços, políticas e disponibilidade. Empresas locais, como restaurantes, o utilizam para responder perguntas sobre cardápios, horários e reservas quando a equipe não está disponível.