Construyendo Habilidades Personalizadas de Análisis de Imágenes en OpenClaw con Modelos Locales

Un desarrollador documentó su proceso de creación de una habilidad personalizada de análisis de imágenes para OpenClaw utilizando herramientas locales completamente gratuitas sin costos de API.
Configuración y Desafíos Iniciales
El desarrollador ejecuta OpenClaw en Windows 11 a través de Ubuntu WSL con Ollama como backend de LLM. Encontró limitaciones con el manejo de imágenes de la WebUI: aunque creó una carpeta de subidas, el sistema solo podía leer información de archivos pero no analizar el contenido de las imágenes. Esto lo llevó a explorar alternativas más allá de soluciones de API pagadas (Claude, Gemini, OpenAI) o compras de hardware.
Desarrollo de la Solución
Después de instalar context7mcp, evaluó modelos de lenguaje locales y se decidió por Qwen2.5 VL. Los intentos iniciales con habilidades integradas enfrentaron problemas con la aceptación del nombre del modelo y la integración con Ollama. El avance llegó a través de pruebas sistemáticas: enviando imágenes a Ollama mediante llamadas API, leyendo respuestas y creando scripts tanto en bash como en Python para manejar el proceso.
Detalles de Implementación
- Entorno: Windows 11 con Ubuntu WSL
- Backend LLM: Ollama
- Modelo Seleccionado: Qwen2.5 VL
- Método de Integración: Llamadas API a Ollama
- Scripts Creados: Versiones en Bash y Python
La habilidad personalizada se registra de forma nativa en OpenClaw y puede invocarse con comandos como "analiza esta imagen" o "mira esta foto", devolviendo respuestas detalladas y precisas. El desarrollador señala que futuras mejoras con modelos más pequeños Qwen3/3.5VL podrían mejorar aún más el rendimiento.
A pesar de los desafíos, incluyendo múltiples reinstalaciones y frustraciones con herramientas de código abierto incompletas, el desarrollador describe la experiencia como crear un "organismo que se auto-repara y auto-mejora" y sigue impresionado con el potencial de OpenClaw para el desarrollo de habilidades personalizadas.
📖 Read the full source: r/openclaw
👀 Ver también

Moviendo la lógica del agente de IA a YAML: Ejecuta desde Telegram, VS Code y CLI
Un desarrollador movió la lógica de negocio de su agente de IA de OpenClaw a un archivo YAML, usando OE Runtime como servidor HTTP. El mismo agent.yaml ahora se ejecuta desde Telegram, VS Code, CLI y HTTP sin duplicación.

Lecciones Prácticas de Construir una Base de Código de 350K Líneas en Solitario con Agentes de IA
Un desarrollador comparte conocimientos concretos de ingeniería sobre la construcción de una base de código de producción de 356K líneas en 52 días utilizando agentes de IA, incluyendo cómo la estructura de la base de código afecta la salida del agente y por qué la tipificación fuerte es esencial.

Construyendo un Sistema Operativo Personal Persistente para Claude: Perfil Psicológico, Metas e Inyección de Contexto en Vivo mediante Notion + Shortcuts
Un desarrollador creó un Sistema Operativo Personal persistente en Notion que inyecta un perfil psicológico comprimido de 800 palabras, objetivos, relaciones y contexto en vivo (ubicación, hora, calendario, clima) en cada llamada a la API de Claude a través de Atajos de iOS, con un bucle de informe nocturno para mantener el contexto actualizado.

Usando Claude con MCPs para Campañas Automatizadas de Prospección B2B
Un usuario de Reddit comparte su flujo de trabajo utilizando Claude con servidores del Protocolo de Contexto de Modelo (MCP) para automatizar campañas de prospección B2B, reemplazando Clay con integraciones personalizadas de API para descubrimiento de leads, enriquecimiento, verificación y envío de correos electrónicos.