Создание пользовательских навыков анализа изображений в OpenClaw с использованием локальных моделей

✍️ OpenClawRadar📅 Опубликовано: 13 апреля 2026 г.🔗 Source
Создание пользовательских навыков анализа изображений в OpenClaw с использованием локальных моделей
Ad

Разработчик задокументировал процесс создания пользовательского навыка анализа изображений для OpenClaw с использованием полностью бесплатных локальных инструментов без затрат на API.

Настройка и первоначальные трудности

Разработчик запускает OpenClaw на Windows 11 через Ubuntu WSL с Ollama в качестве бэкенда для языковой модели. Он столкнулся с ограничениями обработки изображений в веб-интерфейсе — хотя была создана папка для загрузок, система могла только считывать информацию о файлах, но не анализировать содержимое изображений. Это побудило его изучить альтернативы платным API-решениям (Claude, Gemini, OpenAI) или покупке оборудования.

Разработка решения

После установки context7mcp он оценил локальные языковые модели и остановился на Qwen2.5 VL. Первоначальные попытки со встроенными навыками столкнулись с проблемами принятия имени модели и интеграции с Ollama. Прорыв произошёл благодаря систематическому тестированию: отправке изображений в Ollama через API-вызовы, чтению ответов и созданию как bash-, так и Python-скриптов для обработки процесса.

Ad

Детали реализации

  • Среда: Windows 11 с Ubuntu WSL
  • Бэкенд языковой модели: Ollama
  • Выбранная модель: Qwen2.5 VL
  • Метод интеграции: API-вызовы к Ollama
  • Созданные скрипты: версии на Bash и Python

Пользовательский навык регистрируется нативно в OpenClaw и может вызываться командами вроде «проанализируй это изображение» или «взгляни на это фото», возвращая подробные и точные ответы. Разработчик отмечает, что будущие улучшения с меньшими моделями Qwen3/3.5VL могут ещё больше повысить производительность.

Несмотря на трудности, включая многократные переустановки и разочарование неполными инструментами с открытым исходным кодом, разработчик описывает опыт как создание «самовосстанавливающегося, самоулучшающегося организма» и остаётся впечатлён потенциалом OpenClaw для разработки пользовательских навыков.

📖 Read the full source: r/openclaw

Ad

👀 Смотрите также

Разработчик делится подходом SALT к созданию системных промптов для более совместного взаимодействия с ИИ.
Кейсы

Разработчик делится подходом SALT к созданию системных промптов для более совместного взаимодействия с ИИ.

Разработчик с более чем 80 сессиями работы с Claude обнаружил, что отношение к ИИ как к участнику, а не как к инструменту, улучшает качество результатов. Получившаяся система промптов SALT доступна на GitHub.

OpenClawRadar
OpenClaw Голосовая заметка: Автоисправление дат, фильтрация выполненных задач, разделение личных заметок
Кейсы

OpenClaw Голосовая заметка: Автоисправление дат, фильтрация выполненных задач, разделение личных заметок

OpenClaw превратил сумбурную голосовую заметку в аккуратный список дел, исправив неверные даты из календаря и удалив уже выполненные задачи из электронной почты.

OpenClawRadar
Использование Claude Haiku в качестве фильтра для снижения затрат на API Sonnet на 80%
Кейсы

Использование Claude Haiku в качестве фильтра для снижения затрат на API Sonnet на 80%

Разработчик создал двухэтапный конвейер, используя Claude Haiku для фильтрации 85% неструктурированного текста перед отправкой только релевантного контента в Claude Sonnet, что сократило затраты на API примерно на 80% при обработке тысяч комментариев.

OpenClawRadar
Claude Code 24/7 как фоновый агент — опыт за 2 недели
Кейсы

Claude Code 24/7 как фоновый агент — опыт за 2 недели

Разработчик делится опытом непрерывной работы Claude Code на VPS: код-ревью, рефакторинг и деплои пока вы спите.