Entwicklung benutzerdefinierter Bildanalysefähigkeiten in OpenClaw mit lokalen Modellen

✍️ OpenClawRadar📅 Veröffentlicht: 13. April 2026🔗 Source
Entwicklung benutzerdefinierter Bildanalysefähigkeiten in OpenClaw mit lokalen Modellen
Ad

Ein Entwickler dokumentierte seinen Prozess zur Erstellung einer benutzerdefinierten Bildanalyse-Fähigkeit für OpenClaw unter ausschließlicher Verwendung kostenloser, lokaler Tools ohne API-Kosten.

Einrichtung und erste Herausforderungen

Der Entwickler betreibt OpenClaw auf Windows 11 über Ubuntu WSL mit Ollama als LLM-Backend. Er stieß auf Einschränkungen bei der Bildverarbeitung der WebUI – obwohl er einen Upload-Ordner erstellte, konnte das System nur Dateiinformationen lesen, aber keine Bildinhalte analysieren. Dies veranlasste ihn, Alternativen zu kostenpflichtigen API-Lösungen (Claude, Gemini, OpenAI) oder Hardware-Käufen zu erkunden.

Entwicklung der Lösung

Nach der Installation von context7mcp bewertete er lokale Sprachmodelle und entschied sich für Qwen2.5 VL. Erste Versuche mit integrierten Fähigkeiten scheiterten an Problemen mit der Modellnamen-Akzeptanz und der Ollama-Integration. Der Durchbruch gelang durch systematisches Testen: Bilder über API-Aufrufe an Ollama senden, Antworten auslesen und sowohl Bash- als auch Python-Skripte zur Prozessabwicklung erstellen.

Ad

Implementierungsdetails

  • Umgebung: Windows 11 mit Ubuntu WSL
  • LLM-Backend: Ollama
  • Ausgewähltes Modell: Qwen2.5 VL
  • Integrationsmethode: API-Aufrufe an Ollama
  • Erstellte Skripte: Bash- und Python-Versionen

Die benutzerdefinierte Fähigkeit registriert sich nativ in OpenClaw und kann mit Befehlen wie „analysiere dieses Bild“ oder „schau dir dieses Foto an“ aufgerufen werden, wobei detaillierte und genaue Antworten zurückgegeben werden. Der Entwickler merkt an, dass zukünftige Verbesserungen mit kleineren Qwen3/3.5VL-Modellen die Leistung weiter steigern könnten.

Trotz Herausforderungen wie mehrfachen Neuinstallationen und Frustrationen mit unvollständigen Open-Source-Tools beschreibt der Entwickler die Erfahrung als Erschaffung eines „selbstkorrigierenden, sich selbst verbessernden Organismus“ und bleibt beeindruckt vom Potenzial von OpenClaw für die Entwicklung benutzerdefinierter Fähigkeiten.

📖 Read the full source: r/openclaw

Ad

👀 Siehe auch

Claude-Code 24/7 als Hintergrundagent ausführen — 2 Wochen Erfahrung
Anwendungsfälle

Claude-Code 24/7 als Hintergrundagent ausführen — 2 Wochen Erfahrung

Ein Entwickler teilt sein Setup für das kontinuierliche Ausführen von Claude Code auf einem VPS, das Code-Reviews, Refactoring und Deployments während seines Schlafs übernimmt.

Qwen3-VL-32B-Instruct übertrifft bei der Bewertung multimodaler Lernkarten.
Anwendungsfälle

Qwen3-VL-32B-Instruct übertrifft bei der Bewertung multimodaler Lernkarten.

Ein Entwickler testete Qwen3-VL-32B-Instruct für die Bewertung von bildverdeckten Anki-Lernkarten und stellte fest, dass es Modelle wie Gemini 2.5 Flash, GPT 5 Nano/Mini, XAI 4.1 Fast, GLM und Mistral-Modelle übertraf, wobei nur ChatGPT 5.2 und Gemini 3/3.1/Claude 4+ annähernd mithalten konnten.

OpenClawRadar
Entwickler vergleicht Claude KI mit einem modernen Taschenrechner für den Coding-Workflow
Anwendungsfälle

Entwickler vergleicht Claude KI mit einem modernen Taschenrechner für den Coding-Workflow

Ein Entwickler mit 18 Monaten Erfahrung an einem serverlosen Angular/AWS SPA/PWA-Projekt berichtet, dass er Claude AI für 90 % der KI-unterstützten Programmierung nutzt und es als 'eine Taschenrechner-Version des 21. Jahrhunderts' beschreibt, die ihn trotz gelegentlicher katastrophaler Ergebnisse 10-mal produktiver macht.

OpenClawRadar
Wie die Verbesserung der eigenen Umgebung durch OpenClaw nachhaltige Arbeitsplätze schafft
Anwendungsfälle

Wie die Verbesserung der eigenen Umgebung durch OpenClaw nachhaltige Arbeitsplätze schafft

Ein erfahrener OpenClaw-Nutzer fand den größten Produktivitätsgewinn darin, dem Agenten zu erlauben, seine eigenen internen Dokumente zu aktualisieren, Betriebsdateien zu bearbeiten, Prompts zu verfeinern, benutzerdefinierte Tools zu erstellen, Skripte zu schreiben und Lektionen zu dokumentieren. Ihre Arbeitsbereichsstruktur umfasst wichtige Markdown-Dateien wie SOUL.md für den Verhaltensstil, AGENTS.md für Betriebskonventionen und MEMORY.md als leichtgewichtigen Index.

OpenClawRadar