Entwicklung benutzerdefinierter Bildanalysefähigkeiten in OpenClaw mit lokalen Modellen

Ein Entwickler dokumentierte seinen Prozess zur Erstellung einer benutzerdefinierten Bildanalyse-Fähigkeit für OpenClaw unter ausschließlicher Verwendung kostenloser, lokaler Tools ohne API-Kosten.
Einrichtung und erste Herausforderungen
Der Entwickler betreibt OpenClaw auf Windows 11 über Ubuntu WSL mit Ollama als LLM-Backend. Er stieß auf Einschränkungen bei der Bildverarbeitung der WebUI – obwohl er einen Upload-Ordner erstellte, konnte das System nur Dateiinformationen lesen, aber keine Bildinhalte analysieren. Dies veranlasste ihn, Alternativen zu kostenpflichtigen API-Lösungen (Claude, Gemini, OpenAI) oder Hardware-Käufen zu erkunden.
Entwicklung der Lösung
Nach der Installation von context7mcp bewertete er lokale Sprachmodelle und entschied sich für Qwen2.5 VL. Erste Versuche mit integrierten Fähigkeiten scheiterten an Problemen mit der Modellnamen-Akzeptanz und der Ollama-Integration. Der Durchbruch gelang durch systematisches Testen: Bilder über API-Aufrufe an Ollama senden, Antworten auslesen und sowohl Bash- als auch Python-Skripte zur Prozessabwicklung erstellen.
Implementierungsdetails
- Umgebung: Windows 11 mit Ubuntu WSL
- LLM-Backend: Ollama
- Ausgewähltes Modell: Qwen2.5 VL
- Integrationsmethode: API-Aufrufe an Ollama
- Erstellte Skripte: Bash- und Python-Versionen
Die benutzerdefinierte Fähigkeit registriert sich nativ in OpenClaw und kann mit Befehlen wie „analysiere dieses Bild“ oder „schau dir dieses Foto an“ aufgerufen werden, wobei detaillierte und genaue Antworten zurückgegeben werden. Der Entwickler merkt an, dass zukünftige Verbesserungen mit kleineren Qwen3/3.5VL-Modellen die Leistung weiter steigern könnten.
Trotz Herausforderungen wie mehrfachen Neuinstallationen und Frustrationen mit unvollständigen Open-Source-Tools beschreibt der Entwickler die Erfahrung als Erschaffung eines „selbstkorrigierenden, sich selbst verbessernden Organismus“ und bleibt beeindruckt vom Potenzial von OpenClaw für die Entwicklung benutzerdefinierter Fähigkeiten.
📖 Read the full source: r/openclaw
👀 Siehe auch

Gleichzeitiges Ausführen von 20 Claude Code Terminal-Fenstern mit ADHS-Merkmalen
Ein Entwickler mit ADHS-Merkmalen betreibt gleichzeitig 20 Claude Code Terminal-Fenster über verschiedene Projekte hinweg und nutzt KI-Agenten, um Kontexte zu halten, die sein Gehirn nicht behalten kann. Der Artikel untersucht sowohl die Produktivitätsvorteile als auch mögliche Nachteile dieses Arbeitsablaufs.

Claude Word-Add-In: Parallele Verarbeitung von Rechtsdokumenten mit über 100 Seiten und mehrblättrigen Tabellenkalkulationen
Nutzer berichten, dass sie über das Claude Word-Add-In parallel mehrere 40–100+ Seiten lange juristische Dokumente und Arbeitsmappen mit 10 Blättern synchronisieren, wobei Agenten Daten abgleichen und die Konsistenz über gesamte Dokumentenpakete hinweg sicherstellen.

Entwicklung selbstheilender KI-Agenten für Produktionssysteme
Ein Team, das einen KI-betriebenen Shop betreibt, baute eine selbstheilende Infrastruktur, in der Agenten Ausfälle erkennen, Ursachen diagnostizieren und autonom ohne menschliches Eingreifen wiederherstellen, insbesondere bei Ausfällen um 3 Uhr morgens.

Verwendung des SkyClaw-Bots von OpenClaw zur persönlichen Ausgabenverfolgung über Discord und Google Sheets
Ein Nutzer beschreibt die Verwendung von SkyClaw, einem Cloud-nativen Bot, der von OpenClaw betrieben wird, um Ausgaben über Discord-Nachrichten und Quittungsbilder zu erfassen, die automatisch einem Google Sheet hinzugefügt werden, ohne Zugriff auf sensible persönliche Konten zu benötigen.