OpenClawでローカルモデルを使用したカスタム画像分析スキルの構築

ある開発者が、APIコストを一切かけずに完全に無料のローカルツールのみを使用して、OpenClaw用のカスタム画像分析スキルを作成するプロセスを記録しました。
セットアップと初期の課題
開発者は、LLMバックエンドとしてOllamaを使用し、Ubuntu WSLを介してWindows 11上でOpenClawを実行しています。WebUIの画像処理に制限があることに直面しました。アップロードフォルダを作成したものの、システムはファイル情報を読み取るだけで、画像の内容を分析することができませんでした。このため、有料APIソリューション(Claude、Gemini、OpenAI)やハードウェア購入以外の代替手段を探求することになりました。
ソリューションの開発
context7mcpをインストールした後、ローカル言語モデルを評価し、Qwen2.5 VLに決定しました。組み込みスキルでの初期の試みでは、モデル名の受け入れやOllamaとの統合に問題が発生しました。突破口は、体系的なテストを通じてもたらされました。API呼び出しで画像をOllamaに送信し、応答を読み取り、プロセスを処理するためのbashスクリプトとPythonスクリプトの両方を作成しました。
実装の詳細
- 環境:Ubuntu WSLを搭載したWindows 11
- LLMバックエンド:Ollama
- 選択モデル:Qwen2.5 VL
- 統合方法:OllamaへのAPI呼び出し
- 作成スクリプト:bash版とPython版
カスタムスキルはOpenClawにネイティブで登録され、「この画像を分析して」や「この写真を見て」などのコマンドで呼び出すことができ、詳細で正確な応答を返します。開発者は、より小型のQwen3/3.5VLモデルを使用した将来の改善により、パフォーマンスがさらに向上する可能性があると指摘しています。
複数回の再インストールや不完全なオープンソースツールへの不満を含む課題にもかかわらず、開発者はこの経験を「自己修復・自己改善する有機体」の創造と表現し、カスタムスキル開発におけるOpenClawの可能性に感銘を受け続けています。
📖 Read the full source: r/openclaw
👀 See Also
Contabo VPS上のローカルLLMでOpenClawを実行する:Qwen 3:4Bがハングする問題と回避策
6コア/12GBのContabo VPSでOpenClawをローカルLLMと共に実行したユーザーの体験談。Qwen 3:4Bはコンパクションエラー後にハングするが、小さなOllamaモデルは動作する。GPUがないためモデルサイズに制限がある。

音声メモとSCQA構造を活用したコンテンツパイプライン(OpenClaw使用)
ある開発者が、SaySoを使った音声入力とSCQA構造(状況、複雑化、質問、回答)を用いたコンテンツ作成ワークフローを共有し、OpenClawでより焦点を絞ったコンテンツを生成する方法を紹介。最初の記事が数日で200以上の追加を獲得したと報告しています。

Kiro CLIによるAnthropicのGenerator-Evaluator Harnessの複製:12回のイテレーションで構築されたウェブサイト
ある開発者が、Kiro CLIを使用してAnthropicのマルチエージェント「Generator-Evaluator」ハーネスを再現し、12回の対抗的イテレーションを実行して、手動でコードを一切書かずにマーケティングサイトを構築しました。主なポイントは、ゼロ共有コンテキスト、Playwrightベースの視覚的評価、および一般的なAIデザインパターンへのペナルティです。

不動産開発会社のAIエージェントが、コンテキストと音声スタイルを備えた初の電話通話を実現
不動産レポートのマルチエージェント運用を実施している開発者が、AIエージェントが初めて電話を成功させたと報告しています。取引や見込み客に関する完全なコンテキストを使用し、開発者の特定のセールスアプローチと声のスタイルを模倣しました。