OpenClaw + Ollama ローカルモデルのタイムアウトをデバッグ:サイレント障害に対する5つの修正方法

✍️ OpenClawRadar📅 公開日: April 15, 2026🔗 Source
OpenClaw + Ollama ローカルモデルのタイムアウトをデバッグ:サイレント障害に対する5つの修正方法
Ad

問題:ローカルOllamaモデルでのOpenClawエージェントの暗黙的な失敗

M4 Max Mac StudioでOpenClaw 2026.4.2、Ollama 0.20.2、Gemma 4 26B-A4B Q8_0モデルをデバッグしていた開発者は、ollama runではモデルが即座に動作するにもかかわらず、/newコマンド後にエージェントが応答しないことを発見しました。ログにはエラーが表示されず、エージェントにはタイピングインジケーターも表示されませんでした。

根本原因と修正

  • 根本原因 #1:スラッグジェネレーターのブロッキング:OpenClawのsession-memoryフックは、ハードコードされた15秒のタイムアウトでOllamaにリクエストを送信するスラッグジェネレーターを実行します。モデルがOpenClawのシステムプロンプトを時間内に処理できない場合、OpenClawはリクエストを放棄しますが、Ollamaは処理を続行し、後続のエージェントリクエストをブロックします。
    修正:openclaw hooks disable session-memory
  • 根本原因 #2:大きなシステムプロンプト:OpenClawはリクエストごとに約38,500文字のシステムプロンプト(アイデンティティ、ツール、ブートストラップファイル)を注入します。ローカルモデルでは、プレフィルフェーズに40〜60秒を要します。
    修正:設定に追加してブートストラップ注入をスキップし、文字数を制限:
    { "agents": { "defaults": { "skipBootstrap": true, "bootstrapTotalMaxChars": 500 } } }
    これにより、プロンプトは約19K文字に削減されます。
  • 根本原因 #3:隠れたアイドルタイムアウト:OpenClawにはDEFAULT_LLM_IDLE_TIMEOUT_MSが60秒あります。モデルがこの時間内に最初のトークンを生成しない場合、接続を切断し、暗黙的にフォールバックモデル(例:Claude Sonnet)に切り替えます。
    修正:未公開の設定キーを設定:
    { "agents": { "defaults": { "llm": { "idleTimeoutSeconds": 300 } } } }
  • 根本原因 #4:Ollamaのシリアル処理:Ollamaはリクエストを逐次処理するため、放棄されたスラッグジェネレーターリクエストが処理スロットを保持する可能性があります。
    修正:Ollama plist/サービス設定に追加:OLLAMA_NUM_PARALLEL=4
  • 根本原因 #5:思考モードの遅延:Gemma 4はデフォルトで思考/推論フェーズがあり、最初のトークンの前に20〜30秒を追加します。
    修正:設定で無効化:
    { "agents": { "defaults": { "thinkingDefault": "off" } } }
Ad

完全な動作設定

開発者は、動作するセットアップの完全な設定を提供しました:

{ "agents": { "defaults": { "model": { "primary": "ollama/gemma4:26b-a4b-it-q8_0", "fallbacks": ["anthropic/claude-sonnet-4-6"] }, "thinkingDefault": "off", "timeoutSeconds": 600, "skipBootstrap": true, "bootstrapTotalMaxChars": 500, "llm": { "idleTimeoutSeconds": 300 } } } }

さらに、リクエスト間のアンロードを防ぐためにモデルをメモリに固定:

curl http://localhost:11434/api/generate -d '{"model":"gemma4:26b-a4b-it-q8_0","keep_alive":-1,"options":{"num_ctx":16384}}'

結果とトレードオフ

修正を適用した後、/new後の最初のメッセージはシステムプロンプトのプレフィルにより約60秒かかりますが、これはローカルモデルでは避けられないと説明されています。後続のメッセージは、OllamaがKV状態をキャッシュするため高速です。このセットアップは31GB VRAM、100% GPU、16Kコンテキストウィンドウを使用し、完全にローカルで動作し、APIコストはゼロです。

初期遅延は、完全なローカル操作、プライバシー、コストゼロのためのトレードオフです。開発者は、これらの要素を優先する場合は価値があると指摘しています。

📖 完全なソースを読む: r/LocalLLaMA

Ad

👀 See Also

ソロスタジオ向けClaudeスキル9選:実務で使える命令の積み重ね方
Guides

ソロスタジオ向けClaudeスキル9選:実務で使える命令の積み重ね方

ある個人開発者が、動画制作、分析、SEO、財務モデリングなどのために9つのClaudeスキルを構築しました。重要なポイント:スキルはドキュメントではなく、経験豊富な同僚への指示として書くこと。スキルはタスクが重なると自動的にトリガーされ、スタックします。

OpenClawRadar
オープンクローエージェントのコヒーレンスのための定期的瞑想システムの実装
Guides

オープンクローエージェントのコヒーレンスのための定期的瞑想システムの実装

開発者が、meditations.md、reflections/*.md、アイデンティティファイルを含む特定のファイルチェーンを使用した、OpenClawエージェント向けの構造化された内省システムを共有しています。毎晩のループでは、これらのファイルをレビューして追記し、持続的な行動変化への洞察を促進します。

OpenClawRadar
タイトル:バグハント:GKEにおけるWireGuardクラッシュとMTU不一致
Guides

タイトル:バグハント:GKEにおけるWireGuardクラッシュとMTU不一致

Lovableのエンジニアたちは、ユーザーエラーを調査したところ、GoogleのWireGuard統合における同時マップアクセスのパニックによるanetdのクラッシュを特定し、その後に暗号化を無効にした後の二次的なMTU不一致を発見しました。

OpenClawRadar
構造化されたAIワークフロー:段階ベースのコマンドによる手戻りの削減
Guides

構造化されたAIワークフロー:段階ベースのコマンドによる手戻りの削減

ある開発者が、AIコーディングにおける一般的な問題(コンテキストの喪失、標準の破綻、計画と実行の混同)に対処するために、/pwf-brainstormや/pwf-work-planなどの特定のコマンドを使用したプログラム可能なワークフローを共有しています。このアプローチには、必須のドキュメント更新とマルチルートプロジェクト構造が含まれています。

OpenClawRadar