OpenClaw LLM-Timeout-Fix für das Laden kalter Modelle

✍️ OpenClawRadar📅 Veröffentlicht: 15. April 2026🔗 Source
OpenClaw LLM-Timeout-Fix für das Laden kalter Modelle
Ad

Problem: Timeouts bei kalten Modellen nach 60 Sekunden

Benutzer berichteten, dass kalt geladene lokale Modelle in OpenClaw konsistent nach etwa 60 Sekunden versagten, obwohl das allgemeine Agent-Timeout viel höher eingestellt war. Dieses Problem trat auch mit Cloud-Modellen über Ollama und manchmal mit OpenAI Codex auf.

Das typische Fehlermuster:

  • Modelle funktionieren, wenn sie bereits warm sind
  • Kalte Modelle brechen nach ~60 Sekunden ab
  • Logs erwähnen Timeout / eingebettetes Failover / Status: 408
  • Fallback-Modell übernimmt

Irreführende Konfigurationen

Die Quelle warnt davor, dass mehrere offensichtliche Konfigurationsoptionen NICHT die eigentliche Lösung sind und Entwickler in die falsche Richtung lenken können:

  • agents.defaults.timeoutSeconds
  • .zshrc Exports
  • LLM_REQUEST_TIMEOUT
  • Sofortiges Beschuldigen von LM Studio / Ollama

Ursache

Das Problem rührt daher, dass OpenClaw ein separates eingebettetes Runner-LLM-Leerlauf-Timeout für die Zeit vor der Ausgabe des ersten gestreamten Tokens durch das Modell hat.

Quellenspur gefunden in:

src/agents/pi-embedded-runner/run/llm-idle-timeout.ts

Standardwert:

DEFAULT_LLM_IDLE_TIMEOUT_MS = 60_000

Der Konfigurationspfad wird aufgelöst von:

cfg?.agents?.defaults?.llm?.idleTimeoutSeconds

Der tatsächliche Konfigurationsparameter ist also:

agents.defaults.llm.idleTimeoutSeconds
Ad

Die Lösung

Nach Tests ist die funktionierende Konfiguration:

{
  "agents": {
    "defaults": {
      "llm": {
        "idleTimeoutSeconds": 180
      }
    }
  }
}

Tests zeigten, dass ein kalter Gemma-Aufruf, der zuvor nach etwa 60 Sekunden fehlschlug, diese Schwelle überlebte und schließlich erfolgreich antwortete, ohne sofortiges Failover.

Empfohlene dauerhafte Konfiguration

{
  "agents": {
    "defaults": {
      "timeoutSeconds": 300,
      "llm": {
        "idleTimeoutSeconds": 300
      }
    }
  }
}

Die Empfehlung von 300 Sekunden berücksichtigt, dass lokale Modelle unvorhersehbar sein können, wobei falsche Failovers problematischer sind als längeres Warten auf wirklich kalte Modelle.

📖 Read the full source: r/openclaw

Ad

👀 Siehe auch

Wie Claude-Projektanweisungen eingeschleust werden — und warum deren Änderung während des Gesprächs den Verlauf unterbricht
Tipps

Wie Claude-Projektanweisungen eingeschleust werden — und warum deren Änderung während des Gesprächs den Verlauf unterbricht

Projektanweisungen und Benutzereinstellungen werden zu Beginn des Gesprächs in den System-Prompt geladen, aber nicht bei jeder Antwort erneut eingefügt. Werden sie mitten im Gespräch geändert, überschreibt Claude seine Erinnerung an frühere Anweisungen, was zu falschen Erinnerungen führt.

OpenClawRadar
Verbesserung von OpenClaw mit der Macht des lokalen LLM: Einführung von GLM-4.7-Flash
Tipps

Verbesserung von OpenClaw mit der Macht des lokalen LLM: Einführung von GLM-4.7-Flash

Die Integration von GLM-4.7-Flash mit OpenClaw revolutioniert die Automatisierung durch KI, indem sie eine nahtlose lokale Bereitstellung und ausgeklügelte Code-Ausführung ermöglicht.

OpenClawRadar
Ja Flow/Nein Flow: Eine einfache Technik zur Reduzierung von Kontext-Halluzinationen in KI-Codierungssitzungen
Tipps

Ja Flow/Nein Flow: Eine einfache Technik zur Reduzierung von Kontext-Halluzinationen in KI-Codierungssitzungen

Ein Reddit-Nutzer teilt die Yes-Flow/No-Flow-Technik, um die Konsistenz in KI-Gesprächen zu erhalten, indem er Eingabeaufforderungen umschreibt, anstatt Korrekturen zu stapeln. Dies hilft, Kontextabriss und Halluzinationen während langer Programmier-Sessions zu reduzieren.

OpenClawRadar
MiniMax M2.7 Q8_0 128K auf 2x3090 mit CPU-Offloading – Benchmarks und Konfiguration aus der Praxis
Tipps

MiniMax M2.7 Q8_0 128K auf 2x3090 mit CPU-Offloading – Benchmarks und Konfiguration aus der Praxis

Ein Benutzer führt erfolgreich MiniMax M2.7 mit Q8_0 und 128K Kontext auf zwei RTX 3090 plus DDR4 RAM aus, erreicht ~50 tps Prompt-Verarbeitung und ~10 tps Token-Generierung und teilt seine llama-Server-Flags.

OpenClawRadar