OpenClaw LLM-Timeout-Fix für das Laden kalter Modelle

Problem: Timeouts bei kalten Modellen nach 60 Sekunden
Benutzer berichteten, dass kalt geladene lokale Modelle in OpenClaw konsistent nach etwa 60 Sekunden versagten, obwohl das allgemeine Agent-Timeout viel höher eingestellt war. Dieses Problem trat auch mit Cloud-Modellen über Ollama und manchmal mit OpenAI Codex auf.
Das typische Fehlermuster:
- Modelle funktionieren, wenn sie bereits warm sind
- Kalte Modelle brechen nach ~60 Sekunden ab
- Logs erwähnen Timeout / eingebettetes Failover / Status: 408
- Fallback-Modell übernimmt
Irreführende Konfigurationen
Die Quelle warnt davor, dass mehrere offensichtliche Konfigurationsoptionen NICHT die eigentliche Lösung sind und Entwickler in die falsche Richtung lenken können:
agents.defaults.timeoutSeconds.zshrcExportsLLM_REQUEST_TIMEOUT- Sofortiges Beschuldigen von LM Studio / Ollama
Ursache
Das Problem rührt daher, dass OpenClaw ein separates eingebettetes Runner-LLM-Leerlauf-Timeout für die Zeit vor der Ausgabe des ersten gestreamten Tokens durch das Modell hat.
Quellenspur gefunden in:
src/agents/pi-embedded-runner/run/llm-idle-timeout.ts
Standardwert:
DEFAULT_LLM_IDLE_TIMEOUT_MS = 60_000
Der Konfigurationspfad wird aufgelöst von:
cfg?.agents?.defaults?.llm?.idleTimeoutSeconds
Der tatsächliche Konfigurationsparameter ist also:
agents.defaults.llm.idleTimeoutSeconds
Die Lösung
Nach Tests ist die funktionierende Konfiguration:
{
"agents": {
"defaults": {
"llm": {
"idleTimeoutSeconds": 180
}
}
}
}
Tests zeigten, dass ein kalter Gemma-Aufruf, der zuvor nach etwa 60 Sekunden fehlschlug, diese Schwelle überlebte und schließlich erfolgreich antwortete, ohne sofortiges Failover.
Empfohlene dauerhafte Konfiguration
{
"agents": {
"defaults": {
"timeoutSeconds": 300,
"llm": {
"idleTimeoutSeconds": 300
}
}
}
}
Die Empfehlung von 300 Sekunden berücksichtigt, dass lokale Modelle unvorhersehbar sein können, wobei falsche Failovers problematischer sind als längeres Warten auf wirklich kalte Modelle.
📖 Read the full source: r/openclaw
👀 Siehe auch

Wie Claude-Projektanweisungen eingeschleust werden — und warum deren Änderung während des Gesprächs den Verlauf unterbricht
Projektanweisungen und Benutzereinstellungen werden zu Beginn des Gesprächs in den System-Prompt geladen, aber nicht bei jeder Antwort erneut eingefügt. Werden sie mitten im Gespräch geändert, überschreibt Claude seine Erinnerung an frühere Anweisungen, was zu falschen Erinnerungen führt.

Verbesserung von OpenClaw mit der Macht des lokalen LLM: Einführung von GLM-4.7-Flash
Die Integration von GLM-4.7-Flash mit OpenClaw revolutioniert die Automatisierung durch KI, indem sie eine nahtlose lokale Bereitstellung und ausgeklügelte Code-Ausführung ermöglicht.

Ja Flow/Nein Flow: Eine einfache Technik zur Reduzierung von Kontext-Halluzinationen in KI-Codierungssitzungen
Ein Reddit-Nutzer teilt die Yes-Flow/No-Flow-Technik, um die Konsistenz in KI-Gesprächen zu erhalten, indem er Eingabeaufforderungen umschreibt, anstatt Korrekturen zu stapeln. Dies hilft, Kontextabriss und Halluzinationen während langer Programmier-Sessions zu reduzieren.

MiniMax M2.7 Q8_0 128K auf 2x3090 mit CPU-Offloading – Benchmarks und Konfiguration aus der Praxis
Ein Benutzer führt erfolgreich MiniMax M2.7 mit Q8_0 und 128K Kontext auf zwei RTX 3090 plus DDR4 RAM aus, erreicht ~50 tps Prompt-Verarbeitung und ~10 tps Token-Generierung und teilt seine llama-Server-Flags.