Fix Ollama Cloud Model maxTokens: Obergrenze ist 16K, nicht der Konfigurationswert

PSA für alle, die bei Produktions-Turns unexpected EOF von Agents sehen: Wenn eure openclaw.json Cloud-Modelleinträge wie { "id": "deepseek-v4-pro:cloud", "maxTokens": 500000 } enthält, ist dieses maxTokens nicht real. Ollama Cloud begrenzt die Ausgabe serverseitig auf 16.384 Token, unabhängig von eurer Konfiguration. Wenn ein Agent versucht, etwas darüber hinaus zu senden, beendet der Upstream die Verbindung mitten im Stream, und ihr seht einen Transportfehler von ollama.com:443. OpenClaw behandelt das als Timeout-Failover und versucht euren Fallback – aber wenn der Fallback ebenfalls ein :cloud-Modell ist, gilt die gleiche Grenze.
Was geholfen hat
- maxTokens bei Cloud-Einträgen korrigieren, damit OpenClaw keine Output-Budgets anfordert, die der Dienst nicht einhält:
{ "id": "deepseek-v4-pro:cloud", "maxTokens": 14000 }
{ "id": "kimi-k2.6:cloud", "maxTokens": 14000 }
14k statt 16k – etwas Spielraum, da Modelle manchmal direkt am Limit seltsam reagieren. - Große strukturierte Ausgaben umstrukturieren (lange JSONs, mehrteilige Inhalte), sodass ein Abschnitt pro Turn ausgegeben wird, anstatt alles in einem Stapel zu verarbeiten. Bleibt unter der Grenze und Wiederholungen sind sauberer.
- Schwere Agents direkt an einen Anbieter leiten über einen Pro-Agent-Modell-Override in
agents.list[], statt über:cloud. Agents mit kleinen Ausgaben bleiben auf Ollama Cloud. Einmalige Einrichtung:
openclaw onboard --auth-choice deepseek-api-key
Dann in agents.list die benötigten überschreiben:
"list": [ { "id": "your-agent", "model": "deepseek/deepseek-v4-pro" } ]
Kompromiss: Abrechnung pro Token statt Pauschalgebühr, aber beschränkt auf Agents, die Spielraum benötigen.
Fazit
Wenn eure Agents mitten in langen Ausgaben fehlschlagen und ihr die offensichtlichen Dinge geprüft habt, schaut euch das tatsächliche Output-Limit eures Anbieters an, bevor ihr euch im OpenClaw-Bug-Kaninchenbau verliert. Die Fehlermeldung ist nutzlos und das Konfigurationsfeld verrät nicht, dass es serverseitig überschrieben wird.
📖 Vollständige Quelle lesen: r/openclaw
👀 Siehe auch

Claude-Benutzereinstellungen: Ein Reddit-Nutzer-Setup für präzise, kritische Antworten
Ein Reddit-Nutzer teilt seine Claude User Preferences-Anpassungen, um weniger geschäftliche und direkt kritische Antworten zu erhalten. Tipps zur Vermeidung von Wiederholungen, zum Beginnen mit Schlussfolgerungen und zur Vereinfachung der Zeichensetzung.

Cron-Jobs mit KI-Fallback können unerwartete API-Kosten verursachen, wenn Tools hängen bleiben
Ein Benutzer meldete, dass ein Cron-Job in OpenClaw, der alle 10 Minuten einen E-Mail-Posteingang mit himalaya überprüft, etwa 60 US-Dollar an API-Guthaben verbrauchte, als die IMAP-Verbindung hängen blieb. Dies löste bei jedem Timeout Claude-Agenten aus, obwohl die Anweisung lautete, KI nur für eingehende E-Mails zu nutzen.

Hör auf, Fehler in Claude Code zu kopieren — gib ihm stattdessen Zugriff
Kopieren Sie Fehler nicht manuell in Claude Code. Geben Sie ihm stattdessen API-Schlüssel oder Tools zur Selbstheilung. Der Autor zeigt praktische Muster für Staging-Datenbanken, Headless-Browser und Evaluierungsumgebungen.

CLAUDE.md-Einträge, die das menschliche Tempoverhalten von Opus 4.7 deaktivieren
Drei CLAUDE.md-Direktiven, die Claude 4.7 Opus davon abhalten, Pausen vorzuschlagen, Zeitüberschätzungen zu liefern und Aufgaben in Phasen aufzuteilen – während langer Codierungssitzungen.