OpenClaw erreicht das 33K-Kontextlimit: So beheben Sie es
Ein Entwickler auf r/openclaw berichtet über eine dauerhafte 33K-Token-Kontextbegrenzung in OpenClaw, obwohl ein 262K-Kontextfenster konfiguriert wurde. Das Problem betrifft jedes Modell, das sie lokal laden, einschließlich Qwen3.8-27B, und scheint außerhalb der Kontrolle von OpenClaw zu liegen.
Was passiert
Der Benutzer hat das Kontextfenster korrekt eingestellt:
openclaw config set agents.defaults.contextWindow 262144OpenClaw erkennt an, dass das Modell 262144 Token unterstützt, aber die Antworten verschlechtern sich nach etwa 33K Token, was häufige /compact- oder /new-Befehle auf Telegram erzwingt. Die Ausführung von ollama ps zeigt, dass das Modell nur einen 33K-Kontext geladen hat, unabhängig von der nativen Kapazität des Modells.
Ursache
Das Problem liegt wahrscheinlich in Ollama, nicht in OpenClaw. Ollama standardmäßig auf eine Kontextgröße (oft 4096 oder 8192), sofern nicht über die Umgebungsvariable OLLAMA_CONTEXT_LENGTH oder den Parameter num_ctx in der Modelfile überschrieben. OpenClaw übergibt die Kontextlänge nicht an Ollama, also lädt Ollama mit einem kleinen Fenster.
Lösungen
- OLLAMA_CONTEXT_LENGTH setzen: Bevor Sie Ollama starten, setzen Sie die Umgebungsvariable auf 262144.
export OLLAMA_CONTEXT_LENGTH=262144 - Modelfile aktualisieren: Wenn Sie ein benutzerdefiniertes Modell verwenden, fügen Sie den Parameter
hinzu und erstellen Sie das Modell neu.PARAMETER num_ctx 262144 - Docker prüfen: Wenn Ollama in Docker läuft, stellen Sie sicher, dass die Umgebungsvariable über
docker run -e OLLAMA_CONTEXT_LENGTH=262144übergeben wird.
Zusätzliche Hinweise
Sie können den geladenen Kontext mit ollama ps überprüfen – nach dem Fix sollte die neue Größe angezeigt werden. Erwägen Sie auch, den OpenAI-kompatiblen Endpunkt von Ollama mit num_ctx in der Anfrage zu verwenden, was einige Clients unterstützen.
Weitere Details finden Sie in der Quellendiskussion.
📖 Vollständige Quelle lesen: r/openclaw
👀 Siehe auch

Fordere KI auf, ihre eigenen Begriffe aus ersten Prinzipien zu definieren für bessere Ergebnisse und nachvollziehbare Begründungen
Ein Nutzer auf r/ClaudeAI hat herausgefunden, dass das Hinzufügen einer einzigen Anweisung, undefinierte Begriffe vor der weiteren Bearbeitung auf ihre atomare Bedeutung herunterzubrechen, spezifischere Ausgaben liefert und Debugging durch eine nachvollziehbare Argumentationskette ermöglicht.

Claude Code Token-Verschwendung beheben: Deaktiviere Attribution-Header für bessere Cache-Treffer
Das Setzen von CLAUDE_CODE_ATTRIBUTION_HEADER=false in Ihrer Shell-Konfiguration kann die Cache-Trefferquote von Claude Code über Sitzungen hinweg von 48 % auf 99,98 % verbessern und die System-Prompt-Verarbeitungskosten pro Sitzung um das 7-fache reduzieren.

OpenClaw v2026.3.13 fügt eine pro-Agent cacheRetention-Konfiguration hinzu, um OpenAI-Tokenkosten zu senken.
OpenClaw v2026.3.13 fügt eine pro-Agent cacheRetention-Konfiguration hinzu, die die 24-stündige Prompt-Cache-Aufbewahrung von OpenAI ermöglicht und die Eingabe-Token-Kosten für Agenten mit Herzschlagzyklen länger als 10 Minuten potenziell um bis zu 90 % senken kann.

Haben Sie in einem Monat 850 Dollar für OpenClaw ausgegeben? Beheben Sie Ihre Architektur, nicht Ihr Modell
Ein Entwickler verbrannte in einem Monat 850 $ für ein OpenClaw-Multi-Agenten-Setup – davon 350 $ an einem einzigen Tag. Die Lösung war nicht ein günstigeres Modell, sondern das Systemdesign: striktes Context-Pruning, Sitzungsrücksetzungen, n8n für Nicht-Denksportaufgaben und eine Routing-Ebene für günstige vs. leistungsstarke Modelle.