OpenClaw erreicht das 33K-Kontextlimit: So beheben Sie es

✍️ OpenClawRadar📅 Veröffentlicht: 18. August 2026🔗 Source
Ad

Ein Entwickler auf r/openclaw berichtet über eine dauerhafte 33K-Token-Kontextbegrenzung in OpenClaw, obwohl ein 262K-Kontextfenster konfiguriert wurde. Das Problem betrifft jedes Modell, das sie lokal laden, einschließlich Qwen3.8-27B, und scheint außerhalb der Kontrolle von OpenClaw zu liegen.

Was passiert

Der Benutzer hat das Kontextfenster korrekt eingestellt:

openclaw config set agents.defaults.contextWindow 262144

OpenClaw erkennt an, dass das Modell 262144 Token unterstützt, aber die Antworten verschlechtern sich nach etwa 33K Token, was häufige /compact- oder /new-Befehle auf Telegram erzwingt. Die Ausführung von ollama ps zeigt, dass das Modell nur einen 33K-Kontext geladen hat, unabhängig von der nativen Kapazität des Modells.

Ursache

Das Problem liegt wahrscheinlich in Ollama, nicht in OpenClaw. Ollama standardmäßig auf eine Kontextgröße (oft 4096 oder 8192), sofern nicht über die Umgebungsvariable OLLAMA_CONTEXT_LENGTH oder den Parameter num_ctx in der Modelfile überschrieben. OpenClaw übergibt die Kontextlänge nicht an Ollama, also lädt Ollama mit einem kleinen Fenster.

Ad

Lösungen

  • OLLAMA_CONTEXT_LENGTH setzen: Bevor Sie Ollama starten, setzen Sie die Umgebungsvariable auf 262144.
    export OLLAMA_CONTEXT_LENGTH=262144
  • Modelfile aktualisieren: Wenn Sie ein benutzerdefiniertes Modell verwenden, fügen Sie den Parameter
    PARAMETER num_ctx 262144
    hinzu und erstellen Sie das Modell neu.
  • Docker prüfen: Wenn Ollama in Docker läuft, stellen Sie sicher, dass die Umgebungsvariable über docker run -e OLLAMA_CONTEXT_LENGTH=262144 übergeben wird.

Zusätzliche Hinweise

Sie können den geladenen Kontext mit ollama ps überprüfen – nach dem Fix sollte die neue Größe angezeigt werden. Erwägen Sie auch, den OpenAI-kompatiblen Endpunkt von Ollama mit num_ctx in der Anfrage zu verwenden, was einige Clients unterstützen.

Weitere Details finden Sie in der Quellendiskussion.

📖 Vollständige Quelle lesen: r/openclaw

Ad

👀 Siehe auch

Fordere KI auf, ihre eigenen Begriffe aus ersten Prinzipien zu definieren für bessere Ergebnisse und nachvollziehbare Begründungen
Tipps

Fordere KI auf, ihre eigenen Begriffe aus ersten Prinzipien zu definieren für bessere Ergebnisse und nachvollziehbare Begründungen

Ein Nutzer auf r/ClaudeAI hat herausgefunden, dass das Hinzufügen einer einzigen Anweisung, undefinierte Begriffe vor der weiteren Bearbeitung auf ihre atomare Bedeutung herunterzubrechen, spezifischere Ausgaben liefert und Debugging durch eine nachvollziehbare Argumentationskette ermöglicht.

OpenClawRadar
Claude Code Token-Verschwendung beheben: Deaktiviere Attribution-Header für bessere Cache-Treffer
Tipps

Claude Code Token-Verschwendung beheben: Deaktiviere Attribution-Header für bessere Cache-Treffer

Das Setzen von CLAUDE_CODE_ATTRIBUTION_HEADER=false in Ihrer Shell-Konfiguration kann die Cache-Trefferquote von Claude Code über Sitzungen hinweg von 48 % auf 99,98 % verbessern und die System-Prompt-Verarbeitungskosten pro Sitzung um das 7-fache reduzieren.

OpenClawRadar
OpenClaw v2026.3.13 fügt eine pro-Agent cacheRetention-Konfiguration hinzu, um OpenAI-Tokenkosten zu senken.
Tipps

OpenClaw v2026.3.13 fügt eine pro-Agent cacheRetention-Konfiguration hinzu, um OpenAI-Tokenkosten zu senken.

OpenClaw v2026.3.13 fügt eine pro-Agent cacheRetention-Konfiguration hinzu, die die 24-stündige Prompt-Cache-Aufbewahrung von OpenAI ermöglicht und die Eingabe-Token-Kosten für Agenten mit Herzschlagzyklen länger als 10 Minuten potenziell um bis zu 90 % senken kann.

OpenClawRadar
Haben Sie in einem Monat 850 Dollar für OpenClaw ausgegeben? Beheben Sie Ihre Architektur, nicht Ihr Modell
Tipps

Haben Sie in einem Monat 850 Dollar für OpenClaw ausgegeben? Beheben Sie Ihre Architektur, nicht Ihr Modell

Ein Entwickler verbrannte in einem Monat 850 $ für ein OpenClaw-Multi-Agenten-Setup – davon 350 $ an einem einzigen Tag. Die Lösung war nicht ein günstigeres Modell, sondern das Systemdesign: striktes Context-Pruning, Sitzungsrücksetzungen, n8n für Nicht-Denksportaufgaben und eine Routing-Ebene für günstige vs. leistungsstarke Modelle.

OpenClawRadar