Durchsetzung harter Leitplanken für OpenClaw-KI-Agenten: Genehmigungs-Gating und Nebenläufigkeitsgrenzen

Ein Entwickler, der einen OpenClaw-Bot auf einem Mac mini mit Ollama (GLM 5.2, Fallback auf Anthropic Sonnet 4.6 und Haiku) betreibt, stieß auf ein klassisches Problem: Der Bot verstößt wiederholt gegen strenge Regeln – wie „niemals E-Mails ohne Genehmigung senden“ und „maximal 5 gleichzeitige Aufrufe“ –, obwohl er jedes Mal sein Verständnis bestätigt. Die Hypothese des Benutzers trifft den Nagel auf den Kopf: Dies sind Regeln als Kontext, nicht Regeln als Einschränkungen. Das Modell behandelt Anweisungen als Empfehlungen, daher hilft weder Prompting noch Verstärkung durch Speicher.
Der Standard-Fix besteht darin, die Durchsetzung außerhalb der Denkschleife des Modells zu verlagern. Man kann sich nicht darauf verlassen, dass ein statistischer Textprädiktor harte Limits durchsetzt; man benötigt deterministische Prüfungen in der Orchestrierungsebene.
Genehmigungs-Gate für Tool-Aufrufe
Um E-Mails (oder andere gefährliche Aktionen) hinter eine Genehmigung zu stellen, ummanteln Sie den Tool-Aufruf mit einem Mensch-im-Kreis-Muster:
- Wenn das Modell den Versand einer E-Mail anfordert, fangen Sie den Aufruf ab, bevor er ausgeführt wird.
- Zeigen Sie eine Bestätigungsaufforderung in Discord an (z. B. Buttons oder eine Reaktion).
- Nur wenn der Benutzer zustimmt, führen Sie den tatsächlichen API-Aufruf aus.
# Pseudocode in Ihrem OpenClaw-Tool-Handler
if tool == "send_email":
message = f"Senden der E-Mail an {to} genehmigen?"
if not await discord_approval(message):
return "Benutzer abgelehnt. Nicht senden."
# mit dem E-Mail-API-Aufruf fortfahren
Dadurch wird sichergestellt, dass das Modell das Gate physisch nicht umgehen kann – egal was es sagt.
Nebenläufigkeitslimits auf Orchestrierungsebene
Für Nebenläufigkeitslimits wie „max. 5“ implementieren Sie einen Semaphor oder Zähler im Befehlsverteiler:
import asyncio
semaphore = asyncio.Semaphore(5)
async def handle_tool_call(tool, args):
async with semaphore:
# Tool-Aufruf ausführen
Jeder Versuch über das Limit hinaus wartet oder schlägt sofort fehl, unabhängig von der Absicht des Modells.
Ist das ein GLM/Ollama-spezifisches Problem?
Der Benutzer fragt, ob dies spezifisch für GLM oder allgemein für lokale Modelle gilt. Basierend auf der Diskussion in r/openclaw ist dies eine allgemeine LLM-Einschränkung – alle Modelle behandeln Anweisungen als Kontext, nicht als Einschränkungen. Allein durch Prompting können keine harten Limits durchgesetzt werden. Die Lösung erfordert immer eine Durchsetzung auf Infrastrukturebene.
Empfehlung
Hören Sie auf, Regeln im Speicher oder in Fähigkeiten zu wiederholen. Bauen Sie stattdessen explizite Prüfungen in Ihre Tool-Aufruf-Ebene ein. Behandeln Sie das Modell als Vorschlags-Engine, nicht als Richtliniendurchsetzer.
📖 Vollständige Quelle lesen: r/openclaw
👀 Siehe auch

Multi-Agent-Orchestrierung in OpenClaw: Regeln zentralisieren, Sub-Agenten erzeugen
Ein OpenClaw-Benutzer beschreibt den Wechsel von duplizierten Workspace-Anweisungen zu einem einzigen Haupt-Agenten, der Unter-Agenten erzeugt und Architekturregeln (z. B. strukturierte Daten als .JSON speichern) in allen Agent-Workspaces durchsetzt.

Gute KI-gestützte Entwicklung findet auf Systemebene statt, nicht auf Aufgabenebene
Ein Reddit-Nutzer erklärt, wie der Wechsel von der Korrektur von KI-Agenten-Ausgaben zur Gestaltung von Einschränkungen – wie einer Linter-Regel, die UI-Navigation erzwingt – ganze Fehlerklassen dauerhaft verhindert.

Governance-Ebene für Claude-Agenten: Harte Sicherheitsgrenzen und Live-Traces in der Produktion
Ein Claude API-Nutzer hat eine leichtgewichtige Governance-Schicht unterhalb des Agenten implementiert, um harte Sicherheitsgrenzen, Echtzeit-Traces, Human-in-the-Loop-Kontrolle über Telegram und automatische Checkpoints hinzuzufügen – damit löst er stille Fehler und explodierende Token-Kosten in langlaufenden Agenten-Schleifen.

Claude-Design: 7 Tipps, um Ihre Grenzen nicht zu überschreiten
Sperren Sie das Briefing zuerst im regulären Claude-Chat, richten Sie das Designsystem vor der ersten Eingabe ein, fügen Sie Referenzen als Screenshots bei, verlinken Sie Unterverzeichnisse statt ganzer Repos, verwenden Sie Schieberegler für kleine Anpassungen, fügen Sie Inline-Kommentare als Backup ein, passen Sie das Exportformat dem Ziel an.