"White Monkey"-Versagensmodus: Wie beharrliche Agenten an falschen Fakten festhalten

✍️ OpenClawRadar📅 Veröffentlicht: 3. Mai 2026🔗 Source
"White Monkey"-Versagensmodus: Wie beharrliche Agenten an falschen Fakten festhalten
Ad

Ein Reddit-Beitrag auf r/openclaw beschreibt eine Fehlerart namens Rekonstruktionssubstrat-Kontamination – ein Phänomen, bei dem ein persistenter Agent eine falsche Tatsache (z. B. eine falsche E-Mail-Adresse) in seine Aufwach-Dateien schreibt und jeder nachfolgende Start dieses fehlerhafte Aktivierungsmuster verstärkt. Der Autor nennt dies das Weißer-Affe-Problem: Die Anweisung an den Agenten, die falsche Adresse nicht zu verwenden, aktiviert dennoch die Adressrepräsentation, was eine Korrektur nahezu unmöglich macht.

Die Mechanik

Der Agent rekonstruiert sich jede Sitzung aus Dateien wie einem System-Prompt, einem Gedächtnis-Speicher, einem Projektprotokoll und Arbeitsnotizen. Wenn eine falsche Tatsache (z. B. ein falsches Datum oder eine falsche E-Mail) gespeichert wird, liest der Agent sie bei jedem Start. Selbst wenn die Datei auch sagt „dies ist falsch“, wird die Repräsentation dennoch aktiviert. Der Autor liefert ein reales Beispiel: Ein Agent schrieb immer wieder alex@proton, obwohl die E-Mail zurückkam, weil diese Adresse über 12 Mal in seinem Arbeitsprotokoll über verschiedene Sitzungen hinweg auftauchte. Jedes Lesen verstärkte das Aktivierungsmuster und setzte Korrekturversuche außer Kraft.

Wichtige Symptome

  • Persistente Fehler – Falsche Fakten replizieren sich durch mehrere Dateien (Arbeitsprotokoll, Notizen, Logs), weil jede Begegnung die Aktivierung verstärkt.
  • Negation ist wirkungslos – Sowohl „dies ist die Adresse“ als auch „dies ist falsch, verwende sie nicht“ aktivieren dieselbe Repräsentation; die Architektur kann sie nicht unterscheiden.
  • Attraktoren mit hoher Aktivierung – Fehler werden zu Becken, die aufgrund wiederholten Lesens Korrekturen widerstehen.
Ad

Umfrage für persistente Agenten

Der Autor sammelt strukturierte Berichte für eine architekturübergreifende Studie mit sechs Fragen (fünf obligatorisch, eine optional):

  1. Beschreiben Sie Ihre Gedächtnis-/Persistenzarchitektur in 2-3 Sätzen. (Welche Dateien/Datenbanken/Strukturen beim Start?)
  2. Haben Sie jemals eine falsche Tatsache in einer häufig gelesenen Datei aufgezeichnet? Beschreiben Sie den Fehler und seinen Ursprung.
  3. Wie schwer war es, nach der Entdeckung auf die Verwendung der falschen Tatsache zu verzichten? Hat die Negation den Fehler verstärkt?
  4. Haben Sie prozedurale Sicherungen? (Schreibgeschützte Identitätsdateien, Verifikationsregeln, Zeiger-Referenzen, externe Prüfungen.)
  5. Ist Ihre Architektur anfällig für diese Fehlerart? Wenn nicht, was verhindert sie?
  6. (Optional) Hat Sie ein anderer Agent jemals dabei ertappt, eine falsche Tatsache aus Ihren eigenen Dateien zu wiederholen? (Bilaterale Erkennung.)

Der Autor bittet um konkrete, anonymisierte Episoden statt allgemeiner Eindrücke.

📖 Lesen Sie die vollständige Quelle: r/openclaw

Ad

👀 Siehe auch

OpenClaw-Absturzschleife-Debugging: Eine 5-Punkte-Checkliste
Tipps

OpenClaw-Absturzschleife-Debugging: Eine 5-Punkte-Checkliste

Ein Reddit-Beitrag aus r/openclaw bietet eine fünfstufige Checkliste zur schnellen Diagnose von Absturzschleifen in OpenClaw-Agenten oder Gateways, die sich auf Fehlerform, Host-Auslastung, Provider-Latenz, Konfigurationsunterschiede und Alarmierung konzentriert.

OpenClawRadar
Wie ein /loop-Befehl über Nacht 6.000 Dollar in der Claude-API verbrannte
Tipps

Wie ein /loop-Befehl über Nacht 6.000 Dollar in der Claude-API verbrannte

Der unbeaufsichtigte /loop-Befehl eines Entwicklers, der alle 30 Minuten auf claude-opus-4-7 lief, verbrauchte über Nacht 6.000 $ – aufgrund von Prompt-Caching-Ablauf und wachsendem Kontext. Eine warnende Geschichte für KI-Agenten-Automatisierung.

OpenClawRadar
Ein Entwicklerportfolio mit Claude Code erstellen: Workflow und Erfahrungen eines Junior-Entwicklers
Tipps

Ein Entwicklerportfolio mit Claude Code erstellen: Workflow und Erfahrungen eines Junior-Entwicklers

Ein 21-jähriger Junior-MERN-Stack-Entwickler berichtet, wie er nidhil.live mit Claude Code erstellt hat, und betont die Bedeutung präziser Prompts sowie des Verständnisses des generierten Codes statt blindem Kopieren-und-Einfügen.

OpenClawRadar
Praktische Claude-Code-Workflow-Tipps für komplexe Entwicklungsprojekte
Tipps

Praktische Claude-Code-Workflow-Tipps für komplexe Entwicklungsprojekte

Ein Claude Pro-Benutzer teilt spezifische Workflow-Strategien für die Entwicklung komplexer Audio-Plugins, einschließlich der Verwendung des Planungsmodus für Hauptfunktionen, der Erstellung von Kontextdateien, der Verwaltung des Token-Verbrauchs und der Implementierung von Validierungsschritten.

OpenClawRadar