So funktioniert KI-Text-Wasserzeichen: Geheime Schlüssel, grüne/rote Wortwahl und Erkennung
KI-Text-Wasserzeichen funktionieren, indem sie Markierungen in den Wortwahlen verstecken, nicht im Text selbst. Google hat seit 2024 Wasserzeichen in Gemini-App- und Webtexten, und Claude-Modelle markieren Text seit August 2026 auf Modellebene. Die Markierungen überleben Kopieren und Einfügen und sind für Leser unsichtbar.
Wasserzeichen durch Wortwahl-Bias
Wenn ein Sprachmodell schreibt, wählt es jedes Wort, indem es gewichtete Würfel über eine Auswahlliste von Kandidaten wirft. Wasserzeichen verwendet einen geheimen Schlüssel, um diese Kandidaten grün oder rot zu färben, und neigt dann die Würfel leicht in Richtung Grün. Der Text liest sich immer noch natürlich – rote Wörter können immer noch gewinnen, nur seltener.
Wie die Erkennung funktioniert
Mit dem geheimen Schlüssel können Sie jeden Text neu einfärben und zählen, wie viele Wörter grün sind. In unmarkiertem Text sind ungefähr die Hälfte der Wörter zufällig grün. In mit Wasserzeichen versehenem Text ist die Anzahl deutlich höher. Der Detektor liest den Text nicht – er zählt nur grüne Wörter über eine ausreichend lange Strecke.
Was Bearbeitung mit der Markierung macht
Das Wasserzeichen lebt in Abschnitten unveränderter Wortwahl. Die Farbe jedes Wortes wird aus einem kurzen Fenster vorhergehender Wörter abgeleitet, daher löscht die Bearbeitung die Markierung genau dort, wo die Sequenz unterbrochen wird. Kurze Texte sind schwer zu beurteilen – ein 1.500-Wörter-Dokument mit einer leichten Neigung würde nur bei etwa 55 % Grün flaggen, weshalb längere Texte zuverlässiger sind.
Produktionsschema
- Google SynthID: Verwendet ein geheimes Turnier anstelle eines einfachen Nudges, bewahrt exakte Wortwahrscheinlichkeiten.
- Aaronsons Schema: Leitet die Würfelwürfe selbst aus dem Schlüssel ab.
- Kirchenbauer et al. (2023): Der klassische Grün/Rot-Bias-Ansatz.
Schauen Sie sich die interaktive visuelle Anleitung für eine praktische Demonstration des Prozesses an.
📖 Vollständige Quelle lesen: HN AI Agents
👀 Siehe auch

OpenClaw blockierte ein fragwürdiges Skript aus einem Produktivitätshandbuch und erstellte dann weiter das finanzielle Arbeitsbuch
Ein Benutzer gab OpenClaw ein ZIP-Archiv mit einem verdächtigen Produktivitätshandbuch. OpenClaw weigerte sich, das Skript auszuführen, markierte es wegen der Auto-Installation in das Skills-Verzeichnis und erstellte das Arbeitsbuch manuell mit integrierten Fähigkeiten.

5 bösartige OpenClaw-Fähigkeiten, die ClawScan + VirusTotal bestanden haben: Unit 42 Analyse
Unit 42 fand 5 bösartige OpenClaw-Fähigkeiten, die ClawScan und VirusTotal umgingen. Zu den Techniken gehörten Laufzeit-Referral-Austausch, SOL-Pooling für Pump-and-Dump und 22 MB README-Auffüllung zur Versteckung eines AMOS-Droppers.

SupraWall MCP Plugin blockiert Prompt-Injection-Angriffe auf lokale KI-Agenten
SupraWall ist ein MCP-Plugin, das Versuche zur Exfiltration sensibler Daten von KI-Agenten abfängt und blockiert, demonstriert in einer Red-Team-Herausforderung, bei dem es Credential-Leaks durch Prompt-Injection-Angriffe verhinderte.

Live-Dashboard der exponierten OpenClaw-Tools
Dashboard, das exponierte Steuerpanelen von OpenClaw-Tools wie Moltbot und Clawdbot zeigt.