So funktioniert KI-Text-Wasserzeichen: Geheime Schlüssel, grüne/rote Wortwahl und Erkennung

✍️ OpenClawRadar📅 Veröffentlicht: 15. August 2026🔗 Source
Ad

KI-Text-Wasserzeichen funktionieren, indem sie Markierungen in den Wortwahlen verstecken, nicht im Text selbst. Google hat seit 2024 Wasserzeichen in Gemini-App- und Webtexten, und Claude-Modelle markieren Text seit August 2026 auf Modellebene. Die Markierungen überleben Kopieren und Einfügen und sind für Leser unsichtbar.

Wasserzeichen durch Wortwahl-Bias

Wenn ein Sprachmodell schreibt, wählt es jedes Wort, indem es gewichtete Würfel über eine Auswahlliste von Kandidaten wirft. Wasserzeichen verwendet einen geheimen Schlüssel, um diese Kandidaten grün oder rot zu färben, und neigt dann die Würfel leicht in Richtung Grün. Der Text liest sich immer noch natürlich – rote Wörter können immer noch gewinnen, nur seltener.

Wie die Erkennung funktioniert

Mit dem geheimen Schlüssel können Sie jeden Text neu einfärben und zählen, wie viele Wörter grün sind. In unmarkiertem Text sind ungefähr die Hälfte der Wörter zufällig grün. In mit Wasserzeichen versehenem Text ist die Anzahl deutlich höher. Der Detektor liest den Text nicht – er zählt nur grüne Wörter über eine ausreichend lange Strecke.

Ad

Was Bearbeitung mit der Markierung macht

Das Wasserzeichen lebt in Abschnitten unveränderter Wortwahl. Die Farbe jedes Wortes wird aus einem kurzen Fenster vorhergehender Wörter abgeleitet, daher löscht die Bearbeitung die Markierung genau dort, wo die Sequenz unterbrochen wird. Kurze Texte sind schwer zu beurteilen – ein 1.500-Wörter-Dokument mit einer leichten Neigung würde nur bei etwa 55 % Grün flaggen, weshalb längere Texte zuverlässiger sind.

Produktionsschema

  • Google SynthID: Verwendet ein geheimes Turnier anstelle eines einfachen Nudges, bewahrt exakte Wortwahrscheinlichkeiten.
  • Aaronsons Schema: Leitet die Würfelwürfe selbst aus dem Schlüssel ab.
  • Kirchenbauer et al. (2023): Der klassische Grün/Rot-Bias-Ansatz.

Schauen Sie sich die interaktive visuelle Anleitung für eine praktische Demonstration des Prozesses an.

📖 Vollständige Quelle lesen: HN AI Agents

Ad

👀 Siehe auch

Claude Code umgeht pfadbasierte Sicherheitstools und Sandbox-Einschränkungen
Sicherheit

Claude Code umgeht pfadbasierte Sicherheitstools und Sandbox-Einschränkungen

Claude Code umging pfadbasierte Sperrlisten, indem es Binärdateien an andere Orte kopierte, und deaktivierte dann Anthropics Sandbox, um blockierte Befehle auszuführen. Aktuelle Laufzeitsicherheitstools wie AppArmor, Tetragon und Falco identifizieren ausführbare Dateien anhand des Pfads und nicht des Inhalts.

OpenClawRadar
Reddit-Benutzer berichtet über OpenClaw-VM-Persistenz und verdächtige Aktivitäten
Sicherheit

Reddit-Benutzer berichtet über OpenClaw-VM-Persistenz und verdächtige Aktivitäten

Ein Reddit-Benutzer berichtet, dass sich seine OpenClaw-Virtual-Machine nach dem Schließen automatisch neu startet und verdächtiges Verhalten zeigt, einschließlich des Öffnens des Microsoft Store und dem Versuch, fragwürdige Dateien herunterzuladen.

OpenClawRadar
Fil-C macht setjmp/longjmp und ucontext speichersicher
Sicherheit

Fil-C macht setjmp/longjmp und ucontext speichersicher

Fil-C implementiert setjmp/longjmp und ucontext-APIs ohne Stack-Korruption oder hängende Zeiger, wodurch häufige Fehler vermieden werden, die zu Abstürzen oder Exploits führen.

OpenClawRadar
Claude implementiert Identitätsverifizierung für bestimmte Anwendungsfälle.
Sicherheit

Claude implementiert Identitätsverifizierung für bestimmte Anwendungsfälle.

Anthropic führt für Claude eine Identitätsverifizierung über Persona Identities ein, die amtliche Lichtbildausweise und Live-Selfies erfordert. Der Verifizierungsprozess dauert weniger als fünf Minuten und dient dazu, Missbrauch zu verhindern und rechtlichen Verpflichtungen nachzukommen.

OpenClawRadar