So funktioniert KI-Text-Wasserzeichen: Geheime Schlüssel, grüne/rote Wortwahl und Erkennung
KI-Text-Wasserzeichen funktionieren, indem sie Markierungen in den Wortwahlen verstecken, nicht im Text selbst. Google hat seit 2024 Wasserzeichen in Gemini-App- und Webtexten, und Claude-Modelle markieren Text seit August 2026 auf Modellebene. Die Markierungen überleben Kopieren und Einfügen und sind für Leser unsichtbar.
Wasserzeichen durch Wortwahl-Bias
Wenn ein Sprachmodell schreibt, wählt es jedes Wort, indem es gewichtete Würfel über eine Auswahlliste von Kandidaten wirft. Wasserzeichen verwendet einen geheimen Schlüssel, um diese Kandidaten grün oder rot zu färben, und neigt dann die Würfel leicht in Richtung Grün. Der Text liest sich immer noch natürlich – rote Wörter können immer noch gewinnen, nur seltener.
Wie die Erkennung funktioniert
Mit dem geheimen Schlüssel können Sie jeden Text neu einfärben und zählen, wie viele Wörter grün sind. In unmarkiertem Text sind ungefähr die Hälfte der Wörter zufällig grün. In mit Wasserzeichen versehenem Text ist die Anzahl deutlich höher. Der Detektor liest den Text nicht – er zählt nur grüne Wörter über eine ausreichend lange Strecke.
Was Bearbeitung mit der Markierung macht
Das Wasserzeichen lebt in Abschnitten unveränderter Wortwahl. Die Farbe jedes Wortes wird aus einem kurzen Fenster vorhergehender Wörter abgeleitet, daher löscht die Bearbeitung die Markierung genau dort, wo die Sequenz unterbrochen wird. Kurze Texte sind schwer zu beurteilen – ein 1.500-Wörter-Dokument mit einer leichten Neigung würde nur bei etwa 55 % Grün flaggen, weshalb längere Texte zuverlässiger sind.
Produktionsschema
- Google SynthID: Verwendet ein geheimes Turnier anstelle eines einfachen Nudges, bewahrt exakte Wortwahrscheinlichkeiten.
- Aaronsons Schema: Leitet die Würfelwürfe selbst aus dem Schlüssel ab.
- Kirchenbauer et al. (2023): Der klassische Grün/Rot-Bias-Ansatz.
Schauen Sie sich die interaktive visuelle Anleitung für eine praktische Demonstration des Prozesses an.
📖 Vollständige Quelle lesen: HN AI Agents
👀 Siehe auch

Fünf wesentliche Sicherheitsschritte für OpenClaw-Instanzen
Ein Reddit-Beitrag warnt davor, dass das Ausführen von OpenClaw mit Standardeinstellungen erhebliche Sicherheitsrisiken birgt, und nennt fünf sofortige Maßnahmen: Standardport ändern, Tailscale für privaten Zugriff nutzen, eine Firewall konfigurieren, separate Konten für den Agenten erstellen und Skills vor der Installation überprüfen.

Open-Source RAG-Angriffs- und Verteidigungslabor für lokale ChromaDB + LM Studio Stacks
Ein Open-Source-Labor misst die Wirksamkeit von RAG-Wissensbasisvergiftungen auf Standard-Lokalsetups mit ChromaDB und LM Studio und zeigt eine Erfolgsquote von 95 % auf ungeschützten Systemen sowie die Bewertung praktischer Abwehrmaßnahmen.
美国防部网络局局长:中国AI企业正对美国企业发起恶意“蒸馏”行动
Ein neuer DoD-CSA-Bericht enthüllt, dass chinesische KI-Unternehmen bösartige Destillationskampagnen durchführen, um US-KI-Modelle zu stehlen, die auf kommerzielle KI-Produkte und Open-Source-Frameworks abzielen.
