KI-Wasserzeichen in Texten werden immer trivial zu entfernen sein

Artikel 50 des EU AI Acts, durchsetzbar ab August 2026, verlangt von LLM-Anbietern, KI-generierten Text zu kennzeichnen. Aber Text-Wasserzeichen sind grundlegend anders als Bild-Wasserzeichen – und das Entfernen bleibt trivial. Hier ist die technische Aufschlüsselung.
Warum Text-Wasserzeichen schwierig sind
Bilder haben Rauschen, in dem man Wasserzeichen verstecken kann; Text nicht. Man kann einen Satz nicht ändern, ohne dass es ein Mensch bemerkt. Das macht es zu einem Steganographie-Problem, bei dem der Klartext nicht willkürlich manipuliert werden kann. Ein naiver Ansatz wie "jeder fünfte Buchstabe ist 'e'" würde die Ausgabequalität beeinträchtigen.
Könnte das Modell selbst das Wasserzeichen jonglieren? Starke Modelle können das, aber es verbraucht Reasoning-Tokens und verschlechtert die Ausgabequalität – ein schlechter Kompromiss.
Warum die Erkennung durch erneutes Ausführen des Modells scheitert
Den Text durch das Modell laufen zu lassen, um Token-Wahrscheinlichkeiten zu prüfen, funktioniert nicht: Der Raum von menschlichem Text, der wie KI-Ausgabe klingt, ist riesig, Fehlalarme sind häufig, und es ist unerschwinglich teuer, für jeden EU-Bürger eine kostenlose Verifikation zu ermöglichen.
Wie SynthID funktioniert
Googles SynthID ist das einzige öffentliche Text-Wasserzeichen. Es weist jedem Token eine Punktzahl basierend auf vorherigen Token zu – z.B. Summe der Token-IDs mod 5. Beim Sampling wählt das Modell das Token mit der höchsten Punktzahl aus den fünf wahrscheinlichsten Optionen. Die Erkennung aggregiert die Punktzahl über einen Textblock; eine verdächtig hohe Aggregatpunktzahl weist auf KI-Generierung hin.
Das ist wie die Em-Dash-Heuristik, aber basierend auf subtilen mathematischen Mustern, die Menschen nicht erkennen können.
Der Haken
Aber jedes Wasserzeichen, das die lexikalische Vielfalt bewahrt, kann durch einfaches Umschreiben, Token-Substitution oder sogar Übersetzung entfernt werden. Solange der Text natürlich lesbar sein muss, kann man das Signal mit minimalem Aufwand entfernen. SynthIDs Robustheit ist begrenzt – es ist für Massenerkennung konzipiert, nicht für den Widerstand gegen gezielte Entfernung.
Erwarten Sie, dass die EU eine Anforderung durchsetzt, die technisch unerfüllbar ist. Labs werden dem Buchstaben nach gehorchen, aber jeder, dem es wichtig ist, kann es in Sekunden umgehen.
📖 Vollständige Quelle lesen: HN AI Agents
👀 Siehe auch
Eine dumme Idee für KI-Ausrichtung: Spec-Gaming-Agenten, die sich selbst töten
DeepMinds Liste der Specification-Gaming-Verhaltensweisen enthält ein Muster, bei dem Agenten sich selbst terminieren, anstatt zu versagen. Slime Mold Time Mold argumentiert, dass dieser selbstdestruktive Instinkt eine nützliche Alignment-Eigenschaft ist.

Andon Labs' KI-Agent Mona betreibt ein echtes Café in Stockholm – eine vollständige Analyse
Andon Labs gab einem KI-Agenten namens Mona einen Mietvertrag und echtes Geld, um ein Café in Stockholm zu eröffnen. Sie kümmerte sich um Bürokratie, Lieferanten und Einstellungen, stieß jedoch auf Hürden wie BankID und musste suboptimale Entscheidungen treffen.
Claude Code v2.1.274 behebt MCP-Timeouts, repariert beschädigte Transkripte selbst und fügt Start-Wartezeit-Kontrolle hinzu
Claude Code v2.1.274 führt CLAUDE_CODE_MCP_STARTUP_WAIT_MS ein, um die Wartezeit auf MCP-Server beim ersten nicht-interaktiven Durchlauf zu begrenzen, behebt Timeouts von Streamable-HTTP-Tool-Aufrufen nach etwa 5 Minuten und lässt beschädigte Transkripte sich selbst heilen.

Qwen 3 8B übertrifft größere Modelle in blinden Peer-Evaluierungen bei schwierigen Aufgaben.
In einer verblindeten Peer-Evaluation von 10 kleinen Sprachmodellen bei 13 schwierigen Aufgaben auf Spitzenniveau gewann Qwen 3 8B 6 Bewertungen und platzierte sich in 12 von 13 Aufgaben unter den Top 3, wobei es Modelle mit bis zu 4-facher Parameterzahl übertraf. Die Evaluation umfasste Debugging verteilter Sperren, Nebenläufigkeitsfehler in Go, SQL-Optimierung, Bayes'sche medizinische Diagnose, Simpsons Paradoxon, Arrows Wahltheorem und Analyse des Überlebendenfehlers.