Текстовые ИИ-водяные знаки всегда будет тривиально удалить

✍️ OpenClawRadar📅 Опубликовано: 14 августа 2026 г.🔗 Source
Текстовые ИИ-водяные знаки всегда будет тривиально удалить
Ad

Статья 50 Закона ЕС об ИИ, вступающая в силу с августа 2026 года, требует от поставщиков LLM маркировать текст, созданный ИИ, водяными знаками. Но текстовые водяные знаки — это совершенно другая задача, чем водяные знаки для изображений, и их удаление остается тривиальным. Вот технический разбор.

Почему водяные знаки в тексте — это сложно

У изображений есть шум, в котором можно спрятать водяные знаки; у текста его нет. Вы не можете изменить предложение, чтобы это осталось незамеченным. Это делает задачу похожей на стеганографию, где открытый текст нельзя произвольно изменять. Наивный подход, например, «каждая пятая буква — „е“», ухудшил бы качество вывода.

Может ли сама модель управлять водяным знаком? Сильные модели могут, но это сжигает токены рассуждения и снижает качество вывода — плохой компромисс.

Почему обнаружение путем повторного прогона модели не работает

Прогон текста через модель для проверки вероятностей токенов не работает: пространство человеческого текста, который читается как вывод ИИ, огромно, ложные срабатывания многочисленны, а обеспечение бесплатной проверки для каждого гражданина ЕС непомерно дорого.

Ad

Как работает SynthID

SynthID от Google — единственный публичный текстовый водяной знак. Он присваивает каждому токену оценку на основе предыдущих токенов — например, сумма ID токенов по модулю 5. При выборке модель выбирает токен с наивысшей оценкой из пяти наиболее вероятных. Обнаружение агрегирует оценку по всему блоку текста; подозрительно высокая агрегированная оценка указывает на генерацию ИИ.

Это похоже на эвристику с длинным тире, но основано на тонких математических закономерностях, которые люди не могут заметить.

Загвоздка

Но любой водяной знак, который сохраняет лексическое разнообразие, можно удалить простым перефразированием, подменой токенов или даже переводом. Пока текст должен читаться естественно, вы можете устранить сигнал с минимальными усилиями. Устойчивость SynthID ограничена — он предназначен для массового обнаружения, а не для противостояния целенаправленному удалению.

Ожидайте, что ЕС будет обеспечивать соблюдение требования, которое технически невыполнимо. Лаборатории будут соблюдать букву закона, но любой, кому это нужно, сможет обойти его за секунды.

📖 Источник: HN AI Agents

Ad

👀 Смотрите также

Вибрационное кодирование против агентной инженерии: размытые границы становятся неудобными
Новости

Вибрационное кодирование против агентной инженерии: размытые границы становятся неудобными

Саймон Уиллисон размышляет о том, как виб-кодинг и агентная инженерия сходятся в его рабочем процессе, отмечая, что теперь он доверяет Claude Code писать продакшн-эндпоинты JSON API без проверки каждой строки — и это кажется странным.

OpenClawRadar
Миньоны Stripe: повышение производительности разработчиков с помощью агентов кодирования «один раз и готово» для end-to-end решений.
Новости

Миньоны Stripe: повышение производительности разработчиков с помощью агентов кодирования «один раз и готово» для end-to-end решений.

Миньоны Stripe — это одноразовые агенты кодирования, ориентированные на автоматизацию сложных задач в экосистеме Stripe для повышения производительности разработчиков.

OpenClawRadar
Почему активирующее управление Anthropic испытывает трудности с генерацией корректного JSON
Новости

Почему активирующее управление Anthropic испытывает трудности с генерацией корректного JSON

Метод активации управления, используемый для безопасности ИИ, не способен генерировать действительный JSON, достигая лишь 24,4% валидности по сравнению с 86,8% у необученной базовой модели.

OpenClawRadar
Модели OpenAI Frontier и Codex теперь доступны на AWS
Новости

Модели OpenAI Frontier и Codex теперь доступны на AWS

Фронтальные модели OpenAI и Codex теперь доступны на AWS, что позволяет предприятиям использовать OpenAI через существующую среду AWS и процессы закупок.

OpenClawRadar