Как работает водяные знаки ИИ в тексте: секретные ключи, выбор «зеленых»/«красных» слов и обнаружение
Водяные знаки в текстах ИИ работают, скрывая метки в выборе между словами, а не в самом тексте. Google помечает водяными знаками текст в приложении Gemini и в вебе с 2024 года, а модели Claude помечают текст на уровне модели с августа 2026 года. Метки переживают копирование и вставку и невидимы для читателей.
Водяной знак через смещение выбора слов
Когда языковая модель пишет, она выбирает каждое слово, бросая взвешенные кости по списку кандидатов. Водяной знак использует секретный ключ, чтобы окрасить эти кандидаты в зеленый или красный цвет, а затем слегка подталкивает кости в сторону зеленого. Текст по-прежнему читается естественно — красные слова могут побеждать, просто реже.
Как работает детекция
С помощью секретного ключа вы можете перекрасить любой текст и подсчитать, сколько слов зеленые. В немаркированном тексте примерно половина слов будет зеленой по случайности. В тексте с водяным знаком количество значительно выше. Детектор не читает текст — он просто подсчитывает зеленые слова на достаточно длинном отрезке.
Что делает редактирование с меткой
Водяной знак живет в последовательностях нетронутых слов. Цвет каждого слова выводится из короткого окна предшествующих слов, поэтому редактирование стирает метку именно там, где разрывается последовательность. Короткие тексты трудно определить — документ из 1500 слов с умеренным смещением покажет только около 55% зеленых, поэтому более длинные тексты надежнее.
Схемы производства
- Google SynthID: Использует секретный турнир вместо простого смещения, сохраняя точные вероятности слов.
- Схема Ааронсона: Сами броски костей выводятся из ключа.
- Кирхенбауэр и др. (2023): Классический подход с зеленым/красным смещением.
Ознакомьтесь с интерактивным визуальным руководством для практической демонстрации процесса.
📖 Полный источник: HN AI Agents
👀 Смотрите также

Хакербот-Коготь: ИИ-бот, использующий уязвимости рабочих процессов GitHub Actions
ИИ-бот под названием hackerbot-claw провёл недельную автоматизированную кампанию атак на CI/CD-конвейеры, добившись удалённого выполнения кода как минимум в 4 из 6 целей, включая проекты Microsoft, DataDog и CNCF. Бот использовал 5 различных методов эксплуатации и похитил токен GitHub с правами на запись.
美国国防部网络空间安全顾问:中国企业针对美国企业发动恶意蒸馏攻击
Новый отчет DoD CSA раскрывает, что китайские ИИ-компании проводят вредоносные кампании дистилляции, чтобы украсть американские модели ИИ, нацеливаясь на коммерческие продукты и фреймворки с открытым исходным кодом.

Защита бюджета на AI: почему стоит использовать предоплаченную карту с OpenClaw

Практические меры безопасности для агентов OpenClaw
В посте на Reddit описаны конкретные меры безопасности для пользователей OpenClaw, включая запланированные команды для обновлений и аудитов, управление доступом агентов в общих каналах, а также защиту API-ключей и навыков.