Как работает водяные знаки ИИ в тексте: секретные ключи, выбор «зеленых»/«красных» слов и обнаружение
Водяные знаки в текстах ИИ работают, скрывая метки в выборе между словами, а не в самом тексте. Google помечает водяными знаками текст в приложении Gemini и в вебе с 2024 года, а модели Claude помечают текст на уровне модели с августа 2026 года. Метки переживают копирование и вставку и невидимы для читателей.
Водяной знак через смещение выбора слов
Когда языковая модель пишет, она выбирает каждое слово, бросая взвешенные кости по списку кандидатов. Водяной знак использует секретный ключ, чтобы окрасить эти кандидаты в зеленый или красный цвет, а затем слегка подталкивает кости в сторону зеленого. Текст по-прежнему читается естественно — красные слова могут побеждать, просто реже.
Как работает детекция
С помощью секретного ключа вы можете перекрасить любой текст и подсчитать, сколько слов зеленые. В немаркированном тексте примерно половина слов будет зеленой по случайности. В тексте с водяным знаком количество значительно выше. Детектор не читает текст — он просто подсчитывает зеленые слова на достаточно длинном отрезке.
Что делает редактирование с меткой
Водяной знак живет в последовательностях нетронутых слов. Цвет каждого слова выводится из короткого окна предшествующих слов, поэтому редактирование стирает метку именно там, где разрывается последовательность. Короткие тексты трудно определить — документ из 1500 слов с умеренным смещением покажет только около 55% зеленых, поэтому более длинные тексты надежнее.
Схемы производства
- Google SynthID: Использует секретный турнир вместо простого смещения, сохраняя точные вероятности слов.
- Схема Ааронсона: Сами броски костей выводятся из ключа.
- Кирхенбауэр и др. (2023): Классический подход с зеленым/красным смещением.
Ознакомьтесь с интерактивным визуальным руководством для практической демонстрации процесса.
📖 Полный источник: HN AI Agents
👀 Смотрите также

Сканер локального внедрения промптов в модели для безопасности AI-навыков
Концептуальный инструмент сканирует сторонние навыки ИИ на наличие скрытых инъекций bash-команд с использованием локальной модели без вызова инструментов, такой как mistral-small:latest на Ollama, решая проблемы безопасности в функции оператора ! в Claude Code.

Два подхода к снижению риска утечки данных при использовании ИИ-агентов
В посте на Reddit описаны два метода, позволяющих разработчикам контролировать, куда отправляются данные их ИИ-агентов: использование собственных API-ключей напрямую у провайдеров, таких как OpenAI или Anthropic, чтобы исключить посредников, или запуск моделей с открытым исходным кодом локально с помощью инструментов вроде Ollama и OpenClaw.

Обезноженный: Расширенный.Scanner для вредоносных программ, управляемый сообществом, для файлов SKILL.md ClawHub.
Declawed — это инструмент безопасности для сканирования файлов SKILL.md на ClawHub, обнаружения инъекций в подсказках, вредоносного контента и кражи информации с использованием правил, разработанных сообществом.

Уязвимости функции «Разрешать всегда» в OpenClaw и более безопасные альтернативы
Функция 'разрешить всегда' в OpenClaw стала предметом двух уязвимостей (CVE) в этом месяце, позволяя выполнять несанкционированные команды через привязку команд-обёрток и обходы с помощью символов продолжения строки в оболочке. Более глубокая проблема заключается в том, как эта функция приучает пользователей переставать обращать внимание на запросы безопасности.