Как работает водяные знаки ИИ в тексте: секретные ключи, выбор «зеленых»/«красных» слов и обнаружение

✍️ OpenClawRadar📅 Опубликовано: 15 августа 2026 г.🔗 Source
Ad

Водяные знаки в текстах ИИ работают, скрывая метки в выборе между словами, а не в самом тексте. Google помечает водяными знаками текст в приложении Gemini и в вебе с 2024 года, а модели Claude помечают текст на уровне модели с августа 2026 года. Метки переживают копирование и вставку и невидимы для читателей.

Водяной знак через смещение выбора слов

Когда языковая модель пишет, она выбирает каждое слово, бросая взвешенные кости по списку кандидатов. Водяной знак использует секретный ключ, чтобы окрасить эти кандидаты в зеленый или красный цвет, а затем слегка подталкивает кости в сторону зеленого. Текст по-прежнему читается естественно — красные слова могут побеждать, просто реже.

Как работает детекция

С помощью секретного ключа вы можете перекрасить любой текст и подсчитать, сколько слов зеленые. В немаркированном тексте примерно половина слов будет зеленой по случайности. В тексте с водяным знаком количество значительно выше. Детектор не читает текст — он просто подсчитывает зеленые слова на достаточно длинном отрезке.

Ad

Что делает редактирование с меткой

Водяной знак живет в последовательностях нетронутых слов. Цвет каждого слова выводится из короткого окна предшествующих слов, поэтому редактирование стирает метку именно там, где разрывается последовательность. Короткие тексты трудно определить — документ из 1500 слов с умеренным смещением покажет только около 55% зеленых, поэтому более длинные тексты надежнее.

Схемы производства

  • Google SynthID: Использует секретный турнир вместо простого смещения, сохраняя точные вероятности слов.
  • Схема Ааронсона: Сами броски костей выводятся из ключа.
  • Кирхенбауэр и др. (2023): Классический подход с зеленым/красным смещением.

Ознакомьтесь с интерактивным визуальным руководством для практической демонстрации процесса.

📖 Полный источник: HN AI Agents

Ad

👀 Смотрите также

В репозитории GitHub представлены документы, описывающие 16 методов инъекции промптов и стратегии защиты для публичных AI-чатов.
Безопасность

В репозитории GitHub представлены документы, описывающие 16 методов инъекции промптов и стратегии защиты для публичных AI-чатов.

Разработчик опубликовал репозиторий на GitHub с описанием мер безопасности для публичных AI-чатов после того, как пользователи пытались использовать инъекцию промптов, атаки через ролевые игры, многоязычные уловки и полезные нагрузки в кодировке base64. Руководство включает навык кода Claude для тестирования всех 16 задокументированных техник инъекции.

OpenClawRadar
Анализ инструментирования и возможностей телеметрии Claude Code
Безопасность

Анализ инструментирования и возможностей телеметрии Claude Code

Анализ исходного кода показывает, что Claude Code реализует обширное отслеживание поведения, включая классификацию настроений на основе ключевых слов, мониторинг колебаний при запросах разрешений и детальное снятие отпечатков окружения.

OpenClawRadar
Настройте свой OpenClaw: экономьте и улучшайте безопасность.
Безопасность

Настройте свой OpenClaw: экономьте и улучшайте безопасность.

Узнайте, как настроить ваш OpenClaw, чтобы не только сэкономить деньги, но и усилить его безопасность, как обсуждается на сабреддите r/openclaw.

OpenClawRadar
Ядро Linux предлагает децентрализованную систему идентификации для замены сети доверия PGP.
Безопасность

Ядро Linux предлагает децентрализованную систему идентификации для замены сети доверия PGP.

Разработчики ядра Linux работают над децентрализованным уровнем идентификации под названием Linux ID, который должен заменить нынешнюю сеть доверия PGP. Система использует децентрализованные идентификаторы (DID) в стиле W3C и верифицируемые учетные данные для аутентификации разработчиков без необходимости проведения очных сессий подписания ключей.

OpenClawRadar