Водяные знаки текста Anthropic в Claude: объяснение семантической стеганографии
План Anthropic помечать водяными знаками весь текст, создаваемый Claude, не совсем то, что они изначально подразумевали. Согласно подробному анализу Джона Грубера из Daring Fireball, этот метод является формой семантической стеганографии, которая изменяет выбор слов во время вывода — что противоречит их более раннему заявлению о том, что он будет 'незаметным' и не изменит 'смысл, качество или читабельность'.
Как на самом деле работает водяной знак
Метод включает смещение выбора токенов с использованием "зеленых" и "красных" списков:
- На каждом шаге генерации токена слова детерминированно разделяются на зеленые и красные списки на основе секретного ключа.
- Модель с немного большей вероятностью выберет слово из зеленого списка, чем из красного (представьте смещенную монету 51-49).
- Это вносит статистическую закономерность, которую можно обнаружить вероятностно, но она отклоняется от по-настоящему естественной генерации текста.
В исходном документе поддержки утверждалось, что водяной знак будет 'незаметным' и не повлияет на читабельность — Грубер утверждает, что это вводит в заблуждение, потому что процесс по своей сути изменяет выбор токенов, что может снизить семантическое качество.
Где узнать больше
Грубер указывает на интерактивное эссе Джеймса Падолси, 'Как работает водяной знак ИИ-текста', как на лучшее объяснение общей техники. Anthropic также опубликовал дополнительную статью под названием 'Как работает водяной знак текста Claude', в которой объясняется метод, хотя Грубер критикует ее за эвфемистичность.
Для разработчиков, использующих ИИ-агентов, это важно: водяной знак может незаметно изменить вывод, поэтому соответствующим образом тестируйте свои рабочие процессы.
📖 Читать полный источник: HN AI Agents
👀 Смотрите также

Разработчики из Кремниевой долины сообщают об интенсивном использовании ИИ Claude и нагрузке на инфраструктуру.
Старший инженер по ИИ в Meta тратит $2000 в месяц на токены Claude Code, одновременно запускает 2+ агентов и создал расширение для VS Code, которое автоматически генерирует граф знаний Obsidian из диалогов с Claude. Сообщается, что инфраструктура 'полностью разрушена' из-за внедрения кода, сгенерированного Claude, без проверки.

Анализ расхода токенов в контекстном окне Claude на 1 млн: данные показывают неограниченный рост и накопление промахов кэша.
Анализ контекстного окна Claude в 1 млн токенов выявил два взаимосвязанных фактора, вызывающих быстрое потребление токенов: неограниченный рост контекста без автоматического уплотнения и дорогостоящие промахи кэша при больших размерах контекста. Автор предоставляет скрипт на Python для анализа личного использования токенов из JSONL-файлов сессий.

Простой метод самодистилляции улучшает генерацию кода в больших языковых моделях.
Исследователи показали, что дообучение больших языковых моделей на их собственных сгенерированных ответах (простая самодистилляция) улучшает качество генерации кода, повышая показатель Qwen3-30B-Instruct с 42,4% до 55,3% pass@1 на LiveCodeBench v6.

Выпуск Claude-Code версии 2.1.88: Рендеринг без мерцания, хуки разрешений и критические исправления
Claude-Code v2.1.88 представляет опцию рендеринга без мерцания через CLAUDE_CODE_NO_FLICKER=1, добавляет хук PermissionDenied для повторных попыток в автоматическом режиме и исправляет утечки памяти, сбои и проблемы с отображением в терминалах Windows, macOS и Linux.