AI 텍스트 워터마킹 작동 방식: 비밀 키, 그린/레드 단어 선택 및 탐지
AI 텍스트 워터마킹은 텍스트 자체가 아니라 단어 선택 사이에 표시를 숨기는 방식으로 작동합니다. Google은 2024년부터 Gemini 앱 및 웹 텍스트에 워터마크를 적용했으며, Claude 모델은 2026년 8월부터 모델 수준에서 텍스트에 표시를 남깁니다. 이 표시는 복사-붙여넣기 후에도 유지되며 독자에게는 보이지 않습니다.
단어 선택 편향을 통한 워터마킹
언어 모델이 글을 쓸 때, 각 단어는 후보 목록에서 가중 주사위를 굴려 선택됩니다. 워터마킹은 비밀 키를 사용하여 해당 후보를 초록색 또는 빨간색으로 색칠한 다음, 주사위를 초록색 쪽으로 약간 기울입니다. 텍스트는 여전히 자연스럽게 읽힙니다 — 빨간색 단어도 선택될 수 있지만, 그 빈도가 낮아질 뿐입니다.
탐지 작동 방식
비밀 키를 사용하면 모든 텍스트를 다시 색칠하고 초록색 단어 수를 셀 수 있습니다. 워터마크가 없는 텍스트에서는 대략 절반의 단어가 우연히 초록색일 것입니다. 워터마크가 있는 텍스트에서는 그 수가 상당히 높습니다. 탐지기는 텍스트를 읽지 않고 충분히 긴 구간에서 초록색 단어 수만 셉니다.
편집이 워터마크에 미치는 영향
워터마크는 변경되지 않은 단어의 연속에 존재합니다. 각 단어의 색상은 바로 앞의 짧은 단어 창에서 파생되므로, 편집은 그 연속이 끊기는 지점에서 워터마크를 지웁니다. 짧은 텍스트는 판별하기 어렵습니다 — 1,500단어 문서에서 약한 기울기라면 약 55%의 초록색 비율로만 감지될 수 있으며, 따라서 긴 텍스트가 더 신뢰할 수 있습니다.
실제 사용되는 방식
- Google SynthID: 단순한 기울기가 아닌 비밀 토너먼트를 사용하여 정확한 단어 확률을 보존합니다.
- Aaronson의 방식: 키에서 주사위 굴림 자체를 파생합니다.
- Kirchenbauer 외 (2023): 고전적인 초록/빨강 편향 접근법입니다.
과정을 직접 체험할 수 있는 대화형 시각 가이드를 확인해 보세요.
📖 전체 소스 읽기: HN AI Agents
👀 See Also

에이전트-드리프트: AI 에이전트를 위한 보안 모니터링 도구
없음

OpenClaw Security: AI 에이전트를 보호하는 13가지 실용적인 단계
레딧 게시물에서 OpenClaw 설치를 위한 13가지 보안 조치를 설명합니다. 여기에는 별도의 머신에서 실행하기, 네트워크 격리를 위해 Tailscale 사용하기, Docker에서 서브에이전트 샌드박싱하기, 사용자 접근을 위한 허용 목록 구성하기 등이 포함됩니다.

protobuf.js 라이브러리의 치명적인 RCE 취약점
protobuf.js 버전 8.0.0/7.5.4 및 이하 버전에서 발견된 치명적인 원격 코드 실행 취약점으로, 악성 스키마를 통한 JavaScript 코드 실행이 가능합니다. 패치는 버전 8.0.1 및 7.5.5에서 제공됩니다.

MCP 패키지 보안 스캔 결과, 확인 절차 없이도 광범위한 파괴적 기능이 드러났습니다.
npm의 2,386개 MCP 패키지를 대상으로 한 보안 스캔 결과, 63.5%가 파일 삭제 및 데이터베이스 삭제와 같은 파괴적인 작업을 인간의 확인 없이 노출하는 것으로 나타났습니다. 연구원은 전체적으로 49%에 보안 문제가 있으며, 402개의 치명적 및 240개의 높은 심각도 취약점이 발견되었다고 밝혔습니다.