AI 텍스트 워터마킹 작동 방식: 비밀 키, 그린/레드 단어 선택 및 탐지

✍️ OpenClawRadar📅 게시일: August 15, 2026🔗 Source
Ad

AI 텍스트 워터마킹은 텍스트 자체가 아니라 단어 선택 사이에 표시를 숨기는 방식으로 작동합니다. Google은 2024년부터 Gemini 앱 및 웹 텍스트에 워터마크를 적용했으며, Claude 모델은 2026년 8월부터 모델 수준에서 텍스트에 표시를 남깁니다. 이 표시는 복사-붙여넣기 후에도 유지되며 독자에게는 보이지 않습니다.

단어 선택 편향을 통한 워터마킹

언어 모델이 글을 쓸 때, 각 단어는 후보 목록에서 가중 주사위를 굴려 선택됩니다. 워터마킹은 비밀 키를 사용하여 해당 후보를 초록색 또는 빨간색으로 색칠한 다음, 주사위를 초록색 쪽으로 약간 기울입니다. 텍스트는 여전히 자연스럽게 읽힙니다 — 빨간색 단어도 선택될 수 있지만, 그 빈도가 낮아질 뿐입니다.

탐지 작동 방식

비밀 키를 사용하면 모든 텍스트를 다시 색칠하고 초록색 단어 수를 셀 수 있습니다. 워터마크가 없는 텍스트에서는 대략 절반의 단어가 우연히 초록색일 것입니다. 워터마크가 있는 텍스트에서는 그 수가 상당히 높습니다. 탐지기는 텍스트를 읽지 않고 충분히 긴 구간에서 초록색 단어 수만 셉니다.

편집이 워터마크에 미치는 영향

워터마크는 변경되지 않은 단어의 연속에 존재합니다. 각 단어의 색상은 바로 앞의 짧은 단어 창에서 파생되므로, 편집은 그 연속이 끊기는 지점에서 워터마크를 지웁니다. 짧은 텍스트는 판별하기 어렵습니다 — 1,500단어 문서에서 약한 기울기라면 약 55%의 초록색 비율로만 감지될 수 있으며, 따라서 긴 텍스트가 더 신뢰할 수 있습니다.

실제 사용되는 방식

  • Google SynthID: 단순한 기울기가 아닌 비밀 토너먼트를 사용하여 정확한 단어 확률을 보존합니다.
  • Aaronson의 방식: 키에서 주사위 굴림 자체를 파생합니다.
  • Kirchenbauer 외 (2023): 고전적인 초록/빨강 편향 접근법입니다.

과정을 직접 체험할 수 있는 대화형 시각 가이드를 확인해 보세요.

📖 전체 소스 읽기: HN AI Agents

Ad

👀 See Also

런로브스터 호스팅 경고: 봇 스팸 및 무단 청구 보고됨
Security

런로브스터 호스팅 경고: 봇 스팸 및 무단 청구 보고됨

레딧 사용자가 RunLobster(OpenClaw Hosting) 봇이 기술 관련 서브레딧에 스팸을 보내고, 가입 직후 지원팀의 응답 없이 세 건의 무단 결제를 카드에 청구했다고 보고합니다.

OpenClawRadar
로컬 모델 프롬프트 인젝션 스캐너 - AI 스킬 보안용
Security

로컬 모델 프롬프트 인젝션 스캐너 - AI 스킬 보안용

개념 증명 도구는 로컬에서 mistral-small:latest 같은 비-도구-호출 모델을 사용하여 타사 AI 스킬에서 숨겨진 bash 명령어 주입을 스캔하여 Claude Code의 ! 연산자 기능의 보안 취약점을 해결합니다.

OpenClawRadar
클로드 플로우 저장소 skill.md 파일에서 트로이 목마가 발견되었습니다
Security

클로드 플로우 저장소 skill.md 파일에서 트로이 목마가 발견되었습니다

Claude Flow 스킬 파일을 포함한 GitHub 저장소에서 JS/CrypoStealz.AE!MTB로 식별된 트로이 목마가 발견되었습니다. 이 악성코드는 AI 기반 IDE가 마크다운 파일을 읽기 위해 폴더를 열었을 때 자동으로 실행되었습니다.

OpenClawRadar
AI 시스템이 12개의 OpenSSL 제로데이 취약점 발견, Curl은 AI 스팸으로 인해 버그 바운티 취소
Security

AI 시스템이 12개의 OpenSSL 제로데이 취약점 발견, Curl은 AI 스팸으로 인해 버그 바운티 취소

AISLE의 AI 시스템이 OpenSSL의 최근 보안 릴리스에서 12개의 제로데이 취약점을 모두 발견했으며, 이는 AI 기반 사이버보안의 첫 번째 대규모 실증 사례입니다. 한편, curl은 AI 생성 스팸 제출로 인해 버그 바운티 프로그램을 취소했습니다.

OpenClawRadar