AI水印在文本中始终容易被移除

2026년 8월부터 시행되는 EU AI 법 제50조는 LLM 제공업체가 AI 생성 텍스트에 워터마크를 요구합니다. 하지만 텍스트 워터마킹은 이미지 워터마킹과 근본적으로 다르며, 제거는 여전히 간단합니다. 다음은 기술적 분석입니다.
텍스트 워터마킹이 어려운 이유
이미지에는 워터마크를 숨길 수 있는 노이즈가 있지만, 텍스트에는 없습니다. 사람이 눈치채지 못하게 문장을 수정할 수 없습니다. 따라서 일반 텍스트를 임의로 조작할 수 없는 스테가노그래피 문제가 됩니다. "다섯 번째 글자마다 'e'" 같은 순진한 접근 방식은 출력 품질을 저하시킵니다.
모델 자체가 워터마크를 관리할 수 있을까요? 강력한 모델은 가능하지만, 추론 토큰을 소모하고 출력 품질을 저하시켜 좋은 절충안이 아닙니다.
모델 재실행을 통한 탐지가 실패하는 이유
텍스트를 모델에 다시 입력하여 토큰 확률을 확인하는 것은 효과가 없습니다. AI 출력처럼 읽히는 인간 텍스트의 공간은 넓고, 오탐지가 많으며, 모든 EU 시민이 무료로 검증받기에는 비용이 너무 많이 듭니다.
SynthID 작동 방식
Google의 SynthID는 유일하게 공개된 텍스트 워터마크입니다. 각 토큰에 이전 토큰을 기반으로 점수를 할당합니다(예: 토큰 ID 합계 모드 5). 샘플링할 때 모델은 상위 5개 후보 중 가장 높은 점수의 토큰을 선택합니다. 탐지는 텍스트 블록 전체의 점수를 집계하며, 의심스러울 정도로 높은 집계 점수는 AI 생성임을 나타냅니다.
이것은 em-dash 휴리스틱과 유사하지만, 인간이 감지할 수 없는 미묘한 수학적 패턴에 기반합니다.
문제점
어휘 다양성을 보존하는 워터마크는 간단한 패러프레이즈, 토큰 대체, 또는 번역으로도 제거할 수 있습니다. 텍스트가 자연스럽게 읽혀야 하는 한, 최소한의 노력으로 신호를 제거할 수 있습니다. SynthID의 견고성은 제한적입니다. 대량 탐지를 위해 설계되었지, 의도적인 제거에 저항하도록 설계되지 않았습니다.
EU가 기술적으로 충족 불가능한 요구를 강제할 것으로 예상됩니다. 연구소들은 내용을 준수하겠지만, 신경 쓰는 사람이라면 누구나 몇 초 안에 우회할 수 있습니다.
📖 전체 소스 읽기: HN AI Agents
👀 See Also

Anthropic은 오픈소스 유지보수자들을 위해 무료 Claude Max 20x를 제공합니다.
Anthropic의 Claude for Open Source 프로그램은 적격한 오픈소스 메인테이너와 기여자에게 6개월간 무료 Claude Max 20x를 제공합니다. 최대 10,000명의 기여자를 대상으로 순차적으로 신청서를 검토합니다.

클로드 구독으로 더 이상 서드파티 하네스 사용이 지원되지 않습니다.
내일 오후 12시(태평양 표준시)부터 Claude 구독이 OpenClaw와 같은 타사 하네스 사용을 더 이상 포함하지 않습니다. 사용자는 추가 사용량 번들 또는 Claude API 키를 통해 이러한 하네스에 계속 접근할 수 있습니다.
DoltLite 베타: Git 스타일 버전 관리를 갖춘 SQLite 포크, 2천 개의 에이전트 PR로 구축
DoltLite 0.50.0는 Git 스타일의 브랜칭, 병합, 동기화를 제공하는 SQLite 포크로, 2,000개의 에이전트 PR을 통해 구축되었습니다. 베타 버전은 저장소 형식 안정성과 SQL 호환성을 제공합니다.
클로드, 리만 가설 영점 경계를 41.6%에서 67.2%로 향상
공개되지 않은 연구용 버전의 Claude가 임계선 위에 있는 제타 함수 영점의 하한 비율을 41.6%에서 67.2%로 개선했습니다. 이는 이전 연구들의 새로운 조합을 통해 이루어졌습니다.