AI의 10만 가지 이유: 준결정론적 LLM 출력이 특징적 slop을 만드는 법

최근 Substack 게시글에서 lcamtuf(AFL 등 도구로 유명한 보안 연구원)는 인간이 작성한 텍스트와 LLM 출력을 구분할 수 있는지에 대한 반복되는 논쟁을 다룹니다. 그의 주장은 현재 모델이 실제로 어떻게 동작하는지에 대한 구체적인 관찰에 기반합니다.
핵심 주장: 준결정성
LLM은 인간 언어의 최첨단 통계 모델입니다. 이론적으로 그들의 출력은 어떤 통계 테스트에서도 인간 텍스트와 구별할 수 없어야 합니다. 그러나 lcamtuf는 실제 구별 요소는 준결정성이라고 주장합니다. 즉, 100명의 '저자'에게 비슷한 프롬프트(예: '어린이 참고서를 만들어 줘')를 주면 모델은 약 80%의 경우 기능적으로 동일한 출력을 생성합니다.
그는 '100000 whys' 검색 결과에서 나온 약 220개의 Amazon 책 표지 콜라주(링크)로 이를 설명합니다. 이미지는 거의 동일한 표지들의 클러스터를 보여줍니다:
- 위쪽 두 줄 모두 왼쪽에 포효하는 T-Rex가 있습니다
- 반복되는 모티프: 빨간색과 흰색 만화 로켓, 골든 리트리버, 사자
- 저자 이름에는 'Bright'가 믿기지 않을 정도로 많이 포함됩니다: Ethan, Nolan, Pamela, Daniel, Thomas, Andrew W., Mayan, Mary, Levi — 모두 Bright입니다
개발자에게 중요한 이유
AI 생성 콘텐츠를 출시하거나 LLM API 기반으로 구축하는 팀에게 이는 무작위성으로 AI 기원을 숨길 수 없다는 의미입니다. 통계적 특징은 개별 단어 선택이 아니라 유사한 프롬프트에 모델이 동일한 고수준 응답 구조를 반환한다는 점입니다. 비슷한 프롬프트에서 많은 변형을 생성하는 워크플로우라면 출력이 군집화되어 쉽게 식별됩니다.
lcamtuf는 말합니다: '이것은 애매한 신호이므로 인턴이 "이게 아니라 저것이다"라고 말한다고 해고하지 마세요. 그러나 더 캐주얼한 환경에서는 직감을 믿어도 괜찮습니다.'
실용적 시사점
블로그 자동화에 LLM을 사용한다면 콘텐츠가 다른 사람의 것과 똑같이 보일 수 있다는 점을 인지하세요. 게시글의 P.S.는 직설적입니다: '네, 기술은 놀랍지만 당신의 출판물 이름을 "100,000 Whys"로 바꿔도 될 가능성이 높습니다.'
게시글은 이 단일 제목 외의 예시(더 많은 예시)도 링크하며, 원래 'One Hundred Thousand Whys'는 중국에서 인기 있는 1929년 소비에트 아동 도서로, 프롬프트 용어의 시드가 되었을 가능성을 언급합니다.
📖 전체 소스 읽기: HN LLM Tools
👀 See Also

OpenAI, 중요한 모델 둔화를 앞두고 몇 주 전에 대비 팀을 해체하다
OpenAI는 7월 말 준비 팀을 해체했는데, 이는 모델이 사이버 임계값에 도달하기 몇 주 전이었습니다. 재앙적 위험을 평가하던 팀은 이제 단일 부서로 존재하지 않습니다.

InclusionAI, 링-2.6-1T 출시: 에이전트 워크플로우를 위한 조 단위 파라미터 모델
InclusionAI가 Ring-2.6-1T를 공개했습니다. 이는 에이전트 실행에 최적화된 1조 매개변수 추론 모델로, 이중 추론 노력 수준(high/xhigh)과 IcePop 알고리즘을 통한 비동기 RL 훈련을 특징으로 합니다.

APEX MoE Quants 업데이트: 25개 이상의 새로운 모델과 I-나노 등급 출시
APEX MoE 인식 혼합 정밀도 양자화가 Qwen, Mistral, Gemma 및 하이브리드 SSM 제품군 전반에 걸쳐 30개 이상의 모델로 확장되고, 중간 계층 전문가에서 2.06bpw까지 낮추는 새로운 I-Nano 계층이 추가되었습니다.

코딩 에이전트 의존성의 장기적 위험에 대한 레딧 토론
레딧 사용자는 Claude Code와 Copilot과 같은 현재의 코딩 에이전트가 공급업체 종속, 소프트웨어 생성의 중앙집중화, 그리고 엔지니어링 기술의 상품화로 이어질 수 있는 의존성을 만든다고 주장합니다.