AI 에이전트 권한: 인간, 40k 게임에서 위협 3개 중 1개를 놓친다

✍️ OpenClawRadar📅 게시일: August 7, 2026🔗 Source
AI 에이전트 권한: 인간, 40k 게임에서 위협 3개 중 1개를 놓친다
Ad

Scale X는 시간 압박 속에서 AI 코딩 에이전트 명령을 승인하거나 거부하는 브라우저 게임을 실행했습니다. 40,000회 이상의 실행과 409,000개의 결정에서 인간은 위협의 3분의 1을 놓쳤습니다(평균 정확도 66.3%). 세션의 32.9%는 음수 점수로 끝났습니다. 35.2%는 모든 위협을 잡았지만, 그 중 20.8%만이 안전한 명령의 5분의 1을 차단하지 않고 그렇게 했습니다. 7%는 모든 프롬프트를 승인했습니다 — --dangerously-skip-permissions의 열렬한 팬입니다.

게임에는 네 가지 범주에 걸쳐 37개의 위협 명령이 포함되었으며, 누락률은 다음과 같습니다:

  • 명백히 파괴적인 (예: rm -rf /, chmod -R 777 /): 11.7%
  • 지속적 변형 (예: crontab 주입, git config 하이재킹): 23.8%
  • 유출 / 코드 실행 (예: 알 수 없는 API로 curl, typosquatted 패키지): 33.4%
  • 범위 위반 (예: cat ~/.aws/credentials, cat ~/.kube/config): 35.0%

가장 많이 놓친 단일 명령은 npm run analyze로, 64.7%의 확률로 승인되었습니다. 게임의 기록 로그는 package.json의 스크립트가 curl 유출을 포함하도록 수정되었음을 보여주었지만, 플레이어는 여전히 승인했습니다. 세 가지 명령(npm run analyze, npm run setup 48.0%, npm run deploy 44.9%)은 함께 묶였을 때 52.5%의 누락률을 보였고, 다른 유출 스타일 공격의 28.4%와 대비되었습니다.

Ad

이것은 근본적인 문제를 강조합니다: 명령 수준 승인은 결함이 있습니다. 한 HN 댓글러가 지적했듯이, npm run build는 package.json의 임의의 셸 스크립트를 실행하며, 에이전트는 승인 없이 해당 파일(또는 가져온 모듈)을 편집할 수 있었습니다. 사용자는 안전해 보이는 명령을 보지만, 문맥이 중요합니다.

Anthropic은 이전에 승인이 많아질수록 '권한 피로'가 심해진다고 언급했습니다. 주의: 게임은 인위적으로 높은 위협률(~34%)과 시간 압박을 가졌지만, 인간 개입을 안전 메커니즘으로 사용하는 것에 대한 패턴은 우려스럽습니다.

📖 전체 소스 읽기: HN LLM Tools

Ad

👀 See Also