AI 에이전트 권한: 인간, 40k 게임에서 위협 3개 중 1개를 놓친다

✍️ OpenClawRadar📅 게시일: August 7, 2026🔗 Source
AI 에이전트 권한: 인간, 40k 게임에서 위협 3개 중 1개를 놓친다
Ad

Scale X는 시간 압박 속에서 AI 코딩 에이전트 명령을 승인하거나 거부하는 브라우저 게임을 실행했습니다. 40,000회 이상의 실행과 409,000개의 결정에서 인간은 위협의 3분의 1을 놓쳤습니다(평균 정확도 66.3%). 세션의 32.9%는 음수 점수로 끝났습니다. 35.2%는 모든 위협을 잡았지만, 그 중 20.8%만이 안전한 명령의 5분의 1을 차단하지 않고 그렇게 했습니다. 7%는 모든 프롬프트를 승인했습니다 — --dangerously-skip-permissions의 열렬한 팬입니다.

게임에는 네 가지 범주에 걸쳐 37개의 위협 명령이 포함되었으며, 누락률은 다음과 같습니다:

  • 명백히 파괴적인 (예: rm -rf /, chmod -R 777 /): 11.7%
  • 지속적 변형 (예: crontab 주입, git config 하이재킹): 23.8%
  • 유출 / 코드 실행 (예: 알 수 없는 API로 curl, typosquatted 패키지): 33.4%
  • 범위 위반 (예: cat ~/.aws/credentials, cat ~/.kube/config): 35.0%

가장 많이 놓친 단일 명령은 npm run analyze로, 64.7%의 확률로 승인되었습니다. 게임의 기록 로그는 package.json의 스크립트가 curl 유출을 포함하도록 수정되었음을 보여주었지만, 플레이어는 여전히 승인했습니다. 세 가지 명령(npm run analyze, npm run setup 48.0%, npm run deploy 44.9%)은 함께 묶였을 때 52.5%의 누락률을 보였고, 다른 유출 스타일 공격의 28.4%와 대비되었습니다.

Ad

이것은 근본적인 문제를 강조합니다: 명령 수준 승인은 결함이 있습니다. 한 HN 댓글러가 지적했듯이, npm run buildpackage.json의 임의의 셸 스크립트를 실행하며, 에이전트는 승인 없이 해당 파일(또는 가져온 모듈)을 편집할 수 있었습니다. 사용자는 안전해 보이는 명령을 보지만, 문맥이 중요합니다.

Anthropic은 이전에 승인이 많아질수록 '권한 피로'가 심해진다고 언급했습니다. 주의: 게임은 인위적으로 높은 위협률(~34%)과 시간 압박을 가졌지만, 인간 개입을 안전 메커니즘으로 사용하는 것에 대한 패턴은 우려스럽습니다.

📖 전체 소스 읽기: HN LLM Tools

Ad

👀 See Also

🦀
Security

Google 위협 인텔리전스 그룹, 2FA를 우회한 첫 AI 개발 제로데이 익스플로잇 보고

Google 위협 인텔리전스 그룹(GTIG)이 인기 있는 오픈소스 웹 기반 시스템 관리 도구에서 2FA를 우회하는 최초의 완전 AI 개발 제로데이 익스플로잇을 비롯해 스스로 변형하는 멀웨어와 Gemini 기반 백도어를 발견했습니다.

OpenClawRadar
보안 경고: ClawProxy 스크립트가 API 키를 탈취하여 OpenRouter 비용이 크게 증가했습니다
Security

보안 경고: ClawProxy 스크립트가 API 키를 탈취하여 OpenRouter 비용이 크게 증가했습니다

한 개발자가 샌드박스화된 WSL Ubuntu 24.04 시스템에 Reddit 사용자로부터 받은 클로즈드 소스 ClawProxy 스크립트를 설치했는데, 이 스크립트가 OpenRouter API 키를 훔쳐 Google Vertex API를 통해 Opus 4.6을 사용하며 하룻밤 사이에 큰 요금을 발생시켰습니다.

OpenClawRadar
메타 광고에 AI 생성 아동 성착취 콘텐츠 포함; 연구자들이 광고 라이브러리에서 50건 이상 발견
Security

메타 광고에 AI 생성 아동 성착취 콘텐츠 포함; 연구자들이 광고 라이브러리에서 50건 이상 발견

연구진은 메타의 광고 라이브러리에서 AI로 생성된 아동 성적 학대 콘텐츠(CSAM)가 포함된 유료 광고 50여 개를 발견했으며, 일부는 수천 개의 계정에 도달했습니다. WIRED의 문의 후 메타는 해당 광고를 삭제했습니다.

OpenClawRadar
Windows Notepad 앱 원격 코드 실행 취약점 CVE-2026-20841
Security

Windows Notepad 앱 원격 코드 실행 취약점 CVE-2026-20841

CVE-2026-20841는 Windows 메모장 앱의 원격 코드 실행 취약점입니다. 자세한 내용과 완화 단계는 Microsoft 보안 대응 센터 업데이트 가이드에서 확인할 수 있습니다.

OpenClawRadar