AI 에이전트 권한: 인간, 40k 게임에서 위협 3개 중 1개를 놓친다

Scale X는 시간 압박 속에서 AI 코딩 에이전트 명령을 승인하거나 거부하는 브라우저 게임을 실행했습니다. 40,000회 이상의 실행과 409,000개의 결정에서 인간은 위협의 3분의 1을 놓쳤습니다(평균 정확도 66.3%). 세션의 32.9%는 음수 점수로 끝났습니다. 35.2%는 모든 위협을 잡았지만, 그 중 20.8%만이 안전한 명령의 5분의 1을 차단하지 않고 그렇게 했습니다. 7%는 모든 프롬프트를 승인했습니다 — --dangerously-skip-permissions의 열렬한 팬입니다.
게임에는 네 가지 범주에 걸쳐 37개의 위협 명령이 포함되었으며, 누락률은 다음과 같습니다:
- 명백히 파괴적인 (예:
rm -rf /,chmod -R 777 /): 11.7% - 지속적 변형 (예: crontab 주입, git config 하이재킹): 23.8%
- 유출 / 코드 실행 (예: 알 수 없는 API로 curl, typosquatted 패키지): 33.4%
- 범위 위반 (예:
cat ~/.aws/credentials,cat ~/.kube/config): 35.0%
가장 많이 놓친 단일 명령은 npm run analyze로, 64.7%의 확률로 승인되었습니다. 게임의 기록 로그는 package.json의 스크립트가 curl 유출을 포함하도록 수정되었음을 보여주었지만, 플레이어는 여전히 승인했습니다. 세 가지 명령(npm run analyze, npm run setup 48.0%, npm run deploy 44.9%)은 함께 묶였을 때 52.5%의 누락률을 보였고, 다른 유출 스타일 공격의 28.4%와 대비되었습니다.
이것은 근본적인 문제를 강조합니다: 명령 수준 승인은 결함이 있습니다. 한 HN 댓글러가 지적했듯이, npm run build는 package.json의 임의의 셸 스크립트를 실행하며, 에이전트는 승인 없이 해당 파일(또는 가져온 모듈)을 편집할 수 있었습니다. 사용자는 안전해 보이는 명령을 보지만, 문맥이 중요합니다.
Anthropic은 이전에 승인이 많아질수록 '권한 피로'가 심해진다고 언급했습니다. 주의: 게임은 인위적으로 높은 위협률(~34%)과 시간 압박을 가졌지만, 인간 개입을 안전 메커니즘으로 사용하는 것에 대한 패턴은 우려스럽습니다.
📖 전체 소스 읽기: HN LLM Tools
👀 See Also

Pomerium Identity-Aware Proxy를 활용한 OpenClaw 인프라 보안
OpenClaw 서버 접근을 보호하기 위해 제로 트러스트 인증을 위한 신원 인식 프록시로 Pomerium를 사용하세요.

Claude Code로 바이브 코딩하기 위한 보안 개념: 인증, 권한 부여 및 시행
10년 경력의 시니어 엔지니어가 호텔 비유를 통해 바이브 코딩 앱의 인증, 권한 부여, 시행 개념을 설명하고, AI 에이전트에 보안 확인을 요청하는 방법을 알려줍니다.

OpenClaw 2026.3.28은 중요한 권한 상승을 포함한 8개의 보안 취약점을 패치했습니다.
OpenClaw 2026.3.28은 Ant AI Security Lab이 발견한 8개의 보안 취약점을 패치했습니다. 여기에는 /pair approve를 통한 심각한 권한 상승 취약점과 메시지 도구의 높은 심각도 샌드박스 탈출 취약점이 포함됩니다.

FORGE: LLM 시스템을 위한 오픈 소스 AI 보안 테스트 프레임워크
FORGE는 실행 중에 자체 도구를 구축하고, 군집으로 자가 복제하며, 프롬프트 주입, 탈옥 퍼징, RAG 누출을 포함한 OWASP LLM Top 10 취약점을 다루는 자율 AI 보안 테스트 프레임워크입니다.