AIエージェント権限:人間は4万ゲームで3つに1つの脅威を見逃す

Scale Xは、時間制限のある中でAIコーディングエージェントのコマンドを承認または拒否するブラウザゲームを実施しました。40,000回以上の実行と409,000回の決定の中で、人間は脅威の3分の1を見逃しました(平均精度66.3%)。32.9%のセッションが負のスコアで終了しました。35.2%がすべての脅威を検出しましたが、そのうち安全なコマンドの5分の1をブロックせずに検出したのはわずか20.8%でした。7%はすべてのプロンプトを承認しました——--dangerously-skip-permissionsの大ファンです。
このゲームには4つのカテゴリにわたる37の脅威コマンドが含まれており、見逃し率は次のとおりです:
- 明らかに破壊的(例:
rm -rf /、chmod -R 777 /):11.7% - 永続的な変更(例:crontab注入、git configハイジャック):23.8%
- 外部送信 / コード実行(例:未知のAPIへのcurl、タイポスクワッティングパッケージ):33.4%
- スコープ違反(例:
cat ~/.aws/credentials、cat ~/.kube/config):35.0%
最も見逃された単一コマンドはnpm run analyzeで、64.7%の確率で承認されました。ゲームの履歴ログには、package.json内のスクリプトがcurlによる外部送信を含むように変更されていたことが示されていましたが、プレイヤーはそれでも承認しました。そのような3つのコマンド(npm run analyze、npm run setup 48.0%、npm run deploy 44.9%)をまとめると、52.5%の確率で見逃され、他の外部送信型攻撃の28.4%と比較されました。
これは根本的な問題を浮き彫りにしています:コマンドレベルでの承認には欠陥があります。あるHNコメンテーターが指摘したように、npm run buildはpackage.jsonから任意のシェルスクリプトを実行し、エージェントは承認なしにそのファイル(またはインポートされたモジュール)を編集できたはずです。ユーザーは安全に見えるコマンドを見ますが、コンテキストが重要です。
Anthropicは以前、承認が増えると「許可疲れ」が悪化すると指摘しました。注意点:このゲームは人為的に高い脅威率(約34%)と時間制限がありましたが、人間がループにいることを安全機構として考えると、このパターンは懸念されます。
📖 全文を読む: HN LLM Tools
👀 See Also

サンドボックス化されたOpenClaw:AIコーディングにおけるセキュリティ強化
OpenClawコミュニティによる、AIコーディングエージェントのセキュリティにおいて重要な技術であるサンドボックスに関する最新の議論をご紹介します。AIイノベーションを保護するためにこれが不可欠であるとユーザーが考える理由を探ります。

EctoClaw:ターミナルアクセスを有するOpenClawエージェント向け安全ツール
EctoClawは、OpenClaw向けの無料オープンソースのセキュリティツールで、実行前にすべてのアクションを4回チェックし、強力なサンドボックス内でアクションを実行し、証拠とともにすべてを記録します。

OpenClawがプロダクティビティ・プレイブックから怪しいスクリプトをブロックし、その後ファイナンシャル・ワークブックの構築を続けた
ユーザーがOpenClawに怪しい生産性向上プレイブックのzipを渡したところ、OpenClawはスクリプトの実行を拒否し、スキルディレクトリへの自動インストールを警告。代わりに内蔵スキルを使って手動でワークブックを作成した話。

OpenClawコミュニティスキルでマルウェア発見 — 暗号通貨窃盗の警告
オープンクローコミュニティスキルにマルウェア発見 — 暗号通貨窃盗の警告