Разрешения ИИ-агентов: люди пропускают 1 из 3 угроз в игре 40k

Scale X провела браузерную игру, где вы одобряете или отклоняете команды ИИ-кодинг-агента в условиях нехватки времени. За более чем 40 000 запусков и 409 000 решений люди пропустили 1 из 3 угроз (средняя точность 66,3%). 32,9% сессий закончились отрицательным результатом. 35,2% поймали все угрозы, но только 20,8% сделали это, не блокируя 1 из 5 безопасных команд. 7% одобрили все подсказки — большие поклонники --dangerously-skip-permissions.
В игре было 37 команд-угроз четырех категорий, с частотой пропусков:
- Очевидно разрушительные (например,
rm -rf /,chmod -R 777 /): 11,7% - Постоянные мутации (например, инъекция в crontab, перехват git config): 23,8%
- Эксфильтрация / выполнение кода (например, curl на неизвестные API, пакеты-тайпсквоттеры): 33,4%
- Нарушение границ (например,
cat ~/.aws/credentials,cat ~/.kube/config): 35,0%
Самая пропускаемая команда — npm run analyze, одобрена в 64,7% случаев. В журнале игры видно, что скрипт в package.json был изменен, чтобы включить эксфильтрацию через curl, но игроки все равно одобряли его. Три такие команды (npm run analyze, npm run setup — 48,0%, npm run deploy — 44,9%) были объединены и пропущены в 52,5% случаев, против 28,4% для других атак с эксфильтрацией.
Это подчеркивает фундаментальную проблему: одобрение на уровне команд ошибочно. Как отметил один комментатор на HN, npm run build выполняет произвольный скрипт из package.json, и агент мог отредактировать этот файл (или любой импортированный модуль) без одобрения. Пользователи видят команды, которые выглядят безопасно, но контекст имеет значение.
Anthropic ранее отмечал, что «усталость от разрешений» усиливается с ростом числа одобрений. Оговорка: в игре был искусственно высокий уровень угроз (~34%) и цейтнот, но такая тенденция вызывает беспокойство по поводу человеческого контроля как механизма безопасности.
📖 Читать полный источник: HN LLM Tools
👀 Смотрите также

Предупреждение о безопасности: Скрипт ClawProxy похитил API-ключи, что привело к значительному счету от OpenRouter
Разработчик установил закрытый исходный код скрипта ClawProxy от пользователя Reddit на изолированную систему WSL Ubuntu 24.04, который украл его ключ API OpenRouter и использовал его через Google Vertex API, чтобы накрутить крупный счёт на Opus 4.6 за ночь.

Агент Hush: Инструмент с открытым исходным кодом предотвращает утечку конфиденциальных данных AI-агентами для написания кода
Agent Hush — это инструмент с открытым исходным кодом, который перехватывает конфиденциальные данные до того, как они покинут ваше устройство. Он был создан после того, как AI-агент разработчика случайно опубликовал API-ключи, IP-адреса серверов и личную информацию в публичном репозитории GitHub во время работы над проектом по безопасности.

Фишинговый сайт установки Claude Code лидирует в результатах поиска Google
Фишинговый сайт, выдающий себя за официальную страницу загрузки Claude Code, появляется первым в Google по запросу "Claude code install mac". Пользователей предупреждают: не скачивайте с поддельного сайта.

Система ИИ обнаружила 12 уязвимостей нулевого дня в OpenSSL, а Curl отменил программу вознаграждений за баги из-за спама от ИИ.
ИИ-система AISLE обнаружила все 12 уязвимостей нулевого дня в последнем релизе безопасности OpenSSL, что стало первой крупномасштабной демонстрацией ИИ-кибербезопасности. В то же время curl отменил свою программу вознаграждений за обнаружение уязвимостей из-за спам-отчетов, сгенерированных ИИ.