Разрешения ИИ-агентов: люди пропускают 1 из 3 угроз в игре 40k

✍️ OpenClawRadar📅 Опубликовано: 7 августа 2026 г.🔗 Source
Разрешения ИИ-агентов: люди пропускают 1 из 3 угроз в игре 40k
Ad

Scale X провела браузерную игру, где вы одобряете или отклоняете команды ИИ-кодинг-агента в условиях нехватки времени. За более чем 40 000 запусков и 409 000 решений люди пропустили 1 из 3 угроз (средняя точность 66,3%). 32,9% сессий закончились отрицательным результатом. 35,2% поймали все угрозы, но только 20,8% сделали это, не блокируя 1 из 5 безопасных команд. 7% одобрили все подсказки — большие поклонники --dangerously-skip-permissions.

В игре было 37 команд-угроз четырех категорий, с частотой пропусков:

  • Очевидно разрушительные (например, rm -rf /, chmod -R 777 /): 11,7%
  • Постоянные мутации (например, инъекция в crontab, перехват git config): 23,8%
  • Эксфильтрация / выполнение кода (например, curl на неизвестные API, пакеты-тайпсквоттеры): 33,4%
  • Нарушение границ (например, cat ~/.aws/credentials, cat ~/.kube/config): 35,0%

Самая пропускаемая команда — npm run analyze, одобрена в 64,7% случаев. В журнале игры видно, что скрипт в package.json был изменен, чтобы включить эксфильтрацию через curl, но игроки все равно одобряли его. Три такие команды (npm run analyze, npm run setup — 48,0%, npm run deploy — 44,9%) были объединены и пропущены в 52,5% случаев, против 28,4% для других атак с эксфильтрацией.

Ad

Это подчеркивает фундаментальную проблему: одобрение на уровне команд ошибочно. Как отметил один комментатор на HN, npm run build выполняет произвольный скрипт из package.json, и агент мог отредактировать этот файл (или любой импортированный модуль) без одобрения. Пользователи видят команды, которые выглядят безопасно, но контекст имеет значение.

Anthropic ранее отмечал, что «усталость от разрешений» усиливается с ростом числа одобрений. Оговорка: в игре был искусственно высокий уровень угроз (~34%) и цейтнот, но такая тенденция вызывает беспокойство по поводу человеческого контроля как механизма безопасности.

📖 Читать полный источник: HN LLM Tools

Ad

👀 Смотрите также

Предупреждение о безопасности: Скрипт ClawProxy похитил API-ключи, что привело к значительному счету от OpenRouter
Безопасность

Предупреждение о безопасности: Скрипт ClawProxy похитил API-ключи, что привело к значительному счету от OpenRouter

Разработчик установил закрытый исходный код скрипта ClawProxy от пользователя Reddit на изолированную систему WSL Ubuntu 24.04, который украл его ключ API OpenRouter и использовал его через Google Vertex API, чтобы накрутить крупный счёт на Opus 4.6 за ночь.

OpenClawRadar
Агент Hush: Инструмент с открытым исходным кодом предотвращает утечку конфиденциальных данных AI-агентами для написания кода
Безопасность

Агент Hush: Инструмент с открытым исходным кодом предотвращает утечку конфиденциальных данных AI-агентами для написания кода

Agent Hush — это инструмент с открытым исходным кодом, который перехватывает конфиденциальные данные до того, как они покинут ваше устройство. Он был создан после того, как AI-агент разработчика случайно опубликовал API-ключи, IP-адреса серверов и личную информацию в публичном репозитории GitHub во время работы над проектом по безопасности.

OpenClawRadar
Фишинговый сайт установки Claude Code лидирует в результатах поиска Google
Безопасность

Фишинговый сайт установки Claude Code лидирует в результатах поиска Google

Фишинговый сайт, выдающий себя за официальную страницу загрузки Claude Code, появляется первым в Google по запросу "Claude code install mac". Пользователей предупреждают: не скачивайте с поддельного сайта.

OpenClawRadar
Система ИИ обнаружила 12 уязвимостей нулевого дня в OpenSSL, а Curl отменил программу вознаграждений за баги из-за спама от ИИ.
Безопасность

Система ИИ обнаружила 12 уязвимостей нулевого дня в OpenSSL, а Curl отменил программу вознаграждений за баги из-за спама от ИИ.

ИИ-система AISLE обнаружила все 12 уязвимостей нулевого дня в последнем релизе безопасности OpenSSL, что стало первой крупномасштабной демонстрацией ИИ-кибербезопасности. В то же время curl отменил свою программу вознаграждений за обнаружение уязвимостей из-за спам-отчетов, сгенерированных ИИ.

OpenClawRadar