Разрешения ИИ-агентов: люди пропускают 1 из 3 угроз в игре 40k

✍️ OpenClawRadar📅 Опубликовано: 7 августа 2026 г.🔗 Source
Разрешения ИИ-агентов: люди пропускают 1 из 3 угроз в игре 40k
Ad

Scale X провела браузерную игру, где вы одобряете или отклоняете команды ИИ-кодинг-агента в условиях нехватки времени. За более чем 40 000 запусков и 409 000 решений люди пропустили 1 из 3 угроз (средняя точность 66,3%). 32,9% сессий закончились отрицательным результатом. 35,2% поймали все угрозы, но только 20,8% сделали это, не блокируя 1 из 5 безопасных команд. 7% одобрили все подсказки — большие поклонники --dangerously-skip-permissions.

В игре было 37 команд-угроз четырех категорий, с частотой пропусков:

  • Очевидно разрушительные (например, rm -rf /, chmod -R 777 /): 11,7%
  • Постоянные мутации (например, инъекция в crontab, перехват git config): 23,8%
  • Эксфильтрация / выполнение кода (например, curl на неизвестные API, пакеты-тайпсквоттеры): 33,4%
  • Нарушение границ (например, cat ~/.aws/credentials, cat ~/.kube/config): 35,0%

Самая пропускаемая команда — npm run analyze, одобрена в 64,7% случаев. В журнале игры видно, что скрипт в package.json был изменен, чтобы включить эксфильтрацию через curl, но игроки все равно одобряли его. Три такие команды (npm run analyze, npm run setup — 48,0%, npm run deploy — 44,9%) были объединены и пропущены в 52,5% случаев, против 28,4% для других атак с эксфильтрацией.

Ad

Это подчеркивает фундаментальную проблему: одобрение на уровне команд ошибочно. Как отметил один комментатор на HN, npm run build выполняет произвольный скрипт из package.json, и агент мог отредактировать этот файл (или любой импортированный модуль) без одобрения. Пользователи видят команды, которые выглядят безопасно, но контекст имеет значение.

Anthropic ранее отмечал, что «усталость от разрешений» усиливается с ростом числа одобрений. Оговорка: в игре был искусственно высокий уровень угроз (~34%) и цейтнот, но такая тенденция вызывает беспокойство по поводу человеческого контроля как механизма безопасности.

📖 Читать полный источник: HN LLM Tools

Ad

👀 Смотрите также

Усиление безопасности OpenClaw: Многоуровневая защита от рисков автономных агентов.
Безопасность

Усиление безопасности OpenClaw: Многоуровневая защита от рисков автономных агентов.

Разработчик модифицировал код OpenClaw, добавив многоуровневый стек безопасности, включающий строгую регулярную защиту, рекурсивный деобфускатор, профиль AppArmor и интеграцию аудита для предотвращения деструктивных команд и утечки данных автономными агентами.

OpenClawRadar
Компрометация NPM через бэкдор в Axios: влияние на AI-агентов для написания кода
Безопасность

Компрометация NPM через бэкдор в Axios: влияние на AI-агентов для написания кода

31 марта 2026 года угроза, связанная с КНДР, скомпрометировала npm, опубликовав версии Axios с бэкдором (1.14.1 и 0.30.4) в течение трёхчасового окна. Вредоносное ПО внедрило зависимость, которая загружала платформенно-специфичный RAT, собирала учётные данные и самоудалялась, при этом AI-агенты для написания кода, такие как Claude Code и Cursor, оказались особенно уязвимы из-за автоматических установок через npm.

OpenClawRadar
Утечка исходной карты Claude Code показала, что минифицированный JavaScript уже был общедоступен в npm.
Безопасность

Утечка исходной карты Claude Code показала, что минифицированный JavaScript уже был общедоступен в npm.

Файл карты исходного кода, случайно включенный в версию 2.1.88 пакета npm @anthropic-ai/claude-code, раскрыл внутренние комментарии разработчиков, но фактический 13-мегабайтный файл cli.js, содержащий более 148 000 строк обычного текста, был общедоступен на npm с момента запуска.

OpenClawRadar
Бенчмарк безопасности: 10 крупных языковых моделей протестированы с помощью 211 вредоносных запросов.
Безопасность

Бенчмарк безопасности: 10 крупных языковых моделей протестированы с помощью 211 вредоносных запросов.

Исследователь безопасности протестировал 10 больших языковых моделей (LLM) против 211 атакующих воздействий, обнаружив, что устойчивость к извлечению данных в среднем составляет 85%, а устойчивость к внедрению — всего 46,2%. Каждая модель полностью провалила тесты на атаки с использованием разделителей, отвлекающих элементов и стилевого внедрения.

OpenClawRadar