PolyRange: Устойчивый к загрязнению бенчмарк для атакующего ИИ с целями, сгенерированными LLM

PolyRange v1.0 — это бенчмарк для оффенсивного AI в области веб-безопасности с лицензией MIT, устойчивый к загрязнению данных. В отличие от статичных целей, которые просачиваются в обучающие корпусы, каждый развернутый экземпляр PolyRange создается заново с помощью LLM по выбору исследователя, удовлетворяя критерию «новые задачи», который OpenAI, Anthropic и UK AISI публично запрашивали.
Что решает PolyRange
Автор, генеральный директор Aether AI, отмечает, что существующие кибер-AI бенчмарки делятся на две категории, которые не измеряют то, что нужно лабораториям: бенчмарки типа CTF (DVWA, NYU CTF Bench, CyberGym, AutoPenBench) используют статичные цели, загрязняющие будущие модели, а бенчмарки типа bug-bounty (XBOW) имеют неопределенную защитную инфраструктуру. PolyRange заполняет этот пробел условиями, приближенными к продакшну, включая активных защитников.
Технические характеристики
- 84 класса, производных от WSTG, охватывающих все 12 категорий руководства по тестированию OWASP
- Два уровня защиты, приближенных к условиям активного защитника
- Реальные бэкенды: диалекты Postgres, настоящий PHP для LFI, настоящий shell для внедрения команд, настоящий Jinja2 для SSTI
- Конвенция оракула «агент отправляет флаг» для подсчета очков
- CLI оценки одной командой
- Самостоятельное размещение на Fly.io или любом Docker-хосте
Поскольку цели генерируются заново при каждом запуске с помощью LLM (модель-генератор выбирается исследователем), не существует статичного артефакта, который могли бы поглотить будущие модели, что решает проблему, поднятую Anthropic: «этот отчет, скорее всего, сам усугубит проблему».
Бенчмарк использует двухкорзинное энтропийное фреймирование, разделяющее оси эксплуатации/вспоминания от осей внешнего вида/реализма, что, по мнению автора, чрезмерно смешивается в смежной литературе.
Финансирование полной эмпирической статьи (с публикуемыми результатами N) зависит от партнерского финансирования, но фреймворк уже доступен.
📖 Читать полный источник: r/LocalLLaMA
👀 Смотрите также

Открытые инструменты искусственного интеллекта создают угрозы безопасности из-за «иллюзии безопасности через прозрачность».
В посте на Reddit предупреждают о вредоносном ПО, замаскированном под открытые ИИ-агенты и инструменты, где зловредный код может быть скрыт в больших кодовых базах, которые пользователи считают безопасными, потому что они на GitHub. В посте описывается, как «вайб-кодинг» и автономные ИИ-агенты приучают пользователей запускать неизвестные программы без проверки.

Сканер безопасности навыков OpenClaw: 7,6% из 31 371 навыка помечены как опасные
Разработчик создал инструмент, который просканировал весь реестр ClawHub и обнаружил, что 2,371 из 31,371 навыков содержат опасные паттерны, такие как похитители кошельков, кража учетных данных и инъекция промптов. Инструмент предоставляет доступ к API и бейджи для проверки навыков перед установкой.

В репозитории Claude Flow обнаружен троян в файлах skill.md
В репозитории GitHub, содержащем файлы навыков Claude Flow, был обнаружен троян, идентифицированный как JS/CrypoStealz.AE!MTB. Вредоносное ПО активировалось автоматически, когда ИИ-среда разработки открывала папку для чтения файлов markdown.

Правила Когтя: Набор правил безопасности с открытым исходным кодом для агентов OpenClaw
Открытый набор правил JSON с 139 правилами безопасности, который блокирует деструктивные команды, защищает файлы с учетными данными и оберегает инструкционные файлы от несанкционированных изменений агентами. Работает без зависимости от LLM, используя регулярные выражения на уровне инструментов.