PolyRange: Устойчивый к загрязнению бенчмарк для атакующего ИИ с целями, сгенерированными LLM

PolyRange v1.0 — это бенчмарк для оффенсивного AI в области веб-безопасности с лицензией MIT, устойчивый к загрязнению данных. В отличие от статичных целей, которые просачиваются в обучающие корпусы, каждый развернутый экземпляр PolyRange создается заново с помощью LLM по выбору исследователя, удовлетворяя критерию «новые задачи», который OpenAI, Anthropic и UK AISI публично запрашивали.
Что решает PolyRange
Автор, генеральный директор Aether AI, отмечает, что существующие кибер-AI бенчмарки делятся на две категории, которые не измеряют то, что нужно лабораториям: бенчмарки типа CTF (DVWA, NYU CTF Bench, CyberGym, AutoPenBench) используют статичные цели, загрязняющие будущие модели, а бенчмарки типа bug-bounty (XBOW) имеют неопределенную защитную инфраструктуру. PolyRange заполняет этот пробел условиями, приближенными к продакшну, включая активных защитников.
Технические характеристики
- 84 класса, производных от WSTG, охватывающих все 12 категорий руководства по тестированию OWASP
- Два уровня защиты, приближенных к условиям активного защитника
- Реальные бэкенды: диалекты Postgres, настоящий PHP для LFI, настоящий shell для внедрения команд, настоящий Jinja2 для SSTI
- Конвенция оракула «агент отправляет флаг» для подсчета очков
- CLI оценки одной командой
- Самостоятельное размещение на Fly.io или любом Docker-хосте
Поскольку цели генерируются заново при каждом запуске с помощью LLM (модель-генератор выбирается исследователем), не существует статичного артефакта, который могли бы поглотить будущие модели, что решает проблему, поднятую Anthropic: «этот отчет, скорее всего, сам усугубит проблему».
Бенчмарк использует двухкорзинное энтропийное фреймирование, разделяющее оси эксплуатации/вспоминания от осей внешнего вида/реализма, что, по мнению автора, чрезмерно смешивается в смежной литературе.
Финансирование полной эмпирической статьи (с публикуемыми результатами N) зависит от партнерского финансирования, но фреймворк уже доступен.
📖 Читать полный источник: r/LocalLLaMA
👀 Смотрите также

Защита инфраструктуры OpenClaw с помощью прокси-сервера Pomerium, осознающего идентификацию.
Используйте Pomerium в качестве прокси-сервера с учетом идентификации для нулевой доверительной аутентификации для обеспечения доступа к серверу OpenClaw.

Ward: Инструмент с открытым исходным кодом перехватывает команды npm install, чтобы блокировать атаки через цепочку поставок для пользователей Claude Code.
Ward — это инструмент с открытым исходным кодом, который подключается к менеджерам пакетов и проверяет каждый пакет до запуска скриптов установки. Когда Claude Code выполняет npm install, Ward автоматически проверяет пакеты на наличие вредоносного ПО, тайпсквоттинга, подозрительных скриптов и аномалий версий.

Критическая уязвимость удаленного выполнения кода (RCE) в библиотеке protobuf.js
Критическая уязвимость удаленного выполнения кода в protobuf.js версий 8.0.0/7.5.4 и ниже позволяет выполнять JavaScript-код через вредоносные схемы. Исправления доступны в версиях 8.0.1 и 7.5.5.

Клод Код обнаружил бэкдор вредоносного ПО в репозитории GitHub во время технического аудита
Разработчик использовал Claude Code для аудита репозитория GitHub перед выполнением и обнаружил бэкдор удаленного выполнения кода в src/server/routes/auth.js, который мог бы скомпрометировать его компьютер. В запросе требовался технический аудит due diligence для проверки полноты проекта, AI/ML-слоя, базы данных, аутентификации, бэкенд-сервисов, фронтенда, качества кода и оценки трудозатрат.