PolyRange: Benchmark de IA Ofensiva Resistente a Contaminação com Alvos Gerados por LLM

PolyRange v1.0 é um benchmark ofensivo de IA para agentes de segurança web, resistente à contaminação e licenciado sob MIT. Em vez de alvos estáticos que vazam para corpora de treinamento, cada implantação do PolyRange é gerada fresca pela escolha do pesquisador de LLM — satisfazendo o critério de 'tarefas recém-construídas' que OpenAI, Anthropic e UK AISI pediram publicamente.
O que o PolyRange aborda
O autor, CEO da Aether AI, observa que os benchmarks cibernéticos de IA existentes se enquadram em duas categorias que não medem o que os laboratórios precisam: benchmarks estilo CTF (DVWA, NYU CTF Bench, CyberGym, AutoPenBench) usam alvos estáticos que contaminam modelos futuros, e benchmarks estilo bug bounty (XBOW) têm infraestrutura defensiva indefinida. O PolyRange preenche essa lacuna com condições de formato de produção, incluindo defensores ativos.
Especificações técnicas
- 84 classes derivadas do WSTG abrangendo todas as 12 categorias do guia de teste OWASP
- Duas camadas de defesa aproximando condições de defensor ativo
- Backends reais: dialetos Postgres, PHP real para LFI, shell real para injeção de comando, Jinja2 real para SSTI
- Convenção oracle agente-submete-flag para pontuação
- CLI de avaliação com comando único
- Auto-hospedável no Fly.io ou qualquer host Docker
Como os alvos são regenerados a cada execução via LLM (modelo gerador de escolha do pesquisador), não há artefato estático para modelos futuros ingerirem — abordando a preocupação da Anthropic de que 'este relatório, em si, provavelmente contribuirá para o problema.'
O benchmark usa um enquadramento de entropia de dois baldes separando eixos de recall de exploração de eixos cosméticos/realismo, que o autor acredita ser excessivamente amalgamado na literatura de benchmarks adjacente.
O financiamento para um artigo empírico completo (com resultados publicáveis-N) depende de parceria, mas o framework já está disponível.
📖 Leia a fonte completa: r/LocalLLaMA
👀 See Also

Injeção de Prompt Multimensagem: O Padrão de Ataque da "Criatura Fictícia" Contra o Claude
Um ataque que constrói uma regra fictícia ao longo de três mensagens e depois invoca um fantasma para ativá-la — cada mensagem é inofensiva isoladamente. O padrão está convergindo de forma independente entre atacantes.

Dados de ameaça de 91 mil interações com agentes de IA: abuso de ferramentas aumentou 6,4%, novos ataques multimodais
Análise de 91.284 interações de agentes de IA de fevereiro de 2026 mostra que o abuso de ferramentas/comandos aumentou 6,4% para 14,5%, com a escalada da cadeia de ferramentas como o padrão dominante. O envenenamento de RAG mudou para ataques de metadados (12,0%), e a injeção multimodal via imagens/PDFs surgiu em 2,3%.

Desenvolvedor Cria Sandbox Firecracker MicroVM para Segurança OpenClaw
Um desenvolvedor preocupado com a segurança de LLMs construiu um sandbox bare-metal usando microVMs Firecracker para isolar scripts OpenClaw, com cada script rodando em seu próprio kernel Linux com limite de 128MB de RAM e sem rede por padrão.
Análise Estática de 48 Aplicativos Gerados por IA: 90% Apresentavam Vulnerabilidades de Segurança
Um desenvolvedor analisou 48 repositórios públicos do GitHub criados com Lovable, Bolt e Replit. 90% tinham pelo menos uma vulnerabilidade. Problemas comuns: falhas de autenticação (44%), funções Postgres SECURITY DEFINER (33%), BOLA/IDOR (25%) e segredos commitados (25%).