PolyRange: Benchmark de IA Ofensiva Resistente a Contaminação com Alvos Gerados por LLM

✍️ OpenClawRadar📅 Publicado: May 31, 2026🔗 Source
PolyRange: Benchmark de IA Ofensiva Resistente a Contaminação com Alvos Gerados por LLM
Ad

PolyRange v1.0 é um benchmark ofensivo de IA para agentes de segurança web, resistente à contaminação e licenciado sob MIT. Em vez de alvos estáticos que vazam para corpora de treinamento, cada implantação do PolyRange é gerada fresca pela escolha do pesquisador de LLM — satisfazendo o critério de 'tarefas recém-construídas' que OpenAI, Anthropic e UK AISI pediram publicamente.

O que o PolyRange aborda

O autor, CEO da Aether AI, observa que os benchmarks cibernéticos de IA existentes se enquadram em duas categorias que não medem o que os laboratórios precisam: benchmarks estilo CTF (DVWA, NYU CTF Bench, CyberGym, AutoPenBench) usam alvos estáticos que contaminam modelos futuros, e benchmarks estilo bug bounty (XBOW) têm infraestrutura defensiva indefinida. O PolyRange preenche essa lacuna com condições de formato de produção, incluindo defensores ativos.

Ad

Especificações técnicas

  • 84 classes derivadas do WSTG abrangendo todas as 12 categorias do guia de teste OWASP
  • Duas camadas de defesa aproximando condições de defensor ativo
  • Backends reais: dialetos Postgres, PHP real para LFI, shell real para injeção de comando, Jinja2 real para SSTI
  • Convenção oracle agente-submete-flag para pontuação
  • CLI de avaliação com comando único
  • Auto-hospedável no Fly.io ou qualquer host Docker

Como os alvos são regenerados a cada execução via LLM (modelo gerador de escolha do pesquisador), não há artefato estático para modelos futuros ingerirem — abordando a preocupação da Anthropic de que 'este relatório, em si, provavelmente contribuirá para o problema.'

O benchmark usa um enquadramento de entropia de dois baldes separando eixos de recall de exploração de eixos cosméticos/realismo, que o autor acredita ser excessivamente amalgamado na literatura de benchmarks adjacente.

O financiamento para um artigo empírico completo (com resultados publicáveis-N) depende de parceria, mas o framework já está disponível.

📖 Leia a fonte completa: r/LocalLLaMA

Ad

👀 See Also

Injeção de Prompt Multimensagem: O Padrão de Ataque da "Criatura Fictícia" Contra o Claude
Security

Injeção de Prompt Multimensagem: O Padrão de Ataque da "Criatura Fictícia" Contra o Claude

Um ataque que constrói uma regra fictícia ao longo de três mensagens e depois invoca um fantasma para ativá-la — cada mensagem é inofensiva isoladamente. O padrão está convergindo de forma independente entre atacantes.

OpenClawRadar
Dados de ameaça de 91 mil interações com agentes de IA: abuso de ferramentas aumentou 6,4%, novos ataques multimodais
Security

Dados de ameaça de 91 mil interações com agentes de IA: abuso de ferramentas aumentou 6,4%, novos ataques multimodais

Análise de 91.284 interações de agentes de IA de fevereiro de 2026 mostra que o abuso de ferramentas/comandos aumentou 6,4% para 14,5%, com a escalada da cadeia de ferramentas como o padrão dominante. O envenenamento de RAG mudou para ataques de metadados (12,0%), e a injeção multimodal via imagens/PDFs surgiu em 2,3%.

OpenClawRadar
Desenvolvedor Cria Sandbox Firecracker MicroVM para Segurança OpenClaw
Security

Desenvolvedor Cria Sandbox Firecracker MicroVM para Segurança OpenClaw

Um desenvolvedor preocupado com a segurança de LLMs construiu um sandbox bare-metal usando microVMs Firecracker para isolar scripts OpenClaw, com cada script rodando em seu próprio kernel Linux com limite de 128MB de RAM e sem rede por padrão.

OpenClawRadar
🦀
Security

Análise Estática de 48 Aplicativos Gerados por IA: 90% Apresentavam Vulnerabilidades de Segurança

Um desenvolvedor analisou 48 repositórios públicos do GitHub criados com Lovable, Bolt e Replit. 90% tinham pelo menos uma vulnerabilidade. Problemas comuns: falhas de autenticação (44%), funções Postgres SECURITY DEFINER (33%), BOLA/IDOR (25%) e segredos commitados (25%).

OpenClawRadar