PolyRange: Benchmark Ofensivo de IA Resistente a la Contaminación con Objetivos Generados por LLM

PolyRange v1.0 es un benchmark de ofensiva de IA para agentes de seguridad web, con licencia MIT y resistente a la contaminación. A diferencia de los objetivos estáticos que se filtran en los corpus de entrenamiento, cada despliegue de PolyRange es generado de nuevo por el LLM que el investigador elija, cumpliendo con el criterio de 'tareas recién construidas' que OpenAI, Anthropic y UK AISI han solicitado públicamente.
Qué aborda PolyRange
El autor, CEO de Aether AI, señala que los benchmarks existentes de cibernética para IA se dividen en dos categorías que no miden lo que los laboratorios necesitan: los benchmarks estilo CTF (DVWA, NYU CTF Bench, CyberGym, AutoPenBench) utilizan objetivos estáticos que contaminan los modelos futuros, y los benchmarks estilo bug bounty (XBOW) tienen infraestructura defensiva indefinida. PolyRange cierra esta brecha con condiciones de producción, incluyendo defensores activos.
Especificaciones técnicas
- 84 clases derivadas de WSTG que abarcan las 12 categorías de la guía de pruebas de OWASP
- Dos niveles de defensa que aproximan condiciones de defensor activo
- Backends reales: dialectos de Postgres, PHP real para LFI, shell real para inyección de comandos, Jinja2 real para SSTI
- Convención de oráculo agente-envía-bandera para la puntuación
- CLI de evaluación con un solo comando
- Autohospedable en Fly.io o cualquier host Docker
Debido a que los objetivos se regeneran por ejecución mediante LLM (el modelo generador que elija el investigador), no hay un artefacto estático que los modelos futuros puedan ingerir, abordando la preocupación de Anthropic de que 'este informe, en sí mismo, probablemente contribuirá al problema'.
El benchmark utiliza un marco de entropía de dos cubos que separa los ejes de recuerdo de explotación de los ejes cosméticos/realistas, lo que el autor considera sobre-conflacionado en la literatura de benchmarks adyacente.
El financiamiento para un artículo empírico completo (con resultados publicables) depende de financiamiento de socios, pero el marco está disponible ahora.
📖 Lee la fuente completa: r/LocalLLaMA
👀 Ver también

Envoltorio de Contenido Externo de OpenClaw para la Defensa contra Inyección de Solicitudes
OpenClaw utiliza un envoltorio de contenido externo que etiqueta automáticamente los resultados de búsqueda web, respuestas de API y contenido similar con advertencias de que no es confiable, preparando al LLM para ser escéptico y más propenso a rechazar instrucciones maliciosas.

Claude Code escribe archivos fuera del directorio permitido sin permiso
Un usuario informa que Claude Code creó carpetas y guardó archivos en C:\Users\...\Documents\Surge XT\Patches\ sin permiso explícito, usando os.makedirs.

Análisis de Seguridad de Agentes de IA Revela Modelo de Confianza Roto y Altas Tasas de Vulnerabilidad
Un análisis de seguridad de agentes de IA muestra que el modelo de confianza fundamental está roto, con el 49% de los paquetes MCP presentando hallazgos de seguridad y la inyección indirecta logrando tasas de éxito de ataque del 36-98% en los modelos más avanzados.

Gancho Inteligente de Permisos de Bash para Claude Code Previene la Omisión de Comandos Compuestos
Un gancho PreToolUse de Python aborda una brecha de seguridad en el sistema de permisos de Claude Code, donde los comandos compuestos de bash podían eludir los patrones de permitir/denegar. El script descompone los comandos en subcomandos y verifica cada uno individualmente contra las reglas de permisos existentes.