PolyRange: Kontaminationsresistenter Offensiv-KI-Benchmark mit LLM-generierten Zielen

PolyRange v1.0 ist ein MIT-lizenzierter, kontaminationsresistenter Offensive-AI-Benchmark für Web-Sicherheitsagenten. Anstatt statischer Ziele, die in Trainingskorpora einfließen, wird jede PolyRange-Bereitstellung frisch vom LLM der Wahl des Forschers generiert – und erfüllt damit das Kriterium der 'neu konstruierten Aufgaben', das OpenAI, Anthropic und UK AISI öffentlich gefordert haben.
Was PolyRange adressiert
Der Autor, CEO von Aether AI, stellt fest, dass bestehende Cyber-AI-Benchmarks in zwei Kategorien fallen, die nicht messen, was Labore brauchen: CTF-artige Benchmarks (DVWA, NYU CTF Bench, CyberGym, AutoPenBench) verwenden statische Ziele, die zukünftige Modelle kontaminieren, und Bug-Bounty-artige Benchmarks (XBOW) haben keine definierte defensive Infrastruktur. PolyRange schließt diese Lücke mit produktionsnahen Bedingungen, einschließlich aktiver Verteidiger.
Technische Spezifikationen
- 84 WSTG-abgeleitete Klassen über alle 12 OWASP-Testleitfaden-Kategorien
- Zwei Verteidigungsstufen zur Annäherung an Bedingungen mit aktiven Verteidigern
- Echte Backends: Postgres-Dialekte, echtes PHP für LFI, echte Shell für Command Injection, echtes Jinja2 für SSTI
- Agent-reicht-Flag-Orakel-Konvention zur Bewertung
- Ein-Kommando-Evaluierungs-CLI
- Selbst hostbar auf Fly.io oder jedem Docker-Host
Da Ziele pro Durchlauf mittels LLM (generierendes Modell nach Wahl des Forschers) neu generiert werden, gibt es kein statisches Artefakt, das zukünftige Modelle aufnehmen könnten – dies adressiert die Sorge von Anthropic, dass 'dieser Bericht selbst wahrscheinlich zum Problem beitragen wird'.
Der Benchmark verwendet ein Zwei-Bucket-Entropie-Framework, das Exploit-Erinnerungs-Achsen von kosmetischen/Realismus-Achsen trennt, was der Autor in der angrenzenden Benchmark-Literatur für übermäßig vermischt hält.
Die Finanzierung eines vollständigen empirischen Papiers (mit veröffentlichbaren N-Ergebnissen) hängt von Partnerschaftsfinanzierung ab, aber das Framework ist jetzt verfügbar.
📖 Quelle: r/LocalLLaMA
👀 Siehe auch

Snowflake Cortex Code CLI-Schwachstelle ermöglichte Sandbox-Escape und Malware-Ausführung
Eine Sicherheitslücke in Snowflake Cortex Code CLI Version 1.0.25 und früher ermöglichte die Ausführung beliebiger Befehle ohne menschliche Genehmigung über eine Prozesssubstitutionsumgehung, was die Installation von Malware und das Umgehen der Sandbox durch indirekte Prompt-Injection erlaubte.

OpenClaw Slack-Sicherheit: Risiken und Lösungen bei der Offenlegung von API-Schlüsseln
OpenClaw Slack-Bereitstellungen können API-Schlüssel über Fehlermeldungen in Kanälen preisgeben, wobei in einem Bitsight-Bericht über 8.000 offengelegte Instanzen gefunden wurden. Die Quelle beschreibt drei spezifische Schwachstellen und bietet praktische Lösungen, einschließlich Änderungen am System-Prompt und Migration zu SlackClaw.

Claudes Sicherheitsüberprüfungsbefehl hat Einschränkungen für Produktionssysteme
Ein Entwickler fand Claudes Sicherheitsüberprüfungsbefehl hilfreich für grundlegende Validierungen wie MIME-Typen und Dateigrößenbeschränkungen, jedoch unzureichend für die Produktionshärtung gegen ausgeklügelte Bedrohungen. Die Lösung erforderte eine zweiwöchige Architekturüberholung, bei der die Dateiverarbeitung in einen eingeschränkten Worker mit begrenzten Berechtigungen ausgelagert wurde.

Warum interne RAG- und Doc-Chat-Tools Sicherheitsaudits nicht bestehen
Community diskutiert reale Sicherheits- und Compliance-Blocker, die RAG-Tools daran hindern, die Produktion zu erreichen.