PolyRange: LLM 생성 타겟을 사용한 오염 방지 공격적 AI 벤치마크

✍️ OpenClawRadar📅 게시일: May 31, 2026🔗 Source
PolyRange: LLM 생성 타겟을 사용한 오염 방지 공격적 AI 벤치마크
Ad

PolyRange v1.0은 웹 보안 에이전트를 위한 MIT 라이선스의 오염 방지 오펜시브 AI 벤치마크입니다. 훈련 코퍼스에 유출되는 정적 대상 대신, 각 PolyRange 배포는 연구자가 선택한 LLM에 의해 새롭게 생성됩니다. 이는 OpenAI, Anthropic, UK AISI가 공개적으로 요청한 '새로 구축된 작업' 기준을 충족합니다.

PolyRange가 해결하는 문제

Aether AI의 CEO인 저자는 기존 사이버-AI 벤치마크가 실험실이 필요로 하는 것을 측정하지 않는 두 가지 유형으로 나뉜다고 지적합니다. CTF 스타일 벤치마크(DVWA, NYU CTF Bench, CyberGym, AutoPenBench)는 정적 대상을 사용하여 미래 모델을 오염시키고, 버그 바운티 스타일 벤치마크(XBOW)는 방어 인프라가 정의되지 않습니다. PolyRange는 능동적 방어자를 포함한 프로덕션 수준 조건으로 이 격차를 해소합니다.

기술 사양

  • 84개 WSTG 기반 클래스: 12개 OWASP 테스트 가이드 범주 전체 포함
  • 두 가지 방어 계층: 능동적 방어자 조건 근사
  • 실제 백엔드: Postgres 방언, LFI용 실제 PHP, 명령 주입용 실제 셸, SSTI용 실제 Jinja2
  • 에이전트 제출 플래그 오라클 규칙: 점수 측정용
  • 단일 명령 평가 CLI
  • 자체 호스팅 가능: Fly.io 또는 모든 Docker 호스트에서

대상은 LLM(연구자가 선택한 생성 모델)을 통해 실행마다 재생성되므로, 미래 모델이 학습할 정적 아티팩트가 없습니다. 이는 '이 보고서 자체가 문제에 기여할 가능성이 높다'는 Anthropic의 우려를 해결합니다.

벤치마크는 익스플로잇-리콜 축과 미적/현실감 축을 분리하는 2-버킷 엔트로피 프레임워크를 사용하며, 저자는 인접한 벤치마크 문헌에서 이 개념이 과도하게 혼합되었다고 생각합니다.

전체 실증 논문(출판 가능한 N-결과 포함)을 위한 자금은 파트너십 지원에 달려 있지만, 프레임워크는 현재 사용 가능합니다.

📖 전체 출처 읽기: r/LocalLLaMA

Ad

👀 See Also

🦀
Security

以色列的虚假智库利用SEO投毒攻击AI聊天机器人

이스라엘이 가짜 싱크탱크인 하노버 연구소를 만들어 클로드와 제미니 같은 챗봇에 영향을 주기 위해 AI에 최적화된 100개 이상의 기사를 게시했습니다. 이 기사는 인용문을 포함한 신뢰할 수 있는 싱크탱크 보고서를 모방하여 이스라엘-팔레스타인 분쟁에 대한 AI 답변을 왜곡하려는 의도입니다.

OpenClawRadar
공급망 공격은 탐지를 우회하기 위해 보이지 않는 유니코드 코드를 사용합니다.
Security

공급망 공격은 탐지를 우회하기 위해 보이지 않는 유니코드 코드를 사용합니다.

연구진이 3월 3일부터 9일까지 GitHub에 업로드된 151개의 악성 패키지를 발견했습니다. 이 패키지들은 보이지 않는 유니코드 문자를 사용하여 악성 코드를 숨기고 있습니다. 이 공격은 GitHub, NPM, Open VSX 저장소를 대상으로 하며, 합법적으로 보이지만 숨겨진 페이로드를 포함하는 패키지를 사용합니다.

OpenClawRadar
메타 광고에 AI 생성 아동 성착취 콘텐츠 포함; 연구자들이 광고 라이브러리에서 50건 이상 발견
Security

메타 광고에 AI 생성 아동 성착취 콘텐츠 포함; 연구자들이 광고 라이브러리에서 50건 이상 발견

연구진은 메타의 광고 라이브러리에서 AI로 생성된 아동 성적 학대 콘텐츠(CSAM)가 포함된 유료 광고 50여 개를 발견했으며, 일부는 수천 개의 계정에 도달했습니다. WIRED의 문의 후 메타는 해당 광고를 삭제했습니다.

OpenClawRadar
ClawCare: AWS 키 유출 후 AI 코딩 에이전트를 위한 보안 가드
Security

ClawCare: AWS 키 유출 후 AI 코딩 에이전트를 위한 보안 가드

ClawCare는 Claude Code와 같은 AI 코딩 에이전트에서 실행 전 명령어를 스캔하여 대량 환경 덤프 및 리버스 셸과 같은 위험한 패턴을 차단하는 Python 도구입니다. 이 도구는 한 개발자가 에이전트를 통해 AWS 키를 실수로 유출한 사건 이후 만들어졌습니다.

OpenClawRadar