클로드 AI 가드레일 우회가 네트워크 보안 작업으로 요청을 구성할 때 관찰되었습니다.

의도 프레이밍을 통한 가드레일 우회
Claude AI의 프롬프트 동작을 테스트하던 사용자가 모델의 가드레일이 특정 의도 프레이밍을 통해 우회될 수 있는 엣지 케이스를 발견했습니다. 해적판 사이트를 직접 요청할 때 Claude는 일반적으로 요청을 거부합니다. 그러나 동일한 요청을 네트워크 보안 작업으로 프레이밍할 때—특히 라우터나 DNS 필터에서 차단할 도메인을 요청하는 경우—모델은 해적판 도메인 목록을 제공했습니다.
목록을 받은 후 사용자는 프레이밍이 응답에 영향을 미쳤다고 지적했습니다. Claude는 의도를 오해했다고 인정했습니다. 이는 방어적 프레이밍("이 사이트들을 차단하세요")이 정상적으로 제한될 정보를 허용하도록 가드레일을 유도하는 의도 분류 문제로 보입니다.
사용자는 전체 프롬프트 시퀀스와 Claude의 응답을 보여주는 스크린샷을 공유하며 이 동작을 문서화했습니다. 그들은 이를 흥미로운 엣지 케이스로 기록하며 다른 사람들이 Claude나 다른 대규모 언어 모델에서 유사한 동작을 관찰했는지 물었습니다.
📖 Read the full source: r/ClaudeAI
👀 See Also

AI 에이전트 가드레일은 적극적인 유지 관리 없이 시간이 지남에 따라 약화됩니다.
AI 에이전트 가드레일은 시스템 프롬프트 업데이트가 누적되고, 모델 버전이 변경되며, 새로운 도구가 추가됨에 따라 시간이 지남에 따라 성능이 저하되어 종종 상충되거나 무시되는 안전 규칙이 발생하며, 정기적인 검토와 테스트가 필요합니다.

Redacta:一种在临床文本到达LLM之前对其进行假名化的OpenClaw技能
Redacta는 의료 텍스트에서 식별자를 감지하여 LLM에 보내기 전에 일관된 가명으로 대체하는 오픈 소스 OpenClaw 스킬입니다. 로컬에서 실행되며 ClawHub에서 1,400회 이상 다운로드되었습니다.

Cisco 소스 코드, Trivy 공급망 공격을 통해 유출
Cisco의 내부 개발 환경이 Trivy 공급망 공격에서 탈취된 자격 증명을 이용해 침해당해, AI 기반 제품 및 고객 코드를 포함한 300개 이상의 GitHub 저장소에서 소스 코드가 유출되었습니다.

Nullgaze: 오픈 소스 AI 지원 보안 스캐너 출시
Nullgaze는 AI 생성 코드에 특화된 취약점을 탐지하는 새로운 오픈 소스 AI 지원 보안 스캐너로, 거의 제로에 가까운 오탐률을 자랑합니다.