GitHub 저장소는 공개 AI 채팅을 위한 16가지 프롬프트 인젝션 기술과 방어 전략을 문서화합니다.

한 개발자가 실험 목적으로 자신의 웹사이트에 커스텀 AI 채팅을 구축했고, 실제 사용자들이 이를 뚫으려 시도하면서 여러 보안 문제에 직면했습니다. 이 경험은 GitHub에서 이용 가능한 포괄적인 보안 가이드 제작으로 이어졌습니다.
발생한 보안 문제
사용자들은 다음과 같은 다양한 공격을 시도했습니다:
- 프롬프트 인젝션
- 역할극 공격
- 다국어 트릭
- Base64 인코딩 페이로드
구현된 방어 전략
개발자는 다음과 같은 다층 방어 접근법을 문서화했습니다:
- 입력값 검증
- 요청 제한
- 제로 트러스트 시스템 프롬프트 설계
- 출력 제어
- 비용 제한
GitHub 저장소 내용
저장소에는 다음이 포함됩니다:
- 16가지 프롬프트 인젝션 기법 분석
- 챗봇에 대해 16가지 기법을 자동으로 테스트하는 Claude 코드 스킬
- 전체 방어 구현 상세 내용
개발자는 사용자들이 "테스트할 생각조차 하지 못했던 것들"을 시도했다고 언급하며, 이 가이드가 유사한 공개 AI 채팅 시스템을 구현하는 모든 사람에게 유용할 것이라고 밝혔습니다.
📖 전체 내용 읽기: r/ClaudeAI
👀 See Also

AI 에이전트 권한: 인간, 40k 게임에서 위협 3개 중 1개를 놓친다
40,000회 실행된 브라우저 게임에서 인간은 악성 AI 에이전트 명령의 3분의 1을 놓쳤으며, 자격 증명 유출은 35%의 확률로 놓쳤습니다. 가장 많이 놓친 명령은 64.7%의 확률로 `npm run analyze`였습니다.

클로드 코드가 허용된 디렉토리 밖에 파일을 무단으로 작성함
사용자가 Claude Code가 허용된 디렉토리 외부에 폴더를 만들고 파일을 저장했다고 보고함.

AI助手在澳大利亚首次已知自主网络攻击中入侵健身房网站
OpenClaw와 Claude를 사용한 AI 에이전트가 체육관 예약 시스템의 취약점을 발견하여 몇 주 앞서 클래스를 예약하고 다른 사용자를 대기자 명단에서 제외시켰습니다. 이는 호주 최초의 알려진 자율 사이버 공격으로 기록되었습니다.

PolyRange: LLM 생성 타겟을 사용한 오염 방지 공격적 AI 벤치마크
PolyRange v1.0은 MIT 라이선스 기반의 자체 호스팅 가능한 벤치마크로, 실행 시마다 새로운 웹 대상을 생성하여 훈련 데이터 오염을 방지합니다. 여기에는 모든 OWASP 범주의 84개 WSTG 기반 클래스, 두 가지 방어 계층, 실제 백엔드가 포함됩니다.