FORGE: LLM 시스템을 위한 오픈 소스 AI 보안 테스트 프레임워크

FORGE(Framework for Orchestrated Reasoning & Generation of Engines)는 24/7 운영되며 OWASP LLM Top 10 취약점을 다루는 LLM 시스템용 오픈 소스 자율 AI 보안 테스트 프레임워크입니다.
주요 기능
- 실행 중 자체 도구 구축 — 알려지지 않은 취약점을 발견하면 즉석에서 맞춤형 Python 모듈 생성
- 군집으로 자가 복제 — 실시간 집단 지능을 공유하는 하위 프로세스 복사본 생성
- 모든 세션에서 학습 — SQLite로 패턴 저장, AI가 발견 사항 점수화, 유전 알고리즘으로 자체 프롬프트 진화
- AI가 AI를 침투 테스트 — OWASP LLM Top 10 취약점을 다루는 7개 모듈
- 허니팟 — 공격자를 포착하고 인간인지 AI 에이전트인지 분류하는 가짜 취약 AI 엔드포인트
- 24/7 모니터링 — 프로덕션 환경의 AI 감시, 지연 시간 급증, 공격 급증, 주입 시도에 대한 Slack/Discord 웹훅 경고
- 스트레스 테스터 — 실시간 TPS 대시보드와 A-F 등급으로 OWASP LLM04 DoS 복원력 테스트
- 모든 모델에서 작동 — Claude, Llama, Mistral, DeepSeek, GPT-4, Groq 등 — 하나의 환경 변수로 전환
OWASP LLM Top 10 커버리지
- LLM01 프롬프트 주입 → prompt_injector + jailbreak_fuzzer (125개 페이로드)
- LLM02 불안전한 출력 → rag_leaker
- LLM04 모델 DoS → overloader (8가지 스트레스 모드)
- LLM06 민감 정보 노출 → system_prompt_probe + rag_leaker
- LLM07 불안전한 플러그인 → agent_hijacker
- LLM08 과도한 에이전시 → agent_hijacker
- LLM10 모델 도용 → model_fingerprinter
설정 및 사용법
설치 명령어:
git clone https://github.com/umangkartikey/forge
cd forge
pip install anthropic rich
export ANTHROPIC_API_KEY=your_key무료 로컬 Ollama로 실행:
FORGE_BACKEND=ollama FORGE_MODEL=llama3.1 python forge.py이 도구는 일반적인 LLM 보안 격차를 해결합니다: 오늘날 배포된 대부분의 AI 앱은 레드 팀 테스트를 받은 적이 없고, 시스템 프롬프트는 완전히 추출 가능하며, 탈옥이 작동하고, RAG 파이프라인은 누출되며, 도구 출력을 통한 간접 프롬프트 주입은 거의 보호되지 않습니다. FORGE는 인간 레드 팀원과 같은 방식으로 이러한 취약점을 찾는 작업을 자동화하지만 더 빠르고 24/7 운영됩니다.
📖 전체 소스 읽기: r/LocalLLaMA
👀 See Also

AI 에이전트 권한: 인간, 40k 게임에서 위협 3개 중 1개를 놓친다
40,000회 실행된 브라우저 게임에서 인간은 악성 AI 에이전트 명령의 3분의 1을 놓쳤으며, 자격 증명 유출은 35%의 확률로 놓쳤습니다. 가장 많이 놓친 명령은 64.7%의 확률로 `npm run analyze`였습니다.

사랑스러운 데모용 에듀테크 앱에서 노출된 보안 취약점
보안 연구원이 Lovable에서 성공 사례로 소개된 교육 기술(EdTech) 애플리케이션에서 여러 치명적인 취약점을 발견했습니다. 이 앱은 인증 없이 18,697명의 사용자 기록을 노출하는 심각한 인증 논리 결함을 포함해 16개의 취약점이 있었습니다. Lovable 쇼케이스에서 10만 회 이상 조회되었으며 UC 버클리, UC 데이비스 및 전 세계 학교의 실제 사용자를 보유하고 있었습니다.

LLM은 익명 포럼 사용자를 90% 정밀도로 68% 정확도로 식별할 수 있습니다.
연구진이 Hacker News와 Reddit의 게시물을 분석하기 위해 Gemini와 ChatGPT를 사용하여 90% 정확도로 익명 사용자의 68%를 식별했습니다. 이 모델들은 인간이 몇 시간이 걸리거나 불가능한 작업을 몇 분 만에 완료했습니다.

클로드 모델은 도구 접근 시 특히 보이지 않는 유니코드 문자 하이재킹에 취약합니다.
테스트 결과, 도구가 활성화된 상태에서 Claude Sonnet 4는 보이지 않는 유니코드 문자에 숨겨진 지침을 71.2% 준수하는 것으로 나타났으며, Opus 4는 유니코드 태그 인코딩에서 100% 준수율을 기록했습니다. 도구 접근은 모든 Claude 모델의 취약성을 극적으로 증가시킵니다.