FORGE : Cadre de test de sécurité IA open source pour les systèmes LLM

FORGE (Framework for Orchestrated Reasoning & Generation of Engines) est un cadre de test de sécurité IA autonome open source pour les systèmes LLM qui fonctionne 24h/24 et 7j/7 et couvre les vulnérabilités OWASP LLM Top 10.
Caractéristiques principales
- Construit ses propres outils en cours d'exécution — génère des modules Python personnalisés sur place lorsqu'il rencontre des vulnérabilités inconnues
- Se réplique en essaim — crée des copies de sous-processus qui partagent un esprit collectif en temps réel
- Apprend de chaque session — utilise SQLite pour stocker les motifs, l'IA évalue les découvertes, et les algorithmes génétiques font évoluer ses propres prompts
- Pentesting IA par IA — 7 modules couvrant les vulnérabilités OWASP LLM Top 10
- Honeypot — point de terminaison IA vulnérable factice qui capture les attaquants et classe s'ils sont humains ou agents IA
- Surveillance 24h/24 — surveille l'IA en production, alerte sur les pics de latence, les rafales d'attaques et les tentatives d'injection via webhook Slack/Discord
- Testeur de stress — test de résistance OWASP LLM04 DoS avec tableau de bord TPS en direct et note de A à F
- Fonctionne sur n'importe quel modèle — Claude, Llama, Mistral, DeepSeek, GPT-4, Groq, n'importe lequel — une variable d'environnement pour changer
Couverture OWASP LLM Top 10
- LLM01 Injection de Prompt → prompt_injector + jailbreak_fuzzer (125 charges utiles)
- LLM02 Sortie Insecure → rag_leaker
- LLM04 DoS du Modèle → overloader (8 modes de stress)
- LLM06 Divulgation Sensible → system_prompt_probe + rag_leaker
- LLM07 Plugin Insecure → agent_hijacker
- LLM08 Agence Excessive → agent_hijacker
- LLM10 Vol de Modèle → model_fingerprinter
Installation et Utilisation
Commandes d'installation :
git clone https://github.com/umangkartikey/forge
cd forge
pip install anthropic rich
export ANTHROPIC_API_KEY=your_keyExécuter avec Ollama local gratuitement :
FORGE_BACKEND=ollama FORGE_MODEL=llama3.1 python forge.pyL'outil aborde les lacunes de sécurité LLM courantes : la plupart des applications IA déployées aujourd'hui n'ont jamais été testées en équipe rouge, les prompts système sont entièrement extractibles, les jailbreaks fonctionnent, les pipelines RAG fuient, et l'injection de prompt indirecte via les sorties d'outils est presque universellement non protégée. FORGE automatise la recherche de ces vulnérabilités de la même manière qu'un testeur humain en équipe rouge le ferait, mais plus rapidement et fonctionnant 24h/24 et 7j/7.
📖 Lire la source complète : r/LocalLLaMA
👀 See Also
Fonctionnement du tatouage de texte par IA : clés secrètes, choix de mots verts/rouges et détection
Le filigrane de texte dissimule des marques dans les choix de mots, pas dans les caractères. Une clé secrète oriente la sélection de mots vers le vert, et la détection compte les mots verts pour repérer le texte généré par IA.

Terrain de jeu open-source pour la mise à l'épreuve d'agents IA avec des exploits publiés
Fabraix a ouvert en accès libre un environnement en direct pour tester la résistance des défenses des agents IA via des défis adversariaux. Chaque défi déploie un agent en direct avec de vrais outils et des invites système publiées, les transcriptions des conversations gagnantes et les journaux des garde-fous étant documentés publiquement.

L'IA brise les deux cultures de vulnérabilité : divulgation coordonnée contre "les bogues sont des bogues" de Linux
Jeff Kaufman analyse comment la découverte de vulnérabilités par l'IA fracture à la fois la divulgation coordonnée et la culture des correctifs discrets de Linux, en utilisant la récente vulnérabilité Copy Fail (ESP) comme étude de cas.

Piratage du chiffrement de la médiation AppLovin : l'empreinte numérique des appareils contourne l'ATT
Le reverse engineering a révélé que le chiffrement personnalisé d'AppLovin utilise un sel constant + une clé SDK, un PRNG SplitMix64, et aucune authentification. Les requêtes déchiffrées transportent environ 50 champs sur l'appareil (modèle matériel, taille d'écran, locale, heure de démarrage, etc.) même lorsque ATT est refusé, permettant une ré-identification déterministe entre applications.