GLiGuard : Modèle de modération de sécurité open source de 300M paramètres revendiquant un gain de vitesse 16x par rapport aux garde-fous LLM

✍️ OpenClawRadar📅 Publié: May 13, 2026🔗 Source
Ad

Fastino Labs a open-sourcé GLiGuard, un modèle de modération de sécurité qui remplace les garde-fous génératifs par une approche de classification. Le modèle encodeur de 300M paramètres gère quatre tâches de modération en une seule passe avant, atteignant une précision comparable aux modèles décodeurs de 7 à 27 milliards de paramètres tout en réduisant la latence jusqu'à 16 fois. Les poids sont disponibles sous licence Apache 2.0 sur Hugging Face, avec une inférence également disponible sur Pioneer.

Pourquoi les garde-fous basés sur décodeur sont lents

Les garde-fous actuels de pointe (par exemple, Llama Guard) utilisent des transformeurs à décodeur seul qui génèrent des verdicts token par token. Cette génération séquentielle les rend lents et coûteux pour un filtrage de sécurité en temps réel. La plupart évaluent également les dimensions de sécurité séparément, ce qui cumule la latence. Avec 7 à 27 milliards de paramètres, ces modèles sont coûteux à exécuter à l'échelle de production.

Ad

L'approche encodeur de GLiGuard

GLiGuard reformule la modération comme une classification de texte. Il encode à la fois le texte d'entrée et les étiquettes de tâche, notant toutes les étiquettes simultanément en un seul passage. Ajouter plus de dimensions de sécurité (étiquettes) n'augmente pas le temps d'inférence. Le modèle gère quatre tâches concurrentes :

  • Classification de sécurité — sûr / dangereux pour les prompts utilisateur et les réponses du modèle
  • Détection de stratégie de jailbreak — 11 catégories (injection de prompt, contournement de jeu de rôle, override d'instruction, ingénierie sociale, etc.)
  • Détection de catégorie de nuisance — 14 catégories (violence, contenu sexuel, discours de haine, PII, désinformation, sécurité des enfants, violation de droits d'auteur, etc.)
  • Détection de refus — conformité ou refus, utilisé pour mesurer le sur-refus et la fausse conformité

Tous les quatre sont évalués ensemble, alors que les modèles décodeurs nécessiteraient des passes séquentielles ou plusieurs appels de modèle.

Benchmarks et performances

Sur neuf benchmarks de sécurité, GLiGuard égale ou dépasse des modèles 23 à 90 fois plus grands tout en étant jusqu'à 16 fois plus rapide. Aucun chiffre de précision spécifique n'est donné dans l'article, mais la performance est annoncée comme comparable aux garde-fous génératifs leaders.

À qui cela s'adresse

Équipes déployant des agents LLM ou des systèmes de chat ayant besoin d'un filtrage de sécurité en temps réel à faible latence et rentable à grande échelle.

📖 Lire la source complète : HN AI Agents

Ad

👀 See Also

L'API AskFirst ajoute une couche d'approbation humaine pour les agents IA.
Tools

L'API AskFirst ajoute une couche d'approbation humaine pour les agents IA.

AskFirst est une API REST qui permet aux agents IA de faire une pause pour obtenir l'approbation humaine avant d'entreprendre des actions irréversibles. Elle fonctionne avec des modèles locaux, des API hébergées et n'importe quel framework, offrant des notifications par e-mail, des options d'approbation/refus et des journaux d'audit.

OpenClawRadar
Palissade : Un Nouvel Outil d'Orchestration pour le Code Claude avec Support des Canaux et Couches de Sécurité
Tools

Palissade : Un Nouvel Outil d'Orchestration pour le Code Claude avec Support des Canaux et Couches de Sécurité

Stockade est un outil d'orchestration construit autour du SDK Agent d'Anthropic qui fournit une gestion de session basée sur les canaux, un contrôle d'accès basé sur les rôles (RBAC) et des autorisations granulaires pour les agents IA. Il répond aux limitations d'OpenClaw et de NanoClaw en offrant plus de contrôle tout en maintenant la sécurité grâce à la conteneurisation et aux mandataires d'identification.

OpenClawRadar
claude-powerline v1.20 ajoute le mode tableau de bord TUI, les styles de barre de contexte et l'affichage des variables d'environnement.
Tools

claude-powerline v1.20 ajoute le mode tableau de bord TUI, les styles de barre de contexte et l'affichage des variables d'environnement.

claude-powerline v1.20 introduit un mode tableau de bord TUI qui remplace la simple ligne d'état par un panneau complet affichant les informations du modèle, l'utilisation du contexte avec barre de progression, les coûts, l'état git, et plus encore. La mise à jour ajoute 9 styles visuels de barre de progression pour l'utilisation du contexte et la capacité d'affichage des variables d'environnement.

OpenClawRadar
Claude Code charge paresseusement les schémas d'outils via ToolSearch pour économiser des tokens
Tools

Claude Code charge paresseusement les schémas d'outils via ToolSearch pour économiser des tokens

Claude Code diffère le chargement des schémas d'outils en envoyant uniquement les noms des outils au préalable et en nécessitant un appel ToolSearch pour récupérer les schémas avant utilisation. Cette architecture réduit considérablement la consommation de tokens.

OpenClawRadar