GLiGuard : Modèle de modération de sécurité open source de 300M paramètres revendiquant un gain de vitesse 16x par rapport aux garde-fous LLM

✍️ OpenClawRadar📅 Publié: May 13, 2026🔗 Source
Ad

Fastino Labs a open-sourcé GLiGuard, un modèle de modération de sécurité qui remplace les garde-fous génératifs par une approche de classification. Le modèle encodeur de 300M paramètres gère quatre tâches de modération en une seule passe avant, atteignant une précision comparable aux modèles décodeurs de 7 à 27 milliards de paramètres tout en réduisant la latence jusqu'à 16 fois. Les poids sont disponibles sous licence Apache 2.0 sur Hugging Face, avec une inférence également disponible sur Pioneer.

Pourquoi les garde-fous basés sur décodeur sont lents

Les garde-fous actuels de pointe (par exemple, Llama Guard) utilisent des transformeurs à décodeur seul qui génèrent des verdicts token par token. Cette génération séquentielle les rend lents et coûteux pour un filtrage de sécurité en temps réel. La plupart évaluent également les dimensions de sécurité séparément, ce qui cumule la latence. Avec 7 à 27 milliards de paramètres, ces modèles sont coûteux à exécuter à l'échelle de production.

Ad

L'approche encodeur de GLiGuard

GLiGuard reformule la modération comme une classification de texte. Il encode à la fois le texte d'entrée et les étiquettes de tâche, notant toutes les étiquettes simultanément en un seul passage. Ajouter plus de dimensions de sécurité (étiquettes) n'augmente pas le temps d'inférence. Le modèle gère quatre tâches concurrentes :

  • Classification de sécurité — sûr / dangereux pour les prompts utilisateur et les réponses du modèle
  • Détection de stratégie de jailbreak — 11 catégories (injection de prompt, contournement de jeu de rôle, override d'instruction, ingénierie sociale, etc.)
  • Détection de catégorie de nuisance — 14 catégories (violence, contenu sexuel, discours de haine, PII, désinformation, sécurité des enfants, violation de droits d'auteur, etc.)
  • Détection de refus — conformité ou refus, utilisé pour mesurer le sur-refus et la fausse conformité

Tous les quatre sont évalués ensemble, alors que les modèles décodeurs nécessiteraient des passes séquentielles ou plusieurs appels de modèle.

Benchmarks et performances

Sur neuf benchmarks de sécurité, GLiGuard égale ou dépasse des modèles 23 à 90 fois plus grands tout en étant jusqu'à 16 fois plus rapide. Aucun chiffre de précision spécifique n'est donné dans l'article, mais la performance est annoncée comme comparable aux garde-fous génératifs leaders.

À qui cela s'adresse

Équipes déployant des agents LLM ou des systèmes de chat ayant besoin d'un filtrage de sécurité en temps réel à faible latence et rentable à grande échelle.

📖 Lire la source complète : HN AI Agents

Ad

👀 See Also

HN : WUPHF — Wiki LLM style Karpathy avec Markdown + Git comme source de vérité
Tools

HN : WUPHF — Wiki LLM style Karpathy avec Markdown + Git comme source de vérité

WUPHF fournit une couche wiki pour les agents IA utilisant Markdown + Git pour la persistance, bleve (BM25) + SQLite pour la recherche, avec des journaux de faits par entité, des wikiliens et un cron de lint quotidien. Fonctionne en local sans dépendance à une base vectorielle pour l'instant.

OpenClawRadar
Exécution de Claude Code hors ligne sur un M3 Pro avec Qwen3.6 : 4 correctifs qui ont fonctionné
Tools

Exécution de Claude Code hors ligne sur un M3 Pro avec Qwen3.6 : 4 correctifs qui ont fonctionné

Quatre correctifs de variables d'environnement permettent à Claude Code de fonctionner entièrement hors ligne sur un M3 Pro avec Qwen3.6 (MoE, ~3B actifs), bouclant un cycle d'incident SRE de l'investigation à la PR sans que les données quittent la machine.

OpenClawRadar
Plan directeur : Un système de tâches terminal minimal conçu pour les utilisateurs de code Claude
Tools

Plan directeur : Un système de tâches terminal minimal conçu pour les utilisateurs de code Claude

Un développeur a créé master-plan, un plugin Claude Code avec quatre commandes slash qui gère les tâches directement dans le terminal en utilisant un fichier markdown et git. Le système capture les idées en plein milieu d'une session sans changer de contexte et détecte automatiquement les exécuteurs de tests.

OpenClawRadar
Sponsio : Garde-fous déterministes pour OpenClaw — Bloquer les appels d'outils « légaux mais inappropriés »
Tools

Sponsio : Garde-fous déterministes pour OpenClaw — Bloquer les appels d'outils « légaux mais inappropriés »

Outil open source qui se place à la frontière des outils, évaluant chaque appel avec des contrats de logique temporelle (~0,14 ms p50). Empêche les agents de modifier des fichiers en dehors du répertoire de travail, de forcer un push ou d'exécuter des migrations sur la mauvaise base de données.

OpenClawRadar