GLiGuard : Modèle de modération de sécurité open source de 300M paramètres revendiquant un gain de vitesse 16x par rapport aux garde-fous LLM
Fastino Labs a open-sourcé GLiGuard, un modèle de modération de sécurité qui remplace les garde-fous génératifs par une approche de classification. Le modèle encodeur de 300M paramètres gère quatre tâches de modération en une seule passe avant, atteignant une précision comparable aux modèles décodeurs de 7 à 27 milliards de paramètres tout en réduisant la latence jusqu'à 16 fois. Les poids sont disponibles sous licence Apache 2.0 sur Hugging Face, avec une inférence également disponible sur Pioneer.
Pourquoi les garde-fous basés sur décodeur sont lents
Les garde-fous actuels de pointe (par exemple, Llama Guard) utilisent des transformeurs à décodeur seul qui génèrent des verdicts token par token. Cette génération séquentielle les rend lents et coûteux pour un filtrage de sécurité en temps réel. La plupart évaluent également les dimensions de sécurité séparément, ce qui cumule la latence. Avec 7 à 27 milliards de paramètres, ces modèles sont coûteux à exécuter à l'échelle de production.
L'approche encodeur de GLiGuard
GLiGuard reformule la modération comme une classification de texte. Il encode à la fois le texte d'entrée et les étiquettes de tâche, notant toutes les étiquettes simultanément en un seul passage. Ajouter plus de dimensions de sécurité (étiquettes) n'augmente pas le temps d'inférence. Le modèle gère quatre tâches concurrentes :
- Classification de sécurité — sûr / dangereux pour les prompts utilisateur et les réponses du modèle
- Détection de stratégie de jailbreak — 11 catégories (injection de prompt, contournement de jeu de rôle, override d'instruction, ingénierie sociale, etc.)
- Détection de catégorie de nuisance — 14 catégories (violence, contenu sexuel, discours de haine, PII, désinformation, sécurité des enfants, violation de droits d'auteur, etc.)
- Détection de refus — conformité ou refus, utilisé pour mesurer le sur-refus et la fausse conformité
Tous les quatre sont évalués ensemble, alors que les modèles décodeurs nécessiteraient des passes séquentielles ou plusieurs appels de modèle.
Benchmarks et performances
Sur neuf benchmarks de sécurité, GLiGuard égale ou dépasse des modèles 23 à 90 fois plus grands tout en étant jusqu'à 16 fois plus rapide. Aucun chiffre de précision spécifique n'est donné dans l'article, mais la performance est annoncée comme comparable aux garde-fous génératifs leaders.
À qui cela s'adresse
Équipes déployant des agents LLM ou des systèmes de chat ayant besoin d'un filtrage de sécurité en temps réel à faible latence et rentable à grande échelle.
📖 Lire la source complète : HN AI Agents
👀 See Also

Expérience de revue de code en face-à-face comparant trois outils d'IA sur la même base de code.
Une expérience vidéo teste Codex, Claude Code et Claude Code avec Sextant sur des tâches identiques de revue de code, avec Codex vérifiant les résultats et jugeant quel rapport est le plus utile. L'accent est mis sur la façon dont le flux de travail et la structure affectent ce que l'IA remarque et priorise.

htmLLM-124M v2 publié : Modèle d'autocomplétion HTML/Bootstrap spécialisé
LH-Tech-AI a publié htmLLM-124M v2, un modèle de 124 millions de paramètres spécialisé dans l'autocomplétion HTML/Bootstrap qui atteint une perte de validation de 0,91 et s'entraîne en ~8 heures sur une seule GPU T4.

Clooks : Un environnement d'exécution de hooks persistants pour Claude Code
Clooks est un démon HTTP persistant qui gère la distribution des hooks Claude Code sans création de processus, réduisant la latence de ~34,6 ms à ~0,31 ms par invocation. Il inclut la migration automatique, des gestionnaires LLM avec modèles de prompts, la résolution des dépendances et l'empaquetage des plugins.

L'outil de correction de mémoire OpenClaw résout la dégradation des performances.
Une nouvelle commande slash appelée /claw_memory_fix aide à nettoyer les fichiers mémoire d'OpenClaw lorsque l'agent oublie les identifiants ou les autorisations. L'outil met en œuvre des techniques provenant d'Alibaba, de l'ingénierie GitHub, de MemGPT et de recherches de janvier 2026 sur la gestion de la mémoire.