GLiGuard: Modelo de moderación de seguridad de 300M de parámetros de código abierto afirma una aceleración de 16x sobre las salvaguardas de LLM

✍️ OpenClawRadar📅 Publicado: 13 de mayo de 2026🔗 Source
Ad

Fastino Labs ha publicado como código abierto GLiGuard, un modelo de moderación de seguridad que reemplaza las barreras generativas con un enfoque de clasificación. El modelo de codificador de 300 millones de parámetros maneja cuatro tareas de moderación en una sola pasada hacia adelante, logrando una precisión comparable a modelos decodificadores de 7B–27B parámetros y reduciendo la latencia hasta 16 veces. Los pesos están disponibles bajo Apache 2.0 en Hugging Face, y la inferencia también está disponible en Pioneer.

Por qué las barreras basadas en decodificadores son lentas

Las barreras de seguridad de última generación actuales (por ejemplo, Llama Guard) utilizan transformadores solo decodificadores que generan veredictos token por token. Esta generación secuencial las hace lentas y costosas para el filtrado de seguridad en tiempo real. La mayoría también evalúa dimensiones de seguridad por separado, lo que aumenta la latencia. Con 7B a 27B parámetros, estos modelos son costosos de ejecutar a escala de producción.

Ad

El enfoque de codificador de GLiGuard

GLiGuard replantea la moderación como clasificación de texto. Codifica tanto el texto de entrada como las etiquetas de tarea juntos, puntuando todas las etiquetas simultáneamente en una sola pasada. Agregar más dimensiones de seguridad (etiquetas) no aumenta el tiempo de inferencia. El modelo maneja cuatro tareas concurrentes:

  • Clasificación de seguridad — seguro / inseguro para avisos de usuario y respuestas del modelo
  • Detección de estrategia de jailbreak — 11 categorías (inyección de avisos, evasión de roles, anulación de instrucciones, ingeniería social, etc.)
  • Detección de categoría de daño — 14 categorías (violencia, contenido sexual, discurso de odio, PII, desinformación, seguridad infantil, violación de derechos de autor, etc.)
  • Detección de rechazo — cumplimiento o rechazo, utilizado para medir el exceso de rechazo y el falso cumplimiento

Todas las cuatro se evalúan juntas, mientras que los modelos decodificadores requerirían pasos secuenciales o múltiples llamadas al modelo.

Evaluaciones comparativas y rendimiento

En nueve pruebas comparativas de seguridad, GLiGuard iguala o supera a modelos 23–90 veces su tamaño mientras funciona hasta 16 veces más rápido. No se proporcionan cifras de precisión específicas en el artículo, pero se afirma que el rendimiento es comparable al de las barreras de seguridad generativas líderes.

Para quién es

Equipos que implementan agentes LLM o sistemas de chat que necesitan un filtrado de seguridad en tiempo real de baja latencia y rentable a escala.

📖 Leer la fuente completa: HN AI Agents

Ad

👀 Ver también

Comparación de 14 Variantes del Agente de IA Claw en 10 Categorías
Herramientas

Comparación de 14 Variantes del Agente de IA Claw en 10 Categorías

Una comparación detallada de 14 variantes populares de agentes de IA Claw, incluyendo OpenClaw, NanoClaw, NemoClaw, ZeroClaw, PicoClaw, Moltis, IronClaw y NullClaw, evaluadas a través de 53 subparámetros con clasificaciones compuestas y casos de uso ideales para cada una.

OpenClawRadar
Reflect MCP Server Implementa el Documento de Reflexión para la Memoria Persistente del Agente de Codificación
Herramientas

Reflect MCP Server Implementa el Documento de Reflexión para la Memoria Persistente del Agente de Codificación

Un desarrollador implementó el artículo Reflexion (Shinn et al., NeurIPS 2023) como un servidor MCP para dar a los agentes de codificación local una memoria persistente de sus errores. El sistema utiliza coincidencia de patrones basada en expresiones regulares en los mensajes de error y almacena las lecciones en SQLite con FTS5.

OpenClawRadar
El Benchmark de Creatividad Humana: Separando Convergencia de Divergencia en la Evaluación Creativa de IA
Herramientas

El Benchmark de Creatividad Humana: Separando Convergencia de Divergencia en la Evaluación Creativa de IA

Contra Labs presenta el Human Creativity Benchmark (HCB), un marco que distingue criterios objetivamente verificables (p. ej., adherencia a la indicación) del gusto subjetivo (p. ej., atractivo visual) en la evaluación de la IA generativa para trabajos creativos. El benchmark revela que ningún modelo actual es confiablemente correcto y controlable a la vez, abordando el colapso modal y la necesidad de resultados diferenciados.

OpenClawRadar
Caddie: Alternativa de OpenClaw Basada en Slack Se Lanza la Próxima Semana
Herramientas

Caddie: Alternativa de OpenClaw Basada en Slack Se Lanza la Próxima Semana

Caddie es una versión basada en Slack de OpenClaw que no requiere instalación local ni configuración MCP. Los usuarios lo autorizan a través del Directorio de Aplicaciones de Slack en 60 segundos, luego escriben comandos para automatizar tareas en Gmail, LinkedIn, CRM, calendario y más de 100 otras herramientas.

OpenClawRadar