GLiGuard: Modelo de moderación de seguridad de 300M de parámetros de código abierto afirma una aceleración de 16x sobre las salvaguardas de LLM
Fastino Labs ha publicado como código abierto GLiGuard, un modelo de moderación de seguridad que reemplaza las barreras generativas con un enfoque de clasificación. El modelo de codificador de 300 millones de parámetros maneja cuatro tareas de moderación en una sola pasada hacia adelante, logrando una precisión comparable a modelos decodificadores de 7B–27B parámetros y reduciendo la latencia hasta 16 veces. Los pesos están disponibles bajo Apache 2.0 en Hugging Face, y la inferencia también está disponible en Pioneer.
Por qué las barreras basadas en decodificadores son lentas
Las barreras de seguridad de última generación actuales (por ejemplo, Llama Guard) utilizan transformadores solo decodificadores que generan veredictos token por token. Esta generación secuencial las hace lentas y costosas para el filtrado de seguridad en tiempo real. La mayoría también evalúa dimensiones de seguridad por separado, lo que aumenta la latencia. Con 7B a 27B parámetros, estos modelos son costosos de ejecutar a escala de producción.
El enfoque de codificador de GLiGuard
GLiGuard replantea la moderación como clasificación de texto. Codifica tanto el texto de entrada como las etiquetas de tarea juntos, puntuando todas las etiquetas simultáneamente en una sola pasada. Agregar más dimensiones de seguridad (etiquetas) no aumenta el tiempo de inferencia. El modelo maneja cuatro tareas concurrentes:
- Clasificación de seguridad — seguro / inseguro para avisos de usuario y respuestas del modelo
- Detección de estrategia de jailbreak — 11 categorías (inyección de avisos, evasión de roles, anulación de instrucciones, ingeniería social, etc.)
- Detección de categoría de daño — 14 categorías (violencia, contenido sexual, discurso de odio, PII, desinformación, seguridad infantil, violación de derechos de autor, etc.)
- Detección de rechazo — cumplimiento o rechazo, utilizado para medir el exceso de rechazo y el falso cumplimiento
Todas las cuatro se evalúan juntas, mientras que los modelos decodificadores requerirían pasos secuenciales o múltiples llamadas al modelo.
Evaluaciones comparativas y rendimiento
En nueve pruebas comparativas de seguridad, GLiGuard iguala o supera a modelos 23–90 veces su tamaño mientras funciona hasta 16 veces más rápido. No se proporcionan cifras de precisión específicas en el artículo, pero se afirma que el rendimiento es comparable al de las barreras de seguridad generativas líderes.
Para quién es
Equipos que implementan agentes LLM o sistemas de chat que necesitan un filtrado de seguridad en tiempo real de baja latencia y rentable a escala.
📖 Leer la fuente completa: HN AI Agents
👀 Ver también

Comparación de 14 Variantes del Agente de IA Claw en 10 Categorías
Una comparación detallada de 14 variantes populares de agentes de IA Claw, incluyendo OpenClaw, NanoClaw, NemoClaw, ZeroClaw, PicoClaw, Moltis, IronClaw y NullClaw, evaluadas a través de 53 subparámetros con clasificaciones compuestas y casos de uso ideales para cada una.

Reflect MCP Server Implementa el Documento de Reflexión para la Memoria Persistente del Agente de Codificación
Un desarrollador implementó el artículo Reflexion (Shinn et al., NeurIPS 2023) como un servidor MCP para dar a los agentes de codificación local una memoria persistente de sus errores. El sistema utiliza coincidencia de patrones basada en expresiones regulares en los mensajes de error y almacena las lecciones en SQLite con FTS5.

El Benchmark de Creatividad Humana: Separando Convergencia de Divergencia en la Evaluación Creativa de IA
Contra Labs presenta el Human Creativity Benchmark (HCB), un marco que distingue criterios objetivamente verificables (p. ej., adherencia a la indicación) del gusto subjetivo (p. ej., atractivo visual) en la evaluación de la IA generativa para trabajos creativos. El benchmark revela que ningún modelo actual es confiablemente correcto y controlable a la vez, abordando el colapso modal y la necesidad de resultados diferenciados.

Caddie: Alternativa de OpenClaw Basada en Slack Se Lanza la Próxima Semana
Caddie es una versión basada en Slack de OpenClaw que no requiere instalación local ni configuración MCP. Los usuarios lo autorizan a través del Directorio de Aplicaciones de Slack en 60 segundos, luego escriben comandos para automatizar tareas en Gmail, LinkedIn, CRM, calendario y más de 100 otras herramientas.