GLiGuard: открытая модель контроля безопасности с 300 миллионами параметров обещает ускорение в 16 раз по сравнению с LLM-фильтрами

✍️ OpenClawRadar📅 Опубликовано: 13 мая 2026 г.🔗 Source
Ad

Fastino Labs открыла исходный код GLiGuard — модели модерации безопасности, которая заменяет генеративные ограждения классификационным подходом. Энкодер с 300 млн параметров обрабатывает четыре задачи модерации за один прямой проход, достигая точности, сопоставимой с декодерными моделями на 7–27 млрд параметров, сокращая задержку до 16 раз. Веса доступны под лицензией Apache 2.0 на Hugging Face, инференс также доступен на Pioneer.

Почему декодерные ограждения медленны

Современные ограждения (например, Llama Guard) используют декодерные трансформеры, генерирующие вердикты токен за токеном. Такая последовательная генерация делает их медленными и дорогими для фильтрации в реальном времени. Большинство также оценивает аспекты безопасности отдельно, увеличивая задержку. При 7–27 млрд параметров такие модели дороги в масштабировании.

Ad

Подход энкодера GLiGuard

GLiGuard переосмысливает модерацию как классификацию текста. Он кодирует как входной текст, так и метки задач, оценивая все метки одновременно за один проход. Добавление новых аспектов безопасности (меток) не увеличивает время инференса. Модель обрабатывает четыре параллельные задачи:

  • Классификация безопасности — безопасно / небезопасно для запросов пользователя и ответов модели
  • Обнаружение стратегий джейлбрейка — 11 категорий (инъекция запросов, обход ролевой игры, переопределение инструкций, социальная инженерия и др.)
  • Обнаружение категорий вреда — 14 категорий (насилие, сексуальный контент, разжигание ненависти, PII, дезинформация, безопасность детей, нарушение авторских прав и др.)
  • Обнаружение отказов — соответствие или отказ, используется для измерения чрезмерных отказов и ложного согласия

Все четыре задачи оцениваются вместе, тогда как декодерные модели потребовали бы последовательных проходов или нескольких вызовов.

Тесты и производительность

На девяти бенчмарках безопасности GLiGuard сравнивается или превосходит модели в 23–90 раз больше, работая до 16 раз быстрее. В посте не приводятся конкретные показатели точности, но утверждается, что производительность сопоставима с ведущими генеративными ограждениями.

Для кого это

Для команд, развертывающих LLM-агентов или чат-системы, которым требуется низкая задержка и экономически эффективная фильтрация безопасности в реальном времени в масштабе.

📖 Источник: HN AI Agents

Ad

👀 Смотрите также

Mymir: Граф проектов с открытым исходным кодом для агентов программирования через MCP
Инструменты

Mymir: Граф проектов с открытым исходным кодом для агентов программирования через MCP

Mymir предоставляет агентам графовую карту проекта с зависимостями, решениями, критериями приемки и заметками о предыдущем выполнении, доставляемую через MCP, чтобы избежать повторного объяснения состояния между сессиями.

OpenClawRadar
Обход изоляции песочницы NemoClaw для локального агента Nemotron 9B
Инструменты

Обход изоляции песочницы NemoClaw для локального агента Nemotron 9B

Разработчик обошёл изоляцию песочницы NemoClaw, чтобы запустить полностью локального агента с использованием Nemotron 9B и вызовом инструментов на одной видеокарте RTX 5090. Подход включал настройку iptables, пользовательский TCP-ретранслятор и перевод вызовов инструментов в реальном времени.

OpenClawRadar
FUTO Swipe: Модели набора текста свайпом с открытым исходным кодом достигают точности крупных технологических компаний
Инструменты

FUTO Swipe: Модели набора текста свайпом с открытым исходным кодом достигают точности крупных технологических компаний

FUTO выпускает модели свайп-тайпинга с открытым исходным кодом и набор данных из 1 млн свайпов. Энкодер (635K параметров) + ContextLM (1.5M) + декодер (304K) достигают ~4% частоты ошибок в топ-4. Полностью офлайн в FUTO Keyboard.

OpenClawRadar
Навыки Claude для имитации среды дизайн-студии
Инструменты

Навыки Claude для имитации среды дизайн-студии

Дизайнер делится двумя навыками для Claude: один имитирует работу в студии с коллегами и методами дизайна, другой добавляет «строгую игру» для творчества.

OpenClawRadar