GLiGuard: открытая модель контроля безопасности с 300 миллионами параметров обещает ускорение в 16 раз по сравнению с LLM-фильтрами
Fastino Labs открыла исходный код GLiGuard — модели модерации безопасности, которая заменяет генеративные ограждения классификационным подходом. Энкодер с 300 млн параметров обрабатывает четыре задачи модерации за один прямой проход, достигая точности, сопоставимой с декодерными моделями на 7–27 млрд параметров, сокращая задержку до 16 раз. Веса доступны под лицензией Apache 2.0 на Hugging Face, инференс также доступен на Pioneer.
Почему декодерные ограждения медленны
Современные ограждения (например, Llama Guard) используют декодерные трансформеры, генерирующие вердикты токен за токеном. Такая последовательная генерация делает их медленными и дорогими для фильтрации в реальном времени. Большинство также оценивает аспекты безопасности отдельно, увеличивая задержку. При 7–27 млрд параметров такие модели дороги в масштабировании.
Подход энкодера GLiGuard
GLiGuard переосмысливает модерацию как классификацию текста. Он кодирует как входной текст, так и метки задач, оценивая все метки одновременно за один проход. Добавление новых аспектов безопасности (меток) не увеличивает время инференса. Модель обрабатывает четыре параллельные задачи:
- Классификация безопасности — безопасно / небезопасно для запросов пользователя и ответов модели
- Обнаружение стратегий джейлбрейка — 11 категорий (инъекция запросов, обход ролевой игры, переопределение инструкций, социальная инженерия и др.)
- Обнаружение категорий вреда — 14 категорий (насилие, сексуальный контент, разжигание ненависти, PII, дезинформация, безопасность детей, нарушение авторских прав и др.)
- Обнаружение отказов — соответствие или отказ, используется для измерения чрезмерных отказов и ложного согласия
Все четыре задачи оцениваются вместе, тогда как декодерные модели потребовали бы последовательных проходов или нескольких вызовов.
Тесты и производительность
На девяти бенчмарках безопасности GLiGuard сравнивается или превосходит модели в 23–90 раз больше, работая до 16 раз быстрее. В посте не приводятся конкретные показатели точности, но утверждается, что производительность сопоставима с ведущими генеративными ограждениями.
Для кого это
Для команд, развертывающих LLM-агентов или чат-системы, которым требуется низкая задержка и экономически эффективная фильтрация безопасности в реальном времени в масштабе.
📖 Источник: HN AI Agents
👀 Смотрите также

Разработчик создает язык программирования GALA с помощью Claude Code, отмечая, что строгая типизация повышает надежность кода, сгенерированного ИИ.
Разработчик создал GALA, функциональный язык программирования, который транслируется в Go, активно используя Claude Code. Язык включает запечатанные типы, исчерпывающее сопоставление с образцом, неизменяемость по умолчанию и монады, причём Claude помог реализовать вывод типов, преобразователи сопоставления с образцом и исправил более 40 ошибок.
OpenClaw AI-агент с 6 ролями, памятью и дизайном с учетом СДВГ: разбор ежедневных операций
Основатель-одиночка с СДВГ создал open-source AI-агента с 6 ролями (планировщик действий, аналитик, писатель, юрист, следователь, CRM), разделяющими память, автоматически генерирующими последующие действия и черновики из транскриптов.

Сервер MCP с открытым исходным кодом превращает Claude в автономного литературного агента для запросов к издателям
Узел агентской публикации — это MCP-сервер, позволяющий Клоду автоматически сверять рукописи с вишлистами литературных агентов, генерировать письма-запросы, форматировать по стандарту Шанна и вести журнал питчей — и всё это из локальных markdown-файлов.

Инструментарий для путешествий: навыки ИИ и серверы MCP для поиска баллов и миль
Репозиторий на GitHub предоставляет 7 навыков в формате markdown и 6 MCP-серверов, которые обучают Claude Code и OpenCode искать авиабилеты за мили в более чем 25 программах лояльности, сравнивать цены за наличные, получать информацию о балансах бонусных счетов, а также находить отели и паромы. Для настройки требуется клонировать репозиторий и запустить setup.sh.