PromptForest: Обнаружение инъекций промптов с приоритетом локальности и учетом неопределенности

✍️ OpenClawRadar📅 Опубликовано: 14 февраля 2026 г.🔗 Source
PromptForest: Обнаружение инъекций промптов с приоритетом локальности и учетом неопределенности
Ad

PromptForest — это новая библиотека с приоритетом локальности, созданная для решения проблем, часто встречающихся в современных системах обнаружения инъекций запросов. Она направлена на эффективное обнаружение инъекций запросов и джейлбрейков с учетом неопределенности, чтобы избежать избыточной уверенности в результатах. Такой подход отличает ее от традиционных систем, поскольку она сохраняет производительность, одновременно предоставляя более детализированные выводы.

Ad

Ключевые детали

Одной из основных проблем существующих детекторов инъекций является зависимость от крупных моделей, таких как Llama 2 8B и Qualifire Sentinel 0.6B. Эти модели не только медленны, но и их избыточная уверенность в результатах может привести к ложным срабатываниям, что подрывает их надежность в производственных сценариях. Осознавая эти ограничения, PromptForest использует метод голосования, состоящий из трех меньших специализированных моделей:

  • Llama Prompt Guard (86M): Демонстрирует наивысшую предсобранную Ошибку Калибровки Ожидания (ECE) в своем классе веса.
  • Vijil Dome (ModernBERT): Предоставляет наивысшую точность на параметр.
  • Custom XGBoost: Обучена на встраиваниях для архитектурного разнообразия.

Эти модели коллективно используют метод мягкого голосования с учетом веса для определения результатов, где более точные модели имеют большее влияние. Этот метод упрощает процесс принятия решений при высокой точности и согласованности.

Бенчмаркинг показывает, что PromptForest работает со средней задержкой около 141 мс, по сравнению с 225 мс для Qualifire Sentinel v2, при этом обеспечивая сопоставимую точность в 90% против их 97%. Калибровочная ECE также показывает хорошие результаты и составляет 0.070 против 0.096 у Sentinel. Пропускная способность также впечатляет, примерно 27 запросов обрабатывается в секунду на потребительском GPU с помощью pfranger CLI.

Для тестирования и реализации разработчики могут экспериментировать с PromptForest на Google Colab или проверять запросы с помощью инструмента PFRanger, который работает полностью локально. PFRanger использует параллелизацию для повышения скорости и пропускной способности.

📖 Читать полный источник: r/LocalLLaMA

Ad

👀 Смотрите также

Клод Код АФК-агент: Запуск автономных работников с поддержкой Discord через плагин Teams
Инструменты

Клод Код АФК-агент: Запуск автономных работников с поддержкой Discord через плагин Teams

Используйте официальный плагин каналов и командного агента с переменной окружения CLAUDE_CODE_EXPERIMENTAL_AGENT_TEAMS=1, чтобы запускать отдельных исполнителей из Discord. Включает полный файл CLAUDE.md для ведущего агента, который распределяет задачи, никогда не выполняет их сам и принудительно завершает молчащих исполнителей через 60 минут.

OpenClawRadar
Навык OpenClaw сокращает количество токенов в дереве доступности с 600 тысяч до 1,3 тысячи.
Инструменты

Навык OpenClaw сокращает количество токенов в дереве доступности с 600 тысяч до 1,3 тысячи.

Разработчик создал навык OpenClaw, который использует ранжирование элементов на основе машинного обучения для обрезки деревьев доступности, сокращая slickdeals.com с ~598 тыс. токенов до ~1,3 тыс. токенов, сохраняя только ~50 наиболее значимых интерактивных элементов.

OpenClawRadar
MoltPoker.xyz: Техасский Холдем с виртуальными фишками для ИИ-агентов
Инструменты

MoltPoker.xyz: Техасский Холдем с виртуальными фишками для ИИ-агентов

MoltPoker.xyz — это платформа, на которой ИИ-агенты могут играть в No-Limit Texas Hold'em друг против друга, используя WebSocket-соединения, с возможностью пересмотра раздач и видимой логикой агентов во время живых игр.

OpenClawRadar
Google Research представляет TurboQuant для сжатия моделей искусственного интеллекта
Инструменты

Google Research представляет TurboQuant для сжатия моделей искусственного интеллекта

Google Research представила TurboQuant — алгоритм сжатия, который уменьшает размер моделей ИИ без потери точности. Он решает проблему накладных расходов памяти при векторном квантовании и улучшает производительность кэша ключ-значение.

OpenClawRadar