PromptForest: Обнаружение инъекций промптов с приоритетом локальности и учетом неопределенности

PromptForest — это новая библиотека с приоритетом локальности, созданная для решения проблем, часто встречающихся в современных системах обнаружения инъекций запросов. Она направлена на эффективное обнаружение инъекций запросов и джейлбрейков с учетом неопределенности, чтобы избежать избыточной уверенности в результатах. Такой подход отличает ее от традиционных систем, поскольку она сохраняет производительность, одновременно предоставляя более детализированные выводы.
Ключевые детали
Одной из основных проблем существующих детекторов инъекций является зависимость от крупных моделей, таких как Llama 2 8B и Qualifire Sentinel 0.6B. Эти модели не только медленны, но и их избыточная уверенность в результатах может привести к ложным срабатываниям, что подрывает их надежность в производственных сценариях. Осознавая эти ограничения, PromptForest использует метод голосования, состоящий из трех меньших специализированных моделей:
- Llama Prompt Guard (86M): Демонстрирует наивысшую предсобранную Ошибку Калибровки Ожидания (ECE) в своем классе веса.
- Vijil Dome (ModernBERT): Предоставляет наивысшую точность на параметр.
- Custom XGBoost: Обучена на встраиваниях для архитектурного разнообразия.
Эти модели коллективно используют метод мягкого голосования с учетом веса для определения результатов, где более точные модели имеют большее влияние. Этот метод упрощает процесс принятия решений при высокой точности и согласованности.
Бенчмаркинг показывает, что PromptForest работает со средней задержкой около 141 мс, по сравнению с 225 мс для Qualifire Sentinel v2, при этом обеспечивая сопоставимую точность в 90% против их 97%. Калибровочная ECE также показывает хорошие результаты и составляет 0.070 против 0.096 у Sentinel. Пропускная способность также впечатляет, примерно 27 запросов обрабатывается в секунду на потребительском GPU с помощью pfranger CLI.
Для тестирования и реализации разработчики могут экспериментировать с PromptForest на Google Colab или проверять запросы с помощью инструмента PFRanger, который работает полностью локально. PFRanger использует параллелизацию для повышения скорости и пропускной способности.
📖 Читать полный источник: r/LocalLLaMA
👀 Смотрите также

Инструмент Claude-context-lint анализирует избыточное использование токенов в проектах Claude Code.
Новый инструмент claude-context-lint анализирует проекты Claude Code, чтобы показать, сколько контекстного окна потребляется файлами CLAUDE.md, навыками, серверами MCP и системными промптами до ввода пользователя. Инструмент предоставляет конкретные рекомендации по сокращению использования токенов.

Почему ИИ-охотники за головами теряют деньги: данные 60 выпусков
Разработчик попытался заставить Claude зарабатывать деньги на открытых баунти с бюджетом в $20 на токены. Просканировав более 80 баунти на Algora, он обнаружил, что большинство из них засорены 10+ открытыми PR, спамом за $1 или зарезервированы для собеседований. Ожидаемый доход: $0.

Открытый SDK для AI-работы с знаниями
ClioAI выпустил <strong>kw-sdk</strong>, открытый набор инструментов для разработки программного обеспечения, предназначенный для структурирования работы ИИ-агентов в областях знаний, таких как исследование, анализ, стратегия и написание текстов. В отличие от традиционных кодовых фреймворков, которые имеют естественные сигналы верификации через тестирование, работа с знаниями требует структурированных подходов для проверки и оценки задач.

Open Swarm: Открытая система для запуска тысяч параллельных ИИ-агентов
Open Swarm — это система с открытым исходным кодом, которая запускает тысячи параллельных ИИ-агентов с полным доступом к более чем 150 интернет-инструментам, включая электронную почту, социальные сети, Google Workspace, веб-поиск, выполнение кода и планировщик cron.