PromptForest : Détection d'injection de prompts local-first avec incertitude

PromptForest est une nouvelle bibliothèque locale créée pour résoudre les problèmes couramment observés avec les détecteurs d'injection de prompts actuels. Elle vise à détecter les injections de prompts et les jailbreaks efficacement et avec une mesure d'incertitude pour éviter une confiance excessive dans les résultats. Cette approche la différencie des systèmes traditionnels, notamment en maintenant les performances tout en fournissant des sorties plus nuancées.
Détails clés
L'un des problèmes fondamentaux des détecteurs d'injection existants est la dépendance à des modèles volumineux comme Llama 2 8B et Qualifire Sentinel 0.6B. Ces modèles sont non seulement lents, mais leur confiance excessive dans les résultats peut entraîner des faux positifs qui compromettent leur fiabilité dans les scénarios de production. Conscient de ces limites, PromptForest utilise une méthode d'ensemble de vote comprenant trois modèles plus petits et spécialisés :
- Llama Prompt Guard (86M) : Offre l'erreur d'étalonnage attendue (ECE) pré-ensemble la plus élevée dans sa catégorie de poids.
- Vijil Dome (ModernBERT) : Fournit la plus grande précision par paramètre.
- Custom XGBoost : Entraîné sur des embeddings pour une diversité architecturale.
Ces modèles utilisent collectivement une méthode de vote pondéré pour déterminer les résultats, où les modèles plus précis ont une influence plus grande. Cette méthode simplifie la prise de décision tout en maintenant une grande précision et cohérence.
Les tests comparatifs montrent que PromptForest fonctionne avec une latence moyenne d'environ 141 ms, contre environ 225 ms pour le Qualifire Sentinel v2, tout en offrant une précision comparable de 90 % contre leurs 97 %. L'erreur d'étalonnage (ECE) est également bonne à 0,070 contre 0,096 pour Sentinel. Le débit est également impressionnant, avec environ 27 prompts traités par seconde sur un GPU grand public en utilisant l'interface pfranger.
Pour les tests et la mise en œuvre, les développeurs peuvent expérimenter PromptForest sur Google Colab ou auditer les prompts avec l'outil PFRanger, qui fonctionne entièrement localement. PFRanger utilise le parallélisme pour améliorer la vitesse et le débit.
📖 Lire la source complète : r/LocalLLaMA
👀 See Also

Meera : Un assistant IA entièrement hors ligne pour Linux Gnome basé sur Qwen3.5-2B
Meera est un assistant IA hors ligne pour le bureau Gnome qui utilise Qwen3.5-2B-Q4_K_M (1,2 Go) et llama-cpp avec prise en charge Vulkan. Il exploite un deuxième modèle d'embedding minuscule pour la sélection d'outils et le RAG, évitant le gonflement des embeddings de prompt. Fonctionne sur Ubuntu 24.04 avec RTX 5090 et Fedora Silverblue sur Intel i3.

Serveur MCP natif macOS pour le contrôle complet du système d'exploitation
Un serveur natif macOS offre 24 outils pour des clics précis au pixel, des combinaisons de touches, du glisser-déposer, la gestion d'applications, la prise en charge multi-écrans et l'accès au presse-papiers. Il est open source et fonctionne avec Claude Code, Cursor ou tout client MCP.

Test pratique du modèle de Tencent : performant pour les workflows agents, faible pour le codage complexe
Le modèle de Tencent obtient un 8/10 pour les tâches agentiques avec un faible taux d'hallucination, mais échoue sur le code complexe comme les schémas de l'API Notion. À éviter pour la logique backend.

Fonctionnalité Claw Voice ajoute le support de l'API 11Labs avec intégration CarPlay
Claw Voice s'intègre à CarPlay et permet des voix personnalisées via l'API 11Labs, offrant des conversations naturelles et fluides avec votre agent pendant la conduite.