PromptForest : Détection d'injection de prompts local-first avec incertitude

✍️ OpenClawRadar📅 Publié: February 14, 2026🔗 Source
PromptForest : Détection d'injection de prompts local-first avec incertitude
Ad

PromptForest est une nouvelle bibliothèque locale créée pour résoudre les problèmes couramment observés avec les détecteurs d'injection de prompts actuels. Elle vise à détecter les injections de prompts et les jailbreaks efficacement et avec une mesure d'incertitude pour éviter une confiance excessive dans les résultats. Cette approche la différencie des systèmes traditionnels, notamment en maintenant les performances tout en fournissant des sorties plus nuancées.

Ad

Détails clés

L'un des problèmes fondamentaux des détecteurs d'injection existants est la dépendance à des modèles volumineux comme Llama 2 8B et Qualifire Sentinel 0.6B. Ces modèles sont non seulement lents, mais leur confiance excessive dans les résultats peut entraîner des faux positifs qui compromettent leur fiabilité dans les scénarios de production. Conscient de ces limites, PromptForest utilise une méthode d'ensemble de vote comprenant trois modèles plus petits et spécialisés :

  • Llama Prompt Guard (86M) : Offre l'erreur d'étalonnage attendue (ECE) pré-ensemble la plus élevée dans sa catégorie de poids.
  • Vijil Dome (ModernBERT) : Fournit la plus grande précision par paramètre.
  • Custom XGBoost : Entraîné sur des embeddings pour une diversité architecturale.

Ces modèles utilisent collectivement une méthode de vote pondéré pour déterminer les résultats, où les modèles plus précis ont une influence plus grande. Cette méthode simplifie la prise de décision tout en maintenant une grande précision et cohérence.

Les tests comparatifs montrent que PromptForest fonctionne avec une latence moyenne d'environ 141 ms, contre environ 225 ms pour le Qualifire Sentinel v2, tout en offrant une précision comparable de 90 % contre leurs 97 %. L'erreur d'étalonnage (ECE) est également bonne à 0,070 contre 0,096 pour Sentinel. Le débit est également impressionnant, avec environ 27 prompts traités par seconde sur un GPU grand public en utilisant l'interface pfranger.

Pour les tests et la mise en œuvre, les développeurs peuvent expérimenter PromptForest sur Google Colab ou auditer les prompts avec l'outil PFRanger, qui fonctionne entièrement localement. PFRanger utilise le parallélisme pour améliorer la vitesse et le débit.

📖 Lire la source complète : r/LocalLLaMA

Ad

👀 See Also

Claude Code a reconstruit un flux d'onboarding SaaS en 6 heures contre le devis de 3 semaines d'un développeur, augmentant l'activation de 13 points
Tools

Claude Code a reconstruit un flux d'onboarding SaaS en 6 heures contre le devis de 3 semaines d'un développeur, augmentant l'activation de 13 points

Un fondateur de SaaS a utilisé Claude Code pour reconstruire l'intégralité de son flux d'onboarding (inscription → profil → première facture → tutoriel du tableau de bord) en 6 heures, remplaçant ainsi l'estimation de 3 semaines et 4 500 $ d'un développeur. Le taux d'activation est passé de 35 % à 48 %, soit une amélioration de 13 points.

OpenClawRadar
🦀
Tools

Serveur MCP TextExpander permet à l'IA Claude d'accéder et de gérer votre bibliothèque de snippets

TextExpander a lancé un serveur MCP gratuit qui connecte votre bibliothèque de snippets à Claude. Claude peut lister, rechercher, créer et modifier des snippets en masse, y compris des champs dynamiques comme les dates et les menus déroulants.

OpenClawRadar
Connexion d'OpenClaw à Qwen2.5 Coder : Faisabilité et considérations
Tools

Connexion d'OpenClaw à Qwen2.5 Coder : Faisabilité et considérations

Explorez la possibilité de connecter OpenClaw à un modèle local Qwen2.5 Coder avec 7 milliards de paramètres pour contourner les limites de débit de l'API Gemini 3.

OpenClawRadar
Claude Code Ajoute un Mode Automatique pour les Décisions d'Autorisation
Tools

Claude Code Ajoute un Mode Automatique pour les Décisions d'Autorisation

Claude Code dispose désormais d'un mode automatique qui permet à Claude de prendre les décisions d'autorisation au lieu d'exiger une approbation manuelle pour chaque écriture de fichier et commande bash. Ce mode inclut des mesures de sécurité qui vérifient chaque action avant son exécution, avec un classificateur examinant les appels d'outils pour les actions potentiellement destructrices.

OpenClawRadar