PromptForest: Detecção Local-Primeira de Injeção de Prompt com Incerteza

PromptForest é uma nova biblioteca local-first criada para enfrentar os problemas comumente vistos nos detectores atuais de injeção de prompt. Ela visa detectar injeções de prompt e jailbreaks de forma eficiente e com uma medida de incerteza para evitar excesso de confiança nos resultados. Essa abordagem a diferencia dos sistemas tradicionais, especialmente por manter o desempenho enquanto ainda fornece saídas mais matizadas.
Detalhes Principais
Um dos problemas fundamentais com os detectores de injeção existentes é a dependência de modelos grandes como Llama 2 8B e Qualifire Sentinel 0.6B. Esses modelos não são apenas lentos, mas sua excessiva confiança nos resultados pode levar a falsos positivos que prejudicam sua confiabilidade em cenários de produção. Reconhecendo essas limitações, o PromptForest utiliza um método de ensemble por votação composto por três modelos menores e especializados:
- Llama Prompt Guard (86M): Oferece o maior Erro de Calibração Esperado (ECE) pré-ensemble em sua classe de peso.
- Vijil Dome (ModernBERT): Fornece a maior precisão por parâmetro.
- Custom XGBoost: Treinado em embeddings para diversidade arquitetônica.
Esses modelos usam coletivamente um método de votação ponderada por soft voting para determinar os resultados, onde modelos mais precisos têm maior influência. Esse método simplifica a tomada de decisão enquanto mantém alta precisão e consistência.
Benchmarks mostram que o PromptForest opera com uma latência média de ~141ms, comparado a ~225ms do Qualifire Sentinel v2, enquanto oferece uma precisão comparável de 90% contra seus 97%. A calibração ECE também se sai bem com 0,070 versus 0,096 do Sentinel. A taxa de transferência é igualmente impressionante, com aproximadamente 27 prompts processados por segundo em uma GPU de consumo usando a CLI pfranger.
Para testes e implementação, os desenvolvedores podem experimentar o PromptForest no Google Colab ou auditar prompts com a ferramenta PFRanger, que funciona inteiramente localmente. O PFRanger utiliza paralelização para aumentar a velocidade e a taxa de transferência.
📖 Leia a fonte completa: r/LocalLLaMA
👀 See Also
AIttache: Um Servidor MCP Somente Leitura Que Não Pode Destruir Sua Produção
AIttache é um servidor MCP com mais de 25 conectores somente leitura (terminal, servidores, clima, Steam) que fisicamente não pode modificar nada — construído para dar às LLMs contexto de logs sem autonomia.

Mymir: Um Grafo de Projetos Open-Source para Agentes de Codificação via MCP
Mymir fornece aos agentes um mapa de projeto baseado em grafo com dependências, decisões, critérios de aceitação e notas de execução anteriores, entregue via MCP para evitar reexplicar o estado entre sessões.

NGX-OS: Sistema Operacional de Rede Construído para IA com Integração eBPF e MCP
NGX-OS é um sistema operacional de rede projetado desde o início para integração com IA, usando eBPF para telemetria em tempo real e MCP para acesso direto de LLMs aos dados de estado da rede sem camadas de tradução.

SecureContext: Um Plugin MCP para Memória Persistente e Redução de Tokens no Claude Code
SecureContext é um plugin MCP de código aberto que fornece persistência no estilo MemGPT entre sessões do Claude Code, reduz os tokens de entrada em aproximadamente 87% por meio de recuperação de contexto direcionada e isola credenciais por meio de um sandbox de segurança.