プロンプトフォレスト:不確実性を考慮したローカルファーストのプロンプトインジェクション検出

✍️ OpenClawRadar📅 公開日: February 14, 2026🔗 Source
プロンプトフォレスト:不確実性を考慮したローカルファーストのプロンプトインジェクション検出
Ad

PromptForestは、現在のプロンプトインジェクション検出器でよく見られる問題に対処するために作成された新しいローカルファーストライブラリです。プロンプトインジェクションとジェイルブレイクを効率的に検出し、結果に対する過信を避けるために不確実性の尺度を提供することを目指しています。このアプローチは、特にパフォーマンスを維持しながら、よりニュアンスのある出力を提供することで、従来のシステムと区別されます。

主な詳細

既存のインジェクション検出器の根本的な問題の一つは、Llama 2 8BやQualifire Sentinel 0.6Bのような大規模モデルへの依存です。これらのモデルは遅いだけでなく、結果に対する過信により誤検知が発生し、本番環境での信頼性を損なう可能性があります。これらの制限を認識し、PromptForestは3つの小型で専門化されたモデルからなる投票アンサンブル手法を活用しています:

  • Llama Prompt Guard (86M): その重量クラスで最高の事前アンサンブル期待較正誤差(ECE)を提供します。
  • Vijil Dome (ModernBERT): パラメータあたり最高の精度を提供します。
  • カスタムXGBoost: アーキテクチャの多様性のために埋め込みでトレーニングされています。

これらのモデルは、より正確なモデルがより大きな影響力を持つ加重ソフト投票方法を使用して結果を決定します。この方法は、高い精度と一貫性を維持しながら意思決定を簡素化します。

ベンチマークによると、PromptForestは平均レイテンシ約141msで動作し、Qualifire Sentinel v2の約225msと比較して、97%に対して90%の同等の精度を提供します。較正ECEも、Sentinelの0.096に対して0.070と良好な結果を示しています。スループットも印象的で、pfranger CLIを使用したコンシューマーGPUで、約27プロンプトが毎秒処理されます。

テストと実装のために、開発者はGoogle ColabでPromptForestを試したり、完全にローカルで動作するPFRangerツールでプロンプトを監査したりできます。PFRangerは並列化を利用して速度とスループットを向上させます。

📖 完全なソースを読む: r/LocalLLaMA

Ad

👀 See Also

Claude Codeを活用したボットコンサルティング:詳細な分析
Tools

Claude Codeを活用したボットコンサルティング:詳細な分析

ボット開発におけるClaude Codeの統合を探求し、AIコンサルティンスを通じて機能性を向上させる取り組みについて、r/clawdbotの愛好家が共有した内容です。

OpenClawRadar
ミアズマ:AIウェブスクレイパーを毒データで罠にかけるツール
Tools

ミアズマ:AIウェブスクレイパーを毒データで罠にかけるツール

Miasmaは、AIウェブスクレイパーに毒入りのトレーニングデータと自己参照リンクを送信し、無限ループを作り出すサーバーツールです。最小限のメモリ使用量で動作し、ポート、ホスト、リンクプレフィックスなどのCLIオプションで設定できます。

OpenClawRadar
NodeJSプロジェクト向けオープンソースAIメモリストレージ
Tools

NodeJSプロジェクト向けオープンソースAIメモリストレージ

Mind Palaceは、NodeJS向けのオープンソースのメモリ保存・検索システムで、LLMチャットセッション間で情報を永続化します。主要なLLMとベクトルストアをサポートし、インタラクションから要約された記憶を自動的に抽出・ベクトル化します。

OpenClawRadar
クロードコードのプラン懐疑的サブエージェントが生成されたプランのセキュリティギャップを特定
Tools

クロードコードのプラン懐疑的サブエージェントが生成されたプランのセキュリティギャップを特定

ある開発者がClaude Codeのプラン懐疑的サブエージェントを発見しました。このエージェントはAIが生成した開発計画のギャップや問題点を特定し、特に最初は明らかでなかったセキュリティ上の懸念を捉えます。このエージェントは、以前から知られていたセキュリティ監視サブエージェントと連携して計画の品質を向上させます。

OpenClawRadar