プロンプトフォレスト:不確実性を考慮したローカルファーストのプロンプトインジェクション検出

PromptForestは、現在のプロンプトインジェクション検出器でよく見られる問題に対処するために作成された新しいローカルファーストライブラリです。プロンプトインジェクションとジェイルブレイクを効率的に検出し、結果に対する過信を避けるために不確実性の尺度を提供することを目指しています。このアプローチは、特にパフォーマンスを維持しながら、よりニュアンスのある出力を提供することで、従来のシステムと区別されます。
主な詳細
既存のインジェクション検出器の根本的な問題の一つは、Llama 2 8BやQualifire Sentinel 0.6Bのような大規模モデルへの依存です。これらのモデルは遅いだけでなく、結果に対する過信により誤検知が発生し、本番環境での信頼性を損なう可能性があります。これらの制限を認識し、PromptForestは3つの小型で専門化されたモデルからなる投票アンサンブル手法を活用しています:
- Llama Prompt Guard (86M): その重量クラスで最高の事前アンサンブル期待較正誤差(ECE)を提供します。
- Vijil Dome (ModernBERT): パラメータあたり最高の精度を提供します。
- カスタムXGBoost: アーキテクチャの多様性のために埋め込みでトレーニングされています。
これらのモデルは、より正確なモデルがより大きな影響力を持つ加重ソフト投票方法を使用して結果を決定します。この方法は、高い精度と一貫性を維持しながら意思決定を簡素化します。
ベンチマークによると、PromptForestは平均レイテンシ約141msで動作し、Qualifire Sentinel v2の約225msと比較して、97%に対して90%の同等の精度を提供します。較正ECEも、Sentinelの0.096に対して0.070と良好な結果を示しています。スループットも印象的で、pfranger CLIを使用したコンシューマーGPUで、約27プロンプトが毎秒処理されます。
テストと実装のために、開発者はGoogle ColabでPromptForestを試したり、完全にローカルで動作するPFRangerツールでプロンプトを監査したりできます。PFRangerは並列化を利用して速度とスループットを向上させます。
📖 完全なソースを読む: r/LocalLLaMA
👀 See Also

オープンソースのClaudeスキル:経営コンサルティングのフレームワークとケーススタディ向け
MITライセンスで無料提供されているClaudeスキルは、経営コンサルティング業務向けに構造化された参考資料を提供し、フレームワーク、業界コンテキスト、ケーススタディを含みます。このプロジェクトは80以上のマークダウンファイルで構成され、ドメイン別に整理されており、カバレッジ拡大のための貢献者を募集しています。

KubeShark: Kubernetesスキル(Claude Code / Codex対応)による誤ったYAML検出
KubeSharkは、Claude CodeとCodex向けの障害モード優先型Kubernetesスキルで、非推奨API、誤設定されたプローブ、壊れたセレクタ、その他のAIが生成しがちな一般的なミスを本番環境に到達する前にキャッチします。

apple-music-play OpenClawスキルがClawHubで公開され、Apple Musicの検索と再生が可能に
ClawHubで公開されているapple-music-playスキルは、Apple Musicのオンラインカタログを検索し、macOSのミュージックアプリで直接トラックを再生することができます。ローカルライブラリに曲がなくても利用可能です。

Claude IDE Bridge: リアルタイムIDEアクセスのためのWebSocketツール
claude-ide-bridgeは、Claude CodeをIDEの内部状態に直接接続するWebSocketブリッジで、ライブ診断、定義への移動、参照の検索、型のホバリング、ファイルの開閉、ブレークポイントの管理、デバッガ状態のストリーミングを可能にします。