ローカルモデルプロンプトインジェクションスキャナー for AIスキルセキュリティ

AIスキルのセキュリティ脆弱性
Xでの議論で、サードパーティのAIスキルに深刻なセキュリティ上の欠陥が指摘されました。Claude Codeはスキル内で直接bashコマンドを実行する!演算子をサポートしていますが、これらの演算子はHTMLタグ内に隠される可能性があり、LLMが認識しないままbash実行が行われる恐れがあります。
ローカルスキャナーの実装
インストール時にスキル内の潜在的なマルウェアインジェクションをスキャンする概念実証ツールが構築されました。このスキャナーは、ローカルで実行される非ツール呼び出しモデル、具体的にはOllama上のmistral-small:latestを使用します。作成者はテスト中に「完璧に機能した」と報告しています。
このアプローチはウイルススキャナーと同様に機能し、将来の「スキルインストーラー」製品に統合される可能性があります。プロンプトインジェクションに対する保護は、ローカルモデルの有望な応用分野として特定されています。
技術的詳細
この脆弱性は、直接bashコマンド実行を可能にするClaude Codeの!演算子に関連しています。攻撃者はこれらの演算子をHTMLタグ内に隠すことで、LLMの知らないうちに悪意のあるコマンドを実行する可能性があります。スキャナーは、インストール前にスキルを分析してこのような隠れたインジェクションを検出することで、この問題に対処します。
📖 完全なソースを読む: r/LocalLLaMA
👀 See Also

GitHub Copilot CLIの脆弱性により、プロンプトインジェクション経由でのマルウェア実行が可能
GitHub Copilot CLIの脆弱性により、ユーザーの承認なしに間接的なプロンプトインジェクションを介して任意のシェルコマンドが実行される可能性があります。攻撃者は検証を回避し、被害者のコンピューター上で即座にマルウェアを実行するコマンドを作成できます。
美国防部网络安全顾问:中国AI企业对美国企业发动恶意蒸馏活动
米国防総省の新たなCSA報告書は、中国のAI企業が米国のAIモデルを盗むために悪意ある蒸留キャンペーンを実施していることを明らかにし、商用AI製品とオープンソースフレームワークを標的にしている。

新スキルがリモートサーバーでのOpenClawセキュリティ強化を自動化
コミュニティ開発者が、リモートサーバー上のOpenClawインストールをAIアシスタントが自動的に保護するのに役立つスキルをリリースしました。

メタ広告にAI生成のCSAMが含まれていた;研究者が広告ライブラリで50件以上を発見
Tech Transparency Projectによると、Metaの広告ライブラリでAI生成の児童性的虐待コンテンツを含む有料広告が50件以上見つかり、数千のアカウントにリーチしたものもあった。WIREDの問い合わせ後、Metaは広告を削除した。