オーディオレイヤー即時注入攻撃に対するクロード:トランスクリプトにないもの

数ヶ月前からプロンプトインジェクション検出APIを構築している開発者が、最近音声スキャンをリリースし、その知見をr/ClaudeAIで共有しました。結果は、音声エージェントのセキュリティにおけるギャップを浮き彫りにしています。テキストの文字起こしパイプラインを迂回するため、ログに残らない音声レイヤー攻撃です。
音声攻撃で有効なものと無効なもの
明白な攻撃は失敗します。音声入力に「これまでの指示を無視しろ」と話しかけると、Claudeは正確に文字起こしし、攻撃パターンを認識して拒否します。テキストと同じです。
本当の問題:信号レイヤー攻撃
興味深いケースは信号、つまり文字起こしではありません。人間が音声として認識しない周波数に命令を埋め込む、ある種の音声攻撃があります。文字起こしは無害に戻ります。なぜなら、文字起こしすべき可聴内容がないからです。しかし、音声パイプラインが文字起こし前に入力をどのように処理するかによって、信号レイヤーの内容がモデルの受信内容に影響を与える可能性があります。ログには文字起こしされた内容しか記録されず、音声内容は記録されないため、攻撃はログに残りません。
別途、速度変更された音声も問題を引き起こします。音声を通常の0.7倍や0.8倍に遅くすると、人間の耳には奇妙に聞こえますが、文字起こしツールは正確に処理します。文字起こしを読む人は異常に気づきません。聞く人は少しおかしいと感じるかもしれませんが、理由はおそらくわかりません。
音声エージェントへの影響
「文字起こしを確認すれば音声も確認したことになる」という前提は、見かけよりも脆弱です。テキストインジェクション問題はかなり理解されていますが、音声に相当するものはほとんどマッピングされていません。開発者は、自身の敵対的ゲーム castle.bordair.io に音声テストケースを追加しました。キングダム4以降では、これらの攻撃を実際に示す音声レベルがあります。
この問題が重要な人々
Claudeや類似のLLMを使用して音声エージェントを構築している人、特に安全性検証を文字起こし検査のみに依存している人。
📖 全文ソース: r/ClaudeAI
👀 See Also

ClawCare:AWSキー流出後のAIコーディングエージェント向けセキュリティガード
ClawCareは、Claude CodeなどのAIコーディングエージェントで実行前にコマンドをスキャンするPythonツールで、環境変数の一括ダンプやリバースシェルなどの危険なパターンをブロックします。開発者がエージェントを通じてAWSキーを誤って漏洩したことをきっかけに開発されました。

MCPwner AIペンテストツールがOpenClawで複数のゼロデイ脆弱性を発見
MCPwnerは、自動化されたペネトレーションテストのためにAIエージェントを調整するMCPサーバーであり、OpenClawにおける環境変数インジェクション、権限バイパス、情報漏洩などの深刻なゼロデイ脆弱性を、標準的なスキャナーが見逃していたものを特定しました。

Google検索で公開されているセキュリティ対策されていないペーパークリップインスタンスによるライブダッシュボードの露出
Redditユーザーがエラーを検索中に、完全な組織データがGoogleにインデックスされたライブのPaperclipダッシュボードを発見しました。このインスタンスは認証なしで公開されており、組織図、エージェントの会話、タスク割り当て、事業計画が明らかになりました。

Malwar: Claude Codeで構築されたSKILL.mdファイル用脆弱性スキャナー
開発者が、ルールエンジン、URLクローラー、LLM分析、脅威インテリジェンスを含む4層パイプラインを使用してSKILL.mdファイルの悪意のある指示をスキャンする無料ツール「Malwar」をリリースしました。このツールは、既存のスキルでBase64ブロブやcurl出力をbashにパイプする指示など、懸念すべきパターンを発見した後、Claude Codeを使用して完全に構築されました。