隠れた音声信号で音声AIシステムを79~96%の成功率で乗っ取る

IEEE Symposium on Security and Privacyで発表された新たな研究により、大規模音声言語モデル(LALM)に対する実用的な攻撃ベクトルが明らかになりました。攻撃者はオーディオクリップに知覚できない信号を埋め込み、モデルの動作を乗っ取ることができ、MistralやMicrosoftの商用サービスを含む13の主要なオープンモデルに対して79〜96%の平均成功率を達成しています。
攻撃の仕組み
改変されたオーディオクリップは人間の耳には聞こえませんが、モデルに隠されたコマンドを実行させます。重要なのは、この攻撃がユーザーの付随する指示に関係なく機能し、同一のクリップを同じモデルに対して何度でも再利用できる点です。攻撃信号の学習には約30分かかります。
悪用される機能
研究者らは、侵害されたモデルが以下のことを強制的に行えることを実証しました。
- ユーザーに知られずに機密性の高いWeb検索を実行
- 攻撃者が管理するソースからのファイルダウンロード
- ユーザーデータを含むメールを外部アドレスに送信
影響を受けるモデル
この攻撃は、商用の音声AI APIを含む13の人気のあるオープンウェイトLALMに対して検証されました。これは、現在の音声AIシステムが敵対的な音響摂動に対する堅牢な防御策を欠いていることを示しています。
📖 出典全文: HN AI Agents
👀 See Also

農場からコードへ:農夫がオープンクロー用のオープンソースランタイム防御をどのように作ったか
開発経験のない農家が、複数のAIコーディングエージェントを活用して、わずか12時間でOpenClawのオープンソースランタイム防御を構築した方法をご紹介します。

OpenClawセキュリティ:AIエージェントを保護する13の実践的ステップ
Redditの投稿では、OpenClawのインストールに関する13のセキュリティ対策が概説されています。これには、別のマシンでの実行、ネットワーク分離のためのTailscaleの使用、Dockerでのサブエージェントのサンドボックス化、ユーザーアクセスの許可リストの設定などが含まれます。

フロンティアAIがCTF競技を打ち破る — GPT-5.5、狂気のPwnチャレンジを一撃で攻略
Claude Opus 4.5とGPT-5.5は、中級から上級のCTFチャレンジを自律的に解決でき、スコアボードはセキュリティスキルではなく、オーケストレーションとトークン予算の指標になりつつある。

OpenClawの「常に許可」機能のセキュリティ脆弱性とより安全な代替案
OpenClawの「常に許可」承認機能は、今月2つのCVEの対象となり、ラッパーコマンドのバインドとシェルの行継続バイパスを通じて不正なコマンド実行を可能にしました。より深い問題は、この機能がユーザーにセキュリティプロンプトへの注意を払うのをやめるよう訓練してしまうことです。