Anthropicは、中国のAI研究所によるClaudeへの産業規模の蒸留攻撃を報告しています。

産業規模のモデル抽出作戦
Anthropicは、3つの中国AI研究所によるClaudeへの協調的な蒸留攻撃の詳細をまとめた調査結果を公開しました。この攻撃には、大規模なAPIインタラクションを通じてClaudeの推論能力を抽出するために、大規模な不正アカウントの作成が含まれていました。
Anthropicの報告書からの主な攻撃詳細
- DeepSeek、Moonshot、MiniMaxが24,000以上の不正アカウントを作成
- Claudeとの総やり取り回数は1,600万回を超える
- MiniMaxだけで1,300万件のリクエストを実行
- Anthropicが新モデルをリリースすると、MiniMaxは24時間以内にトラフィックのほぼ半分をリダイレクト
- DeepSeekは特に思考連鎖と検閲安全な回答を標的にした
- 研究所が手法を適応させるにつれ、攻撃は時間とともに洗練度を増した
AI開発者へのセキュリティ的示唆
この事例は、数十億ドル規模の研究所が体系的に独自の能力を抽出しようとする際のAIモデルセキュリティの脆弱性を浮き彫りにしています。複数の組織にまたがり、新モデルリリースに適応するこれらの攻撃の規模と持続性は、これが孤立した事例ではなく、継続的な脅威ベクトルを表していることを示唆しています。
使用された手法(不正アカウント作成、特定能力のための標的クエリ、新モデルバージョンへの迅速な適応)は、他のAIシステムに対しても複製される可能性があり、開発者がワークフローに統合するサードパーティAIツールのセキュリティに疑問を投げかけています。
📖 完全なソースを読む: r/ClaudeAI
👀 See Also

OpenClawインスタンスのための5つの必須セキュリティ手順
Redditの投稿では、OpenClawをデフォルト設定で実行すると重大なセキュリティリスクが生じると警告し、5つの緊急対策を提示しています:デフォルトポートの変更、プライベートアクセスのためのTailscaleの使用、ファイアウォールの設定、エージェント用の別アカウントの作成、スキルインストール前のスキャンです。

デリミタ防御により、Gemma 4のプロンプトインジェクション防御率が6100以上のテストベンチマークで21%から100%に向上
ランダムな区切り文字で信頼できないコンテンツを囲むことで、プロンプトインジェクション防御率が劇的に向上したベンチマーク。Gemma 4 E4B は 21.6% から 100% に。

OpenClawセキュリティ強化:自律エージェントリスクに対する多層防御
開発者は、自律エージェントによる破壊的なコマンドやデータ流出を防ぐため、ハードデニー正規表現ガード、再帰的難読化解除ツール、AppArmorプロファイル、監査統合を含む多層セキュリティスタックをOpenClawのコードベースに追加しました。

AIセキュリティ研究者の方々:データ提供オプトイン設定により、0-day脆弱性が漏洩する可能性があります
LLMインターフェースの「モデルを皆のために改善する」トグルは、深刻なレッドチーミング研究を自動的に収集し、脆弱性の概念をベンダーのセキュリティチームや、あなたが発表する前に学術論文に送信する可能性があります。本格的なセキュリティ研究を行う前にデータ共有を無効にしてください。