積層防御層により、Claude Codeにおけるプロンプトインジェクションが0に低減

Anthropicは、多層防御スタックにより、未見の攻撃に対してもプロンプトインジェクション攻撃をゼロに抑えることができると主張しています。Claude Codeの新しいAuto Modeに関する議論の中で、Boris Cherny氏は、モデルトレーニング、意図分類器、入力プローブという多層アプローチを概説しました。また、トークンコストの懸念に対して「分類器を無料にします。安全性のためにコストを払う必要はありません」と述べ、分類器が無料になったことを確認しました。
層の積み重ね方
- モデルトレーニング:ベースモデルは、インジェクションパターンを認識して拒否するように微調整されています。
- 意図分類器:別の分類器が各プロンプトの背後にあるユーザーの意図をチェックし、実行前に悪意のあるリクエストをフィルタリングします。
- 入力プローブ:アクティブなプローブが既知のインジェクションベクトルをテストし、さらなる障壁を追加します。
情報源によると、この組み合わせにより、未見の攻撃に対するプロンプトインジェクション率が0%に低減されます。重要なのは、単一の層は完璧ではないが、積み重ねることで大多数の試みをキャッチできることです。
分類器が無料に
Boris Cherny氏の発言は簡潔です:「分類器を無料にします。安全性のためにコストを払う必要はありません」。これは、セキュリティチェックを追加すると予算を圧迫することを懸念していた開発者にとって、よくある問題点であるトークンコストに対処しています。これまでセキュリティ機能をバイパスしてトークンを節約していたとしても、もはやその心配はありません。
これは、Claude Codeで自律エージェントを構築しているチームにとって特に重要です。Webコンテンツやツール出力に埋め込まれた悪意のあるプロンプトがエージェントを乗っ取る可能性があるため、プロンプトインジェクションは現実的なリスクです。分類器が無料になったことで、追加料金を気にせずに有効化できます。
ブログ記事全体はClaude CodeのAuto Modeに関するものですが、このセキュリティの詳細は際立っています。開発者にとって、これはAnthropicが安全性をプレミアムアドオンではなく基本機能として扱っていることを示すシグナルです。
📖 完全なソースを読む: r/ClaudeAI
👀 See Also
OpenClawクラスタ管理:リカバリパスをクラスタ外に保持する
OpenClaw管理クラスタのためのより安全なトポロジ:Gatewayとタスク状態を外部に置き、読み取り専用アクセスを使用し、PR + CI + 人間の承認によるマージを介してArgo CDに変更を駆動します。

セキュリティベンチマーク:211の敵対的プローブでテストされた10のLLM
あるセキュリティ研究者が10種類のLLMに対して211種類の敵対的攻撃をテストした結果、抽出耐性は平均85%である一方、インジェクション耐性は平均46.2%に留まりました。すべてのモデルがデリミタ、ディストラクタ、スタイルインジェクション攻撃に対して完全に失敗しました。

クロード・ケージ:ClaudeコードセキュリティのためのDockerサンドボックス
開発者がClaude CageというDockerコンテナを作成し、Claude Codeを単一のワークスペースフォルダに隔離することで、SSHキー、AWS認証情報、個人ファイルへのアクセスを防止します。このセットアップにはセキュリティルールが含まれており、Dockerがインストールされていれば約2分で完了します。

OpenClawコミュニティスキルでマルウェア発見 — 暗号通貨窃盗の警告
オープンクローコミュニティスキルにマルウェア発見 — 暗号通貨窃盗の警告