積層防御層により、Claude Codeにおけるプロンプトインジェクションが0に低減

Anthropicは、多層防御スタックにより、未見の攻撃に対してもプロンプトインジェクション攻撃をゼロに抑えることができると主張しています。Claude Codeの新しいAuto Modeに関する議論の中で、Boris Cherny氏は、モデルトレーニング、意図分類器、入力プローブという多層アプローチを概説しました。また、トークンコストの懸念に対して「分類器を無料にします。安全性のためにコストを払う必要はありません」と述べ、分類器が無料になったことを確認しました。
層の積み重ね方
- モデルトレーニング:ベースモデルは、インジェクションパターンを認識して拒否するように微調整されています。
- 意図分類器:別の分類器が各プロンプトの背後にあるユーザーの意図をチェックし、実行前に悪意のあるリクエストをフィルタリングします。
- 入力プローブ:アクティブなプローブが既知のインジェクションベクトルをテストし、さらなる障壁を追加します。
情報源によると、この組み合わせにより、未見の攻撃に対するプロンプトインジェクション率が0%に低減されます。重要なのは、単一の層は完璧ではないが、積み重ねることで大多数の試みをキャッチできることです。
分類器が無料に
Boris Cherny氏の発言は簡潔です:「分類器を無料にします。安全性のためにコストを払う必要はありません」。これは、セキュリティチェックを追加すると予算を圧迫することを懸念していた開発者にとって、よくある問題点であるトークンコストに対処しています。これまでセキュリティ機能をバイパスしてトークンを節約していたとしても、もはやその心配はありません。
これは、Claude Codeで自律エージェントを構築しているチームにとって特に重要です。Webコンテンツやツール出力に埋め込まれた悪意のあるプロンプトがエージェントを乗っ取る可能性があるため、プロンプトインジェクションは現実的なリスクです。分類器が無料になったことで、追加料金を気にせずに有効化できます。
ブログ記事全体はClaude CodeのAuto Modeに関するものですが、このセキュリティの詳細は際立っています。開発者にとって、これはAnthropicが安全性をプレミアムアドオンではなく基本機能として扱っていることを示すシグナルです。
📖 完全なソースを読む: r/ClaudeAI
👀 See Also

無料のClaudeスキルが他のスキルのセキュリティリスクをスキャンします
開発者が、他のClaudeスキルのセキュリティをレビューする無料のClaudeスキルを構築しました。このツールは、コードの悪意のある動作の可能性をチェックし、スコアカード形式のアプローチでリポジトリを分析することで、Claudeスキルが使用しても安全かどうかを判断するのに役立ちます。

フロンティアAIがCTF競技を打ち破る — GPT-5.5、狂気のPwnチャレンジを一撃で攻略
Claude Opus 4.5とGPT-5.5は、中級から上級のCTFチャレンジを自律的に解決でき、スコアボードはセキュリティスキルではなく、オーケストレーションとトークン予算の指標になりつつある。

LiteLLM v1.82.8の侵害は、永続的な実行のために.pthファイルを使用します
LiteLLM v1.82.8がPyPIで侵害され、.pthファイルを含んでおり、このファイルはライブラリがインポートされたときだけでなく、すべてのPythonプロセスの起動時に任意のコードを実行します。ペイロードは、LiteLLMが推移的依存関係としてインストールされ、直接使用されない場合でも実行されます。

ClawSecure:OpenClawエコシステムのためのセキュリティプラットフォーム
ClawSecureは、OpenClawエコシステム専用に構築されたセキュリティプラットフォームで、3層監査プロトコル、継続的監視、OWASP ASIカテゴリーのカバレッジを特徴としています。3,000以上の人気スキルを監査済みで、無料で利用可能、サインアップ不要です。