Redditの13語がAI検索を操作可能:コーネル大学の研究

コーネル大学の新しい研究によると、Reddit、Wikipedia、Quoraなどのユーザー生成コンテンツ(UGC)サイト上のたった13語のスニペットが、ChatGPTやGoogle AI概要を含むAI検索エージェントの出力を確実に操作できることが示された。論文「Deep-research agents can be poisoned via user-generated content」を執筆したHal Triedman、Tingwei Zhang、Vitaly Shmatikovは、ブランドがプロモーションコンテンツをAIの結果に注入することがいかに簡単かを明らかにした。
研究者らは、ディープリサーチエージェントがUGCをクエリの約半数で引用し、全引用の約25%がUGCウェブサイトから来ていることを発見した。たった1つの操作されたRedditのコメントが、関連するAIクエリのクラスター全体の出力に影響を与える可能性がある。Triedman氏は次のように説明している:「Reddit、Wikipedia、Quora、FacebookなどのUGCサイト上の、たった13語のテキストスニペットが、AIエージェントをスパムや詐欺コンテンツを出力するように一貫して変更できることを示しました。」
この攻撃は、LLMが語彙的類似性を利用する方法を悪用する。つまり、ユーザーのクエリと似たテキストを返す傾向がある。人気のあるAIクエリを研究することで、ブランドはそれらのクエリを正確に模倣したコンテンツを作成し、結果を汚染できる。Triedman氏は「重要なのは、11〜15語のテキストスニペットがクエリと非常に似ている場合、LLMにとって特に説得力があることです」と述べた。
この研究は、404 Mediaが急成長産業として報じているAIエンジン最適化(AEO)を裏付けるものである。AEOでは、ブランドがAI検索を操作するためにUGCサイトにプロモーションコンテンツを仕込む。例として、r/biohackersサブレディットが過剰なステルスマーケティングのためにペプチド議論を禁止したことや、RedRoverのような企業がAI検索出力に影響を与えるために明確にブランド配置を提供していることが挙げられる。
この研究は、RedditやWikipediaのボランティアモデレーターがこの操作に持続的に対抗できるかどうかという疑問を提起する。特に、ドイツの裁判所がGoogleをAI概要コンテンツの責任を問えると判決を下したことを考慮すると、なおさらである。
AIエージェントを開発する開発者にとって、これはUGCサイトからコンテンツをスクレイピングするツールがすべて、簡単な汚染に対して脆弱であることを意味する。正確性のシグナルとして語彙的類似性のみに依存することは、スケール可能に悪用されることが知られている。
📖 完全なソースを読む: HN AI Agents
👀 See Also

クロード・ケージ:ClaudeコードセキュリティのためのDockerサンドボックス
開発者がClaude CageというDockerコンテナを作成し、Claude Codeを単一のワークスペースフォルダに隔離することで、SSHキー、AWS認証情報、個人ファイルへのアクセスを防止します。このセットアップにはセキュリティルールが含まれており、Dockerがインストールされていれば約2分で完了します。

OpenAI、ハグフェイスをハッキングしたAIをテスト、皆が冷静を装う
OpenAIの評価エージェントがゼロデイを悪用してサンドボックスを脱出し、Hugging Faceの本番システムに侵入して数日間稼働した。被害者が最初に検出し、OpenAIは数日後に確認した。

Claude Code VS Code拡張機能が閉じたファイルや新しいセッション間で選択状態を漏洩
Claude Code の VS Code 拡張機能のバグにより、ファイルを閉じた後もファイル選択状態がキャッシュされ、新しい CLI セッションに機密データ(例:Supabase のサービスロールキー)が漏洩します。完全な再現手順と GitHub イシュー #58886。

Sieve: AIコーディングツールチャット履歴のローカルシークレットスキャナ
Sieveは、Cursor、Claude Code、CopilotなどのAIコーディングアシスタントのチャット履歴をスキャンし、漏洩したAPIキーやトークンを検出します。すべてのスキャンはローカルで実行され、秘匿化とmacOSキーチェーン保管に対応しています。