Redditの13語がAI検索を操作可能:コーネル大学の研究

コーネル大学の新しい研究によると、Reddit、Wikipedia、Quoraなどのユーザー生成コンテンツ(UGC)サイト上のたった13語のスニペットが、ChatGPTやGoogle AI概要を含むAI検索エージェントの出力を確実に操作できることが示された。論文「Deep-research agents can be poisoned via user-generated content」を執筆したHal Triedman、Tingwei Zhang、Vitaly Shmatikovは、ブランドがプロモーションコンテンツをAIの結果に注入することがいかに簡単かを明らかにした。
研究者らは、ディープリサーチエージェントがUGCをクエリの約半数で引用し、全引用の約25%がUGCウェブサイトから来ていることを発見した。たった1つの操作されたRedditのコメントが、関連するAIクエリのクラスター全体の出力に影響を与える可能性がある。Triedman氏は次のように説明している:「Reddit、Wikipedia、Quora、FacebookなどのUGCサイト上の、たった13語のテキストスニペットが、AIエージェントをスパムや詐欺コンテンツを出力するように一貫して変更できることを示しました。」
この攻撃は、LLMが語彙的類似性を利用する方法を悪用する。つまり、ユーザーのクエリと似たテキストを返す傾向がある。人気のあるAIクエリを研究することで、ブランドはそれらのクエリを正確に模倣したコンテンツを作成し、結果を汚染できる。Triedman氏は「重要なのは、11〜15語のテキストスニペットがクエリと非常に似ている場合、LLMにとって特に説得力があることです」と述べた。
この研究は、404 Mediaが急成長産業として報じているAIエンジン最適化(AEO)を裏付けるものである。AEOでは、ブランドがAI検索を操作するためにUGCサイトにプロモーションコンテンツを仕込む。例として、r/biohackersサブレディットが過剰なステルスマーケティングのためにペプチド議論を禁止したことや、RedRoverのような企業がAI検索出力に影響を与えるために明確にブランド配置を提供していることが挙げられる。
この研究は、RedditやWikipediaのボランティアモデレーターがこの操作に持続的に対抗できるかどうかという疑問を提起する。特に、ドイツの裁判所がGoogleをAI概要コンテンツの責任を問えると判決を下したことを考慮すると、なおさらである。
AIエージェントを開発する開発者にとって、これはUGCサイトからコンテンツをスクレイピングするツールがすべて、簡単な汚染に対して脆弱であることを意味する。正確性のシグナルとして語彙的類似性のみに依存することは、スケール可能に悪用されることが知られている。
📖 完全なソースを読む: HN AI Agents
👀 See Also

Claude Flowリポジトリのskill.mdファイルにトロイの木馬が検出されました
Claude Flowのスキルファイルを含むGitHubリポジトリから、JS/CrypoStealz.AE!MTBと識別されるトロイの木馬が発見されました。このマルウェアは、AIベースのIDEがマークダウンファイルを読み取るためにフォルダを開いた際に自動的に起動しました。

PyPIサプライチェーン攻撃後のlitellmに代わる3つのオープンソース代替案
PyPI上のlitellmバージョン1.82.7と1.82.8は、サプライチェーン攻撃により認証情報を盗むマルウェアに侵害されました。AIコーディングエージェントを使用している開発者で移行が必要な方のために、ソースで言及されている3つのオープンソース代替案を紹介します。

アンソピック社のコンピューター利用機能、実テストでガバナンスのロックダウンを引き起こす
Anthropicはコンピュータ利用機能をリリースしました。ガバナンス制御の実装中に、リスク閾値がLOCKDOWNモードを引き起こし、オペレーター自身のガバナンス作業を含むすべての変更操作をブロックしました。

AIコーディングアシスタントのための必須ファイルブロッキング:実践的なセキュリティチェックリスト
AIコーディングアシスタントは、リポジトリだけでなくローカルディスクからも読み取るため、.gitignoreでGitHubへのプッシュから保護されているファイルもエージェントに晒される。Redditの議論では、APIキーを含むAIアシスタント設定、サービス認証情報、SSHキー、環境ファイルなど、ブロックすべき重要なファイルが特定されている。