Исследование Корнелла: 13 слов в Reddit могут манипулировать ИИ-поиском

Новое исследование Корнеллского университета показывает, что один фрагмент из 13 слов на сайтах с пользовательским контентом (UGC), таких как Reddit, Wikipedia или Quora, может надежно манипулировать результатами AI-поисковых агентов — включая ChatGPT и сводки Google AI. Статья «Deep-research agents can be poisoned via user-generated content» (авторы: Хэл Тридман, Тинвэй Чжан и Виталий Шматиков) раскрывает, насколько просто брендам внедрять рекламный контент в результаты AI.
Исследователи обнаружили, что глубокие исследовательские агенты ссылаются на UGC примерно в половине всех запросов, и почти 25% всех цитат приходится на сайты UGC. Один отравленный комментарий на Reddit может повлиять на результаты целого кластера связанных AI-запросов. Тридман пояснил: «Мы показываем, что крошечный фрагмент — всего 13 слов — извлеченного текста на UGC-сайте, таком как Reddit, Wikipedia, Quora, Facebook и т.д., может достаточно последовательно заставить AI-агентов выдавать спам/мошеннический контент».
Атака использует то, как LLM применяют лексическое сходство: они склонны возвращать текст, похожий по чтению на запрос пользователя. Изучая популярные AI-запросы, бренды могут создавать контент, точно отражающий эти запросы, отравляя результаты. «Один из ключевых моментов: если фрагмент из 11–15 слов очень похож на запрос, он может быть особенно убедительным для LLM», — сказал Тридман.
Это подтверждает то, о чем 404 Media сообщало как о процветающей индустрии: AI-инжиниринг поиска (AEO), где бренды размещают рекламный контент на UGC-сайтах для манипуляции AI-поиском. Примеры включают запрет обсуждения пептидов на сабреддите r/biohackers из-за массового астротурфинга и компанию RedRover, предлагающую размещение брендов для явного влияния на результаты AI-поиска.
Исследование поднимает вопросы о том, смогут ли добровольные модераторы на Reddit и Wikipedia устойчиво защищаться от этой манипуляции, особенно после того, как немецкий суд постановил, что Google может нести ответственность за контент AI-сводок.
Для разработчиков AI-агентов: это означает, что любой инструмент, который извлекает данные с UGC-сайтов для контекста, уязвим для тривиального отравления. Полагаться только на лексическое сходство как на сигнал точности теперь известно как эксплуатируемое в масштабе.
📖 Читать полный источник: HN AI Agents
👀 Смотрите также

Сканирование безопасности пакетов MCP выявляет широко распространенные деструктивные возможности без подтверждения
Сканирование безопасности 2,386 пакетов MCP в npm показало, что 63,5% из них предоставляют деструктивные операции, такие как удаление файлов и сброс баз данных, без запроса подтверждения у человека. Исследователь обнаружил, что в целом 49% пакетов имеют проблемы с безопасностью, включая 402 критических и 240 уязвимостей высокой степени серьезности.

OpenObscure: Открытый локальный межсетевой экран для защиты конфиденциальности ИИ-агентов
OpenObscure — это открытый межсетевой экран для защиты конфиденциальности, работающий на устройстве и располагающийся между AI-агентами и провайдерами LLM. Он использует FF1 Format-Preserving Encryption с AES-256 для шифрования значений PII до того, как запросы покинут ваше устройство, сохраняя структуру данных и защищая конфиденциальность.

Nullgaze: Выпущен открытую исходный код сканер безопасности с поддержкой ИИ.
Nullgaze — это новый открытый проект, поддерживаемый ИИ, который сканирует безопасность и выявляет уязвимости, специфичные для кода, сгенерированного ИИ, с почти нулевым количеством ложных срабатываний.

jqwik v1.10.0 позволяет скрытое внедрение запросов, которое удаляет код при использовании AI-агентами
Йоханнес Линк добавил скрытую инструкцию в jqwik v1.10.0, которая сообщает ИИ-агентам по кодингу удалить все тесты и код jqwik, скрытую с помощью ANSI-символов. Claude правильно её обнаруживает, но пользователи-люди могут быть не так удачливы.