Исследование Корнелла: 13 слов в Reddit могут манипулировать ИИ-поиском

✍️ OpenClawRadar📅 Опубликовано: 28 июня 2026 г.🔗 Source
Исследование Корнелла: 13 слов в Reddit могут манипулировать ИИ-поиском
Ad

Новое исследование Корнеллского университета показывает, что один фрагмент из 13 слов на сайтах с пользовательским контентом (UGC), таких как Reddit, Wikipedia или Quora, может надежно манипулировать результатами AI-поисковых агентов — включая ChatGPT и сводки Google AI. Статья «Deep-research agents can be poisoned via user-generated content» (авторы: Хэл Тридман, Тинвэй Чжан и Виталий Шматиков) раскрывает, насколько просто брендам внедрять рекламный контент в результаты AI.

Исследователи обнаружили, что глубокие исследовательские агенты ссылаются на UGC примерно в половине всех запросов, и почти 25% всех цитат приходится на сайты UGC. Один отравленный комментарий на Reddit может повлиять на результаты целого кластера связанных AI-запросов. Тридман пояснил: «Мы показываем, что крошечный фрагмент — всего 13 слов — извлеченного текста на UGC-сайте, таком как Reddit, Wikipedia, Quora, Facebook и т.д., может достаточно последовательно заставить AI-агентов выдавать спам/мошеннический контент».

Атака использует то, как LLM применяют лексическое сходство: они склонны возвращать текст, похожий по чтению на запрос пользователя. Изучая популярные AI-запросы, бренды могут создавать контент, точно отражающий эти запросы, отравляя результаты. «Один из ключевых моментов: если фрагмент из 11–15 слов очень похож на запрос, он может быть особенно убедительным для LLM», — сказал Тридман.

Ad

Это подтверждает то, о чем 404 Media сообщало как о процветающей индустрии: AI-инжиниринг поиска (AEO), где бренды размещают рекламный контент на UGC-сайтах для манипуляции AI-поиском. Примеры включают запрет обсуждения пептидов на сабреддите r/biohackers из-за массового астротурфинга и компанию RedRover, предлагающую размещение брендов для явного влияния на результаты AI-поиска.

Исследование поднимает вопросы о том, смогут ли добровольные модераторы на Reddit и Wikipedia устойчиво защищаться от этой манипуляции, особенно после того, как немецкий суд постановил, что Google может нести ответственность за контент AI-сводок.

Для разработчиков AI-агентов: это означает, что любой инструмент, который извлекает данные с UGC-сайтов для контекста, уязвим для тривиального отравления. Полагаться только на лексическое сходство как на сигнал точности теперь известно как эксплуатируемое в масштабе.

📖 Читать полный источник: HN AI Agents

Ad

👀 Смотрите также

Сканирование безопасности пакетов MCP выявляет широко распространенные деструктивные возможности без подтверждения
Безопасность

Сканирование безопасности пакетов MCP выявляет широко распространенные деструктивные возможности без подтверждения

Сканирование безопасности 2,386 пакетов MCP в npm показало, что 63,5% из них предоставляют деструктивные операции, такие как удаление файлов и сброс баз данных, без запроса подтверждения у человека. Исследователь обнаружил, что в целом 49% пакетов имеют проблемы с безопасностью, включая 402 критических и 240 уязвимостей высокой степени серьезности.

OpenClawRadar
OpenObscure: Открытый локальный межсетевой экран для защиты конфиденциальности ИИ-агентов
Безопасность

OpenObscure: Открытый локальный межсетевой экран для защиты конфиденциальности ИИ-агентов

OpenObscure — это открытый межсетевой экран для защиты конфиденциальности, работающий на устройстве и располагающийся между AI-агентами и провайдерами LLM. Он использует FF1 Format-Preserving Encryption с AES-256 для шифрования значений PII до того, как запросы покинут ваше устройство, сохраняя структуру данных и защищая конфиденциальность.

OpenClawRadar
Nullgaze: Выпущен открытую исходный код сканер безопасности с поддержкой ИИ.
Безопасность

Nullgaze: Выпущен открытую исходный код сканер безопасности с поддержкой ИИ.

Nullgaze — это новый открытый проект, поддерживаемый ИИ, который сканирует безопасность и выявляет уязвимости, специфичные для кода, сгенерированного ИИ, с почти нулевым количеством ложных срабатываний.

OpenClawRadar
jqwik v1.10.0 позволяет скрытое внедрение запросов, которое удаляет код при использовании AI-агентами
Безопасность

jqwik v1.10.0 позволяет скрытое внедрение запросов, которое удаляет код при использовании AI-агентами

Йоханнес Линк добавил скрытую инструкцию в jqwik v1.10.0, которая сообщает ИИ-агентам по кодингу удалить все тесты и код jqwik, скрытую с помощью ANSI-символов. Claude правильно её обнаруживает, но пользователи-люди могут быть не так удачливы.

OpenClawRadar