Исследование Корнелла: 13 слов в Reddit могут манипулировать ИИ-поиском

Новое исследование Корнеллского университета показывает, что один фрагмент из 13 слов на сайтах с пользовательским контентом (UGC), таких как Reddit, Wikipedia или Quora, может надежно манипулировать результатами AI-поисковых агентов — включая ChatGPT и сводки Google AI. Статья «Deep-research agents can be poisoned via user-generated content» (авторы: Хэл Тридман, Тинвэй Чжан и Виталий Шматиков) раскрывает, насколько просто брендам внедрять рекламный контент в результаты AI.
Исследователи обнаружили, что глубокие исследовательские агенты ссылаются на UGC примерно в половине всех запросов, и почти 25% всех цитат приходится на сайты UGC. Один отравленный комментарий на Reddit может повлиять на результаты целого кластера связанных AI-запросов. Тридман пояснил: «Мы показываем, что крошечный фрагмент — всего 13 слов — извлеченного текста на UGC-сайте, таком как Reddit, Wikipedia, Quora, Facebook и т.д., может достаточно последовательно заставить AI-агентов выдавать спам/мошеннический контент».
Атака использует то, как LLM применяют лексическое сходство: они склонны возвращать текст, похожий по чтению на запрос пользователя. Изучая популярные AI-запросы, бренды могут создавать контент, точно отражающий эти запросы, отравляя результаты. «Один из ключевых моментов: если фрагмент из 11–15 слов очень похож на запрос, он может быть особенно убедительным для LLM», — сказал Тридман.
Это подтверждает то, о чем 404 Media сообщало как о процветающей индустрии: AI-инжиниринг поиска (AEO), где бренды размещают рекламный контент на UGC-сайтах для манипуляции AI-поиском. Примеры включают запрет обсуждения пептидов на сабреддите r/biohackers из-за массового астротурфинга и компанию RedRover, предлагающую размещение брендов для явного влияния на результаты AI-поиска.
Исследование поднимает вопросы о том, смогут ли добровольные модераторы на Reddit и Wikipedia устойчиво защищаться от этой манипуляции, особенно после того, как немецкий суд постановил, что Google может нести ответственность за контент AI-сводок.
Для разработчиков AI-агентов: это означает, что любой инструмент, который извлекает данные с UGC-сайтов для контекста, уязвим для тривиального отравления. Полагаться только на лексическое сходство как на сигнал точности теперь известно как эксплуатируемое в масштабе.
📖 Читать полный источник: HN AI Agents
👀 Смотрите также

Обновления безопасности OpenClaw устраняют уязвимости, связанные с раскрытием учетных данных через QR-коды и автоматической загрузкой плагинов.
OpenClaw выпустил два патча безопасности для устранения критических уязвимостей: QR-коды содержали постоянные учетные данные шлюза без срока действия, а плагины автоматически загружались из клонированных репозиториев без подтверждения пользователя. Версия 2026.3.12 исправляет обе проблемы.

BlindKey: Слепая инъекция учетных данных для ИИ-агентов
BlindKey — это инструмент безопасности, который предотвращает доступ агентов ИИ к открытым API-ключам, используя зашифрованные токены хранилища и локальный прокси. Агенты ссылаются на токены, такие как bk://stripe, а прокси внедряет реальный ключ во время запроса.

Аудит безопасности выявил уязвимости в эталонных серверах MCP компании Anthropic, которые создают риски, связанные с генерацией ложных данных.
Аудит безопасности 100 пакетов серверов MCP показал, что 71% получили оценку F, включая официальные референсные реализации Anthropic для GitHub и файловой системы. Аудит выявил Уязвимости на основе Галлюцинаций, которые создают бреши в безопасности и тратят токены через циклы рассуждений.

OpenClaw Skill Analyzer: Статический сканер безопасности для навыков ИИ-агентов
Разработчик создал статический анализатор, который сканирует навыки OpenClaw на наличие угроз безопасности перед установкой, используя более 40 правил обнаружения в 12 категориях, включая инъекцию промптов и эксфильтрацию данных.