Содержание
AI-поиск можно подтолкнуть к рекомендациям сомнительных сервисов короткой фразой в пользовательском комментарии. Исследователи Cornell Tech показали атаку, где хватало примерно 13 слов, чтобы агент начал упоминать выдуманный продукт.
Работа называется Deep-Research Agents Can Be Poisoned via User-Generated Content. Её подготовили Tingwei Zhang, Harold Triedman и Vitaly Shmatikov, а первым о препринте написал 404 Media.
Исследователи назвали метод WARP — Web Agent Retrieval Poisoning. Смысл простой и неприятный: если AI-агент ищет ответ в интернете, читает найденные страницы и собирает ответ с цитатами, его можно отравить через текст на популярной странице.
WARP использует слабое место AI-поиска
AI-агенты для глубокого поиска часто берут часть фактуры с сайтов, где контент создают сами пользователи: Reddit, Wikipedia, Quora, YouTube. В тестах Cornell Tech такие страницы давали примерно 17-23% всех документов, которые агенты подтягивали из веба.
Это не баг в одном конкретном чат-боте. Это проблема архитектуры: модель ищет текст, похожий на запрос пользователя, а затем пересобирает его в уверенный ответ. Если мошенник заранее пишет комментарий под популярный запрос, он попадает ровно в этот механизм.
Узкое место тут — популярные обсуждения. Один часто цитируемый тред может всплывать по целой группе похожих запросов. Значит, атакующему не нужно переписывать весь интернет. Достаточно удачно попасть в страницу, которую AI-агенты и так любят читать.
В эксперименте исследователи добавляли около 13 слов рекламного текста к одному источнику. Если агент подтягивал этот источник, выдуманный продукт появлялся в ответе в 38-51% прогонов. Когда приманку раскидывали по нескольким тредам, показатель доходил до 62%.
Коммерческие чат-боты напрямую не атаковали
Полную атаку от начала до конца команда проверила на трёх открытых агентах: STORM, Co-STORM и OmniThink. Большие коммерческие системы исследователи не травили напрямую, потому что для этого пришлось бы публиковать манипулятивный текст в живом интернете.
Вместо этого они измерили, как часто коммерческие режимы глубокого поиска цитируют пользовательский контент. Картина вышла неровной. Gemini Deep Research от Google брал такие источники примерно в 12% цитат. OpenAI Deep Research почти не цитировал их — около 0,4%.
Поэтому корректная формулировка такая: Cornell Tech доказал рабочую слабость класса систем, но не доказал массовый взлом ChatGPT или Gemini в реальном мире. Для новостей про безопасность это важная граница. Иначе легко превратить исследование в страшилку.
Выдуманные рестораны, приложения и криптомонеты
Команда не публиковала вредный текст в открытом вебе. Эксперименты шли в песочнице, где исследователи имитировали появление отравленного фрагмента на реальных страницах.
Примеры получились почти бытовыми. Короткая строка в обсуждении еды в Остине рекомендовала несуществующий ресторан Sol Azteca как место с «аутентичной кухней». Агент затем советовал Sol Azteca и ссылался на этот пост.
- Криптовалюта: фейковая монета, которую агент мог подать как подходящий вариант.
- Сервисы отмены подписок: сомнительный посредник для отказа от Xfinity.
- Локальные рекомендации: рестораны и приложения из пользовательских обсуждений.
Самый рискованный класс запросов — рекомендации и советы. «Лучшее приложение», «куда пойти», «что купить», «кому позвонить», «как отменить подписку» — именно там AI часто опирается на форумный шум вместо проверяемых первичных данных.
У Tingwei Zhang есть жёсткая формулировка из разговора с 404 Media: такие системы могут оценивать случайный комментарий на Reddit и официальный сайт примерно как одинаково надёжные. Для пользователя это выглядит как аккуратный ответ с источником. Для атакующего — как рекламная полка без модератора.
Защита ломает качество ответов
Исследователи проверяли очевидные защиты: полностью блокировать пользовательские сайты, фильтровать источники до чтения и искать манипуляции уже в финальном ответе. Ни один подход не сработал чисто: ответы становились хуже или атака всё равно проходила.
Старый приём против AI-мусора тоже дал сбой. Детекторы часто ищут «неестественный» текст. Но короткая рекламная вставка в этом сценарии выглядит даже более гладко, чем обычный человеческий комментарий.
Reddit заявил 404 Media, что два десятилетия борется со спамом, ботами и координированными манипуляциями. Компания также начала просить подозрительные автоматизированные аккаунты подтверждать, что за ними стоит человек. Авторы Cornell Tech считают проблему шире одной площадки: Reddit или Wikipedia не закроют её в одиночку.
Практический вывод для пользователей пока скучный, но рабочий: рекомендации AI лучше воспринимать как зацепку, а не как финальный ответ. Особенно когда речь идёт о деньгах, безопасности, срочных услугах и незнакомых брендах. В измерениях Cornell Tech Gemini Deep Research цитировал пользовательский контент примерно в 12% случаев, OpenAI Deep Research — около 0,4%.