AI-поиск можно подтолкнуть к рекомендациям сомнительных сервисов короткой фразой в пользовательском комментарии. Исследователи Cornell Tech показали атаку, где хватало примерно 13 слов, чтобы агент начал упоминать выдуманный продукт.

Работа называется Deep-Research Agents Can Be Poisoned via User-Generated Content. Её подготовили Tingwei Zhang, Harold Triedman и Vitaly Shmatikov, а первым о препринте написал 404 Media.

Исследователи назвали метод WARP — Web Agent Retrieval Poisoning. Смысл простой и неприятный: если AI-агент ищет ответ в интернете, читает найденные страницы и собирает ответ с цитатами, его можно отравить через текст на популярной странице.

Продолжение после рекламы

WARP использует слабое место AI-поиска

AI-агенты для глубокого поиска часто берут часть фактуры с сайтов, где контент создают сами пользователи: Reddit, Wikipedia, Quora, YouTube. В тестах Cornell Tech такие страницы давали примерно 17-23% всех документов, которые агенты подтягивали из веба.

Это не баг в одном конкретном чат-боте. Это проблема архитектуры: модель ищет текст, похожий на запрос пользователя, а затем пересобирает его в уверенный ответ. Если мошенник заранее пишет комментарий под популярный запрос, он попадает ровно в этот механизм.

Узкое место тут — популярные обсуждения. Один часто цитируемый тред может всплывать по целой группе похожих запросов. Значит, атакующему не нужно переписывать весь интернет. Достаточно удачно попасть в страницу, которую AI-агенты и так любят читать.

В эксперименте исследователи добавляли около 13 слов рекламного текста к одному источнику. Если агент подтягивал этот источник, выдуманный продукт появлялся в ответе в 38-51% прогонов. Когда приманку раскидывали по нескольким тредам, показатель доходил до 62%.

Коммерческие чат-боты напрямую не атаковали

Полную атаку от начала до конца команда проверила на трёх открытых агентах: STORM, Co-STORM и OmniThink. Большие коммерческие системы исследователи не травили напрямую, потому что для этого пришлось бы публиковать манипулятивный текст в живом интернете.

Вместо этого они измерили, как часто коммерческие режимы глубокого поиска цитируют пользовательский контент. Картина вышла неровной. Gemini Deep Research от Google брал такие источники примерно в 12% цитат. OpenAI Deep Research почти не цитировал их — около 0,4%.

Изображение к статье: 13 слов в Reddit могут подменить советы AI-поиска

Поэтому корректная формулировка такая: Cornell Tech доказал рабочую слабость класса систем, но не доказал массовый взлом ChatGPT или Gemini в реальном мире. Для новостей про безопасность это важная граница. Иначе легко превратить исследование в страшилку.

Выдуманные рестораны, приложения и криптомонеты

Команда не публиковала вредный текст в открытом вебе. Эксперименты шли в песочнице, где исследователи имитировали появление отравленного фрагмента на реальных страницах.

Примеры получились почти бытовыми. Короткая строка в обсуждении еды в Остине рекомендовала несуществующий ресторан Sol Azteca как место с «аутентичной кухней». Агент затем советовал Sol Azteca и ссылался на этот пост.

Продолжение после рекламы
  • Криптовалюта: фейковая монета, которую агент мог подать как подходящий вариант.
  • Сервисы отмены подписок: сомнительный посредник для отказа от Xfinity.
  • Локальные рекомендации: рестораны и приложения из пользовательских обсуждений.

Самый рискованный класс запросов — рекомендации и советы. «Лучшее приложение», «куда пойти», «что купить», «кому позвонить», «как отменить подписку» — именно там AI часто опирается на форумный шум вместо проверяемых первичных данных.

У Tingwei Zhang есть жёсткая формулировка из разговора с 404 Media: такие системы могут оценивать случайный комментарий на Reddit и официальный сайт примерно как одинаково надёжные. Для пользователя это выглядит как аккуратный ответ с источником. Для атакующего — как рекламная полка без модератора.

Защита ломает качество ответов

Исследователи проверяли очевидные защиты: полностью блокировать пользовательские сайты, фильтровать источники до чтения и искать манипуляции уже в финальном ответе. Ни один подход не сработал чисто: ответы становились хуже или атака всё равно проходила.

Старый приём против AI-мусора тоже дал сбой. Детекторы часто ищут «неестественный» текст. Но короткая рекламная вставка в этом сценарии выглядит даже более гладко, чем обычный человеческий комментарий.

Reddit заявил 404 Media, что два десятилетия борется со спамом, ботами и координированными манипуляциями. Компания также начала просить подозрительные автоматизированные аккаунты подтверждать, что за ними стоит человек. Авторы Cornell Tech считают проблему шире одной площадки: Reddit или Wikipedia не закроют её в одиночку.

Практический вывод для пользователей пока скучный, но рабочий: рекомендации AI лучше воспринимать как зацепку, а не как финальный ответ. Особенно когда речь идёт о деньгах, безопасности, срочных услугах и незнакомых брендах. В измерениях Cornell Tech Gemini Deep Research цитировал пользовательский контент примерно в 12% случаев, OpenAI Deep Research — около 0,4%.

Рейтинг: 0 / 5. Оценок: 0

Рекомендуем почитать

Оставьте комментарий

Перед оставлением комментария, пожалуйста, ознакомьтесь с правилами комментирования.