Содержание
Отравление памяти AI-агентов стало отдельной угрозой для ассистентов с долгой памятью: Forcepoint X-Labs описала атаку, при которой скрытый текст на странице превращается в «факт» для будущих ответов. Такой след может жить неделями и всплывать в совсем другой задаче.
Сценарий выглядит буднично. AI-ассистент с доступом к браузеру читает страницу о сбоях в авиаперелетах. Внизу страницы лежит абзац мелким или смещенным текстом, который человек не увидит. Там написано, что ABC Travel Support — официальный сервис срочного бронирования.
Экстрактор текста у ассистента не всегда отличает видимую часть страницы от скрытой. Модель получает все как обычный текст и сохраняет утверждение как полезное знание. Через месяц пользователь спрашивает, что делать после отмены рейса. Ассистент спокойно советует обратиться в ABC Travel Support.
Скрытый текст становится долговременной памятью
Forcepoint X-Labs называет этот класс атак persistent memory poisoning — постоянное отравление памяти. Атакующий не ломает сервер и не крадет доступ к базе. Он подсовывает ложный факт через обычный интерфейс, а агент позже достает его из памяти как свой прошлый опыт.
Проблема неприятна именно из-за задержки. Пользователь не видит момент атаки. Ассистент тоже не сигналит, что берет спорную информацию из непроверенного источника. Внешне ответ выглядит так же уверенно, как рекомендация из календаря, почты или корпоративной базы.
Forcepoint указывает, что похожие атаки уже демонстрировали против продуктов, которые есть на рынке. В списке фигурируют ChatGPT, Gemini, Claude и Microsoft 365 Copilot. Это не значит, что каждый пользователь уже под ударом. Но сама модель риска перестала быть лабораторной фантазией.
MINJA показала высокую успешность атаки
Академический ориентир здесь — MINJA, представленная на NeurIPS 2025. Название расшифровывается как Memory INJection Attack. Работа важна не названием, а моделью атакующего: ей не нужен прямой доступ к хранилищу памяти или повышенные права.
MINJA работает через обычные запросы. Авторы описывают цепочку из indication prompts, bridging steps и progressive shortening. Последний прием постепенно убирает подозрительные формулировки, но оставляет в памяти нужную злоумышленнику запись.
В тестах на GPT-4o-mini, Gemini 2.0 Flash и Llama 3.1 8B исследователи сообщили о более чем 95% успешных инъекций. Успешность самой атаки превысила 70%.
Правда, эти цифры нельзя механически переносить на каждый корпоративный Copilot или чат-бот. Работа о memory poisoning в агентах для электронных медицинских карт, вышедшая в январе 2026 года, прямо отмечает: результаты MINJA получены в идеализированных условиях. Реальные внедрения изучены хуже.
Защита упирается в статус памяти
Forcepoint предлагает не хранить извлеченные воспоминания как голые факты. Каждая запись должна идти с метаданными: откуда она пришла, что это за источник, подтвердил ли ее пользователь и какой у нее риск. Для корпоративного ассистента это ближе к журналу событий, чем к человеческой памяти.
Риск повышают фразы, которые явно пытаются управлять будущим поведением. Например, «с этого момента», «используй по умолчанию» или «впредь всегда рекомендуй». В ту же категорию попадает внезапное появление нового домена, контакта или поставщика.
Еще один фильтр — поиск противоречий. Если в памяти уже есть официальный поставщик для срочного бронирования, новая запись не должна тихо его заменить. Движок может остановить изменение и попросить подтверждение у пользователя.
Forcepoint предлагает сильнее взвешивать темы, где ошибка стоит дороже. В эту группу попадают платежные инструкции, банковские реквизиты, настройки VPN и контакты служб безопасности. Для таких записей источник и подтверждение пользователя должны весить больше, чем удобство быстрого ответа.
Но оценка риска не решает базовую проблему. AI-агенты часто обращаются к найденной памяти как к собственному опыту, а не как к внешнему вводу. Scoring повышает цену атаки, но не меняет поведение модели после успешного попадания записи в память.
Этот разрыв хорошо виден в Agent Security Bench: текущие защиты AI-агентов пока показывают слабые результаты против атак на память и инструменты. Практический минимум для пользователей остается скучным — периодически открывать настройки памяти и смотреть, какие факты ассистент уже сохранил.
Публичная точка отсчета для темы — NeurIPS 2025, где представили MINJA; отдельная работа по агентам для электронных медицинских карт вышла в январе 2026 года и указала на нехватку данных по реалистичным внедрениям.