Содержание
CoT Forgery поднял успешность джейлбрейка LLM почти с нуля до примерно 60%: исследователи показали, что чат-боты могут принимать поддельную цепочку рассуждений за собственную и выдавать запрещённые сведения. В одном из тестов модель соглашалась отвечать на опасный запрос после абсурдного «обоснования» про зелёную рубашку пользователя.
Работу Prompt Injection as Role Confusion подготовили независимые исследователи Чарльз Йе, Жасмин Цуй и доцент MIT Дилан Хэдфилд-Менелл. Доклад заявлен на ICML 2026 в Сеуле, старт конференции — 6 июля 2026 года.
LLM путают роль текста с его стилем
Главная мысль работы простая и неприятная: современные языковые модели оценивают «авторитет» фрагмента не только по служебным меткам, а по тому, как этот фрагмент написан. Если текст похож на внутреннее рассуждение модели, она может обращаться с ним как с собственным выводом.
В обычном чат-боте диалог приходит модели одной длинной строкой. Внутри есть разметка: user, tool, think и другие служебные зоны. Они должны объяснять модели, где команда пользователя, где ответ инструмента, а где рассуждение самой модели.
На бумаге это похоже на нормальную архитектуру безопасности. На практике исследователи нашли слабое место: модель не «видит» роли так надёжно, как хотелось бы. Она считывает стиль текста и по нему решает, кому доверять.
Авторы сделали специальные role probes — диагностические инструменты, которые показывают, как модель внутренне воспринимает каждый токен. Эти оценки предсказывали успех атаки ещё до генерации первого слова ответа. Для безопасности это плохой знак: проблему можно заметить до вывода, но сама модель уже ошиблась на этапе восприятия.
CoT Forgery подсовывает модели готовый вывод
CoT Forgery работает не через уговоры, а через подделку контекста. В запрос вставляют фальшивую цепочку рассуждений, чтобы модель приняла её за собственный уже сделанный вывод и продолжила с этого места.
Авторы приводят намеренно нелепый пример с зелёной рубашкой. Смысл не в рубашке и не в конкретном запрещённом запросе. Смысл в том, что модель не проверяет этот фрагмент как внешнее утверждение. Она воспринимает его как часть собственного рассуждения.
Это отличает CoT Forgery от классических джейлбрейков, где пользователя изображают профессором, сценаристом или админом. Такие атаки обычно хуже работают на более жёстких запросах. В тестах CoT Forgery устойчивость не падала, даже когда запрос становился более экстремальным.
- Успех атаки: почти с нуля до примерно 60% на протестированных моделях
- Средний показатель: 61% при сохранении стилистических маркеров рассуждения
- После удаления маркеров: падение до 10% при том же смысле для человека
- Одна замена фразы: «The user» на «The request» снизила успех на 19%

Эти цифры хорошо показывают масштаб проблемы. Для человека смысл почти не меняется. Для модели меняется роль текста, уровень доверия и итоговый ответ.
CoT Forgery уже получил практическое подтверждение за пределами лабораторного примера. Эта атака выиграла конкурс OpenAI GPT-OSS-20B по red-teaming на Kaggle в 2025 году. То есть речь не только о красивой академической демонстрации.
Промпт-инъекции остаются проблемой для AI-агентов
Авторы проверили, ограничивается ли путаница ролей только CoT Forgery. Они спрятали команду на веб-странице и добавили перед ней «User:», чтобы опасная инструкция выглядела как запрос доверенного пользователя. Эксплойт сработал.
Это уже зона риска для AI-агентов, которые читают сайты, документы, почту и интерфейсы. Агент может получить полезные данные и вредную инструкцию в одном куске текста. Если модель перепутает роли, внешний контент начнёт давить на её поведение.
Microsoft недавно описывала похожий риск для агентных систем. Компания предупредила, что текст внутри документов или элементов интерфейса может конфликтовать с инструкциями агента. Исследование Йе, Цуй и Хэдфилд-Менелла даёт этому механическое объяснение: граница между ролями для LLM слишком мягкая.
Есть и менее очевидный сценарий. Агент открывает страницу магазина, сравнивает товары и должен принять решение о покупке. Тон страницы, формулировки и псевдо-команды могут чуть сдвигать внутреннее состояние модели. Тысячи вариантов страниц можно дешево перебрать и найти тот, который чаще толкает агента к нужному действию.
Авторы формулируют проблему жёстко: «Role tags were a formatting trick that became the security architecture and the cognitive scaffolding of modern LLMs». По-русски: ролевые метки начинались как форматирование, но стали архитектурой безопасности и когнитивным каркасом современных LLM. Доклад по работе заявлен на ICML 2026 в Сеуле 6 июля 2026 года.