Содержание
Лента рекламы, которую вы видите в соцсетях, сама по себе стала источником персональных выводов. Исследователи показали: большие языковые модели (LLM) могут восстановить приватные атрибуты человека, анализируя только набор показанных ему объявлений — без истории браузера и без доступа к аккаунту.
Работу провели команды UNSW Sydney и Queensland University of Technology (QUT). Они изучили, как рекламные платформы формируют «узор» показов, и почему этот узор читается как отпечаток.
435 тысяч объявлений и 891 участник: что проверили исследователи
В основе исследования — массив из более 435 000 рекламных объявлений Facebook, которые собрали у 891 жителя Австралии. Данные получили через citizen science-проект, то есть с участием добровольцев.
Дальше команда взяла общедоступные LLM и попробовала предсказывать характеристики пользователей, опираясь только на то, какие объявления им показывали. Историю просмотров, клики и «персональные данные» модели не получали.
Результат неприятный по своей простоте: по одному лишь потоку рекламы модели смогли делать выводы о человеке.
- Пол: модель делала вывод по паттерну показов
- Возраст: оценка по тематике и «взрослости» рекламы
- Образование: вероятностная классификация по типам предложений
- Занятость: выводы по карьерным и сервисным объявлениям
- Экономическое положение: по ценовым сегментам и категориям товаров
- Политические предпочтения: исследователи отдельно отметили такую возможность
Почему это работает: реклама не случайна, и это видно со стороны
Механика здесь не магическая. Рекламная платформа сначала строит профиль, а потом выбирает, какие объявления отправить именно вам. Эти выборы формируют уникальную последовательность показов.
Если кто-то получает доступ к тому, какие объявления вы видите, он читает эту последовательность как «зеркало» профиля. Платформа не раскрывает ваш профиль напрямую, но выдаёт его косвенно через доставку рекламы.
И ключевой момент: атакующему не нужно взламывать рекламную систему. Ему достаточно наблюдать за тем, что она уже показывает на вашем экране.
Скорость и цена: LLM оказались в разы эффективнее человека
Исследователи сравнили автоматический анализ с ручной работой. По их данным, подход с LLM оказался более чем в 200 раз дешевле и в 50 раз быстрее, чем анализ тех же рекламных паттернов людьми.
Это переводит историю из «экзотики» в практику. Если раньше подобный профайлинг требовал команды аналитиков, то теперь его масштабирует обычный софт.
Ещё один вывод: даже коротких сессий хватало, чтобы модель собрала достаточно сигналов для профиля. Атакующему не нужно наблюдать за человеком неделями.
Самый реалистичный сценарий атаки — расширения браузера
В качестве самого вероятного вектора исследователи называют расширения браузера. Логика простая: многим популярным типам расширений нужны права на чтение содержимого страниц, иначе они не работают.
Это касается, например, блокировщиков рекламы, купонных расширений и переводчиков страниц. Те же разрешения можно использовать, чтобы незаметно собирать рекламные блоки, которые пользователь видит, и отправлять их третьей стороне.
Сценарий опасен скрытностью: расширение продолжает выполнять свою «нормальную» функцию. Пользователь не видит явных симптомов, а рекламная платформа не узнаёт, что её доставка объявлений стала инструментом наблюдения.
Почему VPN не решает проблему
Отдельно подчёркивают: VPN не закрывает эту дыру. Причина банальна: реклама приходит на устройство независимо от того, как вы подключились к интернету. Если наблюдатель видит ваш экран (или содержимое страницы через расширение), он видит и рекламный поток.
Это история не про «утекла история браузера». Это история про то, что сам факт потребления контента создаёт данные, из которых можно делать выводы.
Авторы работы считают, что законы о приватности должны учитывать не только сбор данных, но и то, что можно вывести из пассивно потребляемого контента. Они прямо описывают рекламный поток как «отпечаток», который ИИ уже умеет читать.