GPT-4 смог заранее оценить, как группы людей ответят на вопросы о личности. В исследовании iScience модель предсказала средние результаты до того, как участники вообще начали заполнять анкеты.

Звучит как очередной заголовок про «ИИ читает мысли». Но аккуратнее: речь не про конкретного человека за экраном. Исследователи проверяли, может ли модель уловить массовые паттерны ответов, спрятанные в языке и формулировках вопросов.

Работу провели Ротем Монса, Авив Зоар и Шахар Арзи из Еврейского университета и Медицинского центра Хадасса. Они сравнили прогнозы GPT-4 с ответами 600 участников и с классическим тестом Big Five Inventory.

Продолжение после рекламы

GPT-4 угадал средние ответы до опроса людей

Команда дала GPT-4 две разные текстовые базы и попросила собрать из них личностные опросники. Затем модель заранее оценила средний балл по каждому вопросу на пятибалльной шкале Лайкерта, а исследователи сравнили прогноз с реальными ответами людей.

Первый набор вопросов опирался на DSM-5 — клиническое руководство, которым психиатры пользуются для диагностики расстройств личности. Второй взяли из учебника по астрологии, где каждому знаку зодиака приписывают набор черт.

Выбор специально сделали контрастным. Ротем Монса объяснил это так: «Мы хотели выбрать тексты, которые богато описывают человеческую личность, но находятся на противоположных концах спектра по научной обоснованности».

Изображение к статье: GPT-4 предсказал ответы людей в тестах личности

Результат получился нервный для тех, кто привык считать LLM просто автодополнением. Корреляция между прогнозами GPT-4 и средними ответами людей достигла 0,71 для вопросов на базе DSM-5. Для астрологического опросника показатель оказался еще выше — 0,85.

Это не значит, что астрология внезапно стала научнее психиатрии. Исследователи отдельно показали, что у астрологического опросника слабее внутренняя согласованность. Проще говоря, его вопросы хуже держались как единая измерительная система.

  • DSM-5: корреляция прогнозов GPT-4 с реальными средними ответами — 0,71
  • Астрологический текст: корреляция прогнозов GPT-4 с реальными средними ответами — 0,85
  • Связи между вопросами: GPT-4 предсказал их с корреляцией 0,74 для DSM и 0,69 для астрологии
  • Выборка: 600 участников плюс сравнение с Big Five Inventory

Руководство от духовки Bosch тоже породило «личность»

Самый показательный тест начался там, где психологии вообще не было. Исследователи дали GPT-4 инструкцию к духовке Bosch и литературное описание пейзажа из «Властелина колец». Модель все равно сгенерировала вопросы, похожие на личностный тест.

Вот здесь и начинается полезная трезвость. GPT-4 умеет собирать убедительно звучащие формулировки, даже когда исходный текст не описывает характер человека. У модели явно сильная связь между языковыми шаблонами, описаниями поведения и привычной структурой анкет.

Но убедительный вопрос не равен хорошему измерению. В таких наборах появлялись слабые, узкие или плохо связанные пункты. Они похожи на психологический инструмент внешне, но могут не мерить ту черту, которую исследователь хотел изучить.

Изображение к статье: GPT-4 предсказал ответы людей в тестах личности

Статистика подтвердила эту разницу. Big Five лучше всего совпал с ожидаемой структурой факторов. Опросники на базе DSM-5 и астрологии показали более слабое соответствие confirmatory factor model. Астрологические пункты не сохранили исходную «стихийную» структуру и сложились в более широкие паттерны, похожие на признанные личностные измерения.

Продолжение после рекламы

Модель видит популяцию, но не диагноз конкретного человека

Авторы исследования формулируют вывод осторожно: GPT-4 может предсказывать агрегированные ответы людей по тексту с измеримой точностью. Это не доказывает, что такой опросник точно измерит личность отдельного человека или заменит психолога.

Разница принципиальная. Средний прогноз по группе может совпасть с будущими ответами, потому что модель выучила частотные связи из огромного массива текстов. Но индивидуальная диагностика требует надежности, проверки шкал и клинического контекста.

В работе есть еще одна деталь. Астрологические меры показали сопоставимую предсказательную силу для многих жизненных исходов, но хуже работали для показателей психического здоровья. Это хорошо охлаждает восторг от цифры 0,85.

Для пользователей ChatGPT вывод практичный. Большие языковые модели не просто подбирают следующее слово в бытовом смысле. Они впитывают устойчивые связи между языком, самоописанием и поведением людей. Поэтому ответы выглядят не только грамотными, но и психологически правдоподобными.

Монса сформулировал это прямо: «Поскольку личностные черты отражаются в языке, LLM могли выучить структуру человеческой личности как естественный побочный продукт обучения. Их не учили специально психологии или теориям личности, но они уже встроены в язык, на котором учатся LLM».

Рейтинг: 0 / 5. Оценок: 0

Рекомендуем почитать

Оставьте комментарий

Перед оставлением комментария, пожалуйста, ознакомьтесь с правилами комментирования.