Тест Струпа неожиданно стал неприятным фильтром для больших языковых моделей: GPT-4o и Claude 3.5 Sonnet резко теряли точность, когда список слов становился длиннее.

Исследование опубликовали в журнале PNAS Nexus. Авторы проверяли не знание фактов и не качество текста. Они били в более базовую точку — исполнительный контроль внимания.

Тест Струпа проверяет конфликт между чтением и вниманием

В классическом тесте Струпа человеку показывают слово с названием цвета, но окрашивают его другим цветом. Например, слово «красный» печатают синим. Задача — назвать цвет чернил, а не прочитать слово.

Продолжение после рекламы

Мозг в такой ситуации ловит конфликт. Читать слово проще и привычнее, чем подавлять автоматическую реакцию. Поэтому люди отвечают медленнее и иногда ошибаются. Подробнее сам эффект описывает Американская психологическая ассоциация.

Авторы исследования дали LLM две задачи. Первая — читать слова. Вторая — называть цвет. Списки включали 5, 10, 20 и 40 слов. Условия тоже менялись: совпадающие цвета, нейтральные варианты и конфликтные пары.

На чтении слов модели держались неплохо. Проблемы начались там, где слово и цвет не совпадали. То есть именно там, где нужен контроль внимания, а не простое распознавание шаблона.

Изображение к статье: GPT и Claude провалили тест Струпа: проблема внимания ИИ

GPT-4o упал с 91% до 15% на длинном списке

Человек в таких тестах обычно сохраняет около 95% точности даже на длинных испытаниях до часа. У LLM график пошел вниз быстро. Особенно у GPT-4o, который почти развалился на списках из 20 и 40 слов.

Участник теста Условие Точность
Люди Длинные конфликтные тесты около 95%
GPT-4o 5 слов 91%
GPT-4o 10 слов 57%
GPT-4o 20 слов 22%
GPT-4o 40 слов 15%
Claude 3.5 Sonnet 20 слов 76%
Claude 3.5 Sonnet 40 слов 24%

Claude 3.5 Sonnet выглядел крепче на 20 словах. Но на 40 словах он тоже просел до 24%. Для модели такого класса это плохой результат, если сравнивать с человеческим вниманием.

Формулировка авторов жесткая: «значительная деградация двух LLM указывает на фундаментальные ограничения по сравнению с человеческим вниманием». Тут речь не про одну неудачную подсказку. Исследователи видят проблему в самом способе обработки конфликтов.

Старые модели — не вся история

У исследования есть уязвимое место: основные тесты провели на GPT-4o и Claude 3.5 Sonnet. На момент эксперимента это были передовые модели, но к публикации они уже не верх линейки.

Изображение к статье: GPT и Claude провалили тест Струпа: проблема внимания ИИ

Этот нюанс важен. Если бы работа остановилась только на старых версиях, вывод легко было бы списать на темпы рынка. Но авторы добавили проверку новых моделей в сентябре 2025 года: GPT-5, Claude Opus 4.1 и Gemini 2.5 Pro.

По их данным, свежие модели улучшились лишь немного. Они по-прежнему показывали дефицит исполнительного внимания. Выборка там меньше, поэтому этот блок слабее основной части. Но он не дает просто закрыть тему фразой «модели устарели».

Продолжение после рекламы

Есть и хитрый обходной путь. GPT-5 в режиме Thinking может написать код, запустить его и идеально пройти тест. Но авторы считают это обходом ограничения, а не изменением мышления модели. Машина не стала лучше подавлять конфликт. Она просто вынесла задачу во внешний алгоритм.

Почему это важно для AGI

Авторы связывают провал с архитектурой трансформерных LLM. По их версии, развитие моделей слишком часто упирается в память и контекст, но хуже закрывает механизмы внимания: alerting, orienting и executive control.

Если перевести с академического на человеческий, модели отлично продолжают текст и держат огромные куски контекста. Но при конфликте целей они могут терять нить. Для обычного чат-бота это неприятный баг. Для разговоров про AGI — уже архитектурный вопрос.

Мы бы не называли этот тест доказательством, что универсальный ИИ невозможен. Один психологический эксперимент не ломает всю индустрию. Но он хорошо показывает разницу между уверенным текстом и устойчивым целевым поведением.

Финальный вывод авторов звучит так: «включение механизмов исполнительного контроля, похожих на биологическое внимание, критично для достижения искусственного общего интеллекта». Работа вышла в PNAS Nexus, а дополнительную проверку GPT-5, Claude Opus 4.1 и Gemini 2.5 Pro исследователи датируют сентябрем 2025 года.

Рейтинг: 0 / 5. Оценок: 0

Рекомендуем почитать

Оставьте комментарий

Перед оставлением комментария, пожалуйста, ознакомьтесь с правилами комментирования.