Содержание
Тест Струпа неожиданно стал неприятным фильтром для больших языковых моделей: GPT-4o и Claude 3.5 Sonnet резко теряли точность, когда список слов становился длиннее.
Исследование опубликовали в журнале PNAS Nexus. Авторы проверяли не знание фактов и не качество текста. Они били в более базовую точку — исполнительный контроль внимания.
Тест Струпа проверяет конфликт между чтением и вниманием
В классическом тесте Струпа человеку показывают слово с названием цвета, но окрашивают его другим цветом. Например, слово «красный» печатают синим. Задача — назвать цвет чернил, а не прочитать слово.
Мозг в такой ситуации ловит конфликт. Читать слово проще и привычнее, чем подавлять автоматическую реакцию. Поэтому люди отвечают медленнее и иногда ошибаются. Подробнее сам эффект описывает Американская психологическая ассоциация.
Авторы исследования дали LLM две задачи. Первая — читать слова. Вторая — называть цвет. Списки включали 5, 10, 20 и 40 слов. Условия тоже менялись: совпадающие цвета, нейтральные варианты и конфликтные пары.
На чтении слов модели держались неплохо. Проблемы начались там, где слово и цвет не совпадали. То есть именно там, где нужен контроль внимания, а не простое распознавание шаблона.
GPT-4o упал с 91% до 15% на длинном списке
Человек в таких тестах обычно сохраняет около 95% точности даже на длинных испытаниях до часа. У LLM график пошел вниз быстро. Особенно у GPT-4o, который почти развалился на списках из 20 и 40 слов.
| Участник теста | Условие | Точность |
|---|---|---|
| Люди | Длинные конфликтные тесты | около 95% |
| GPT-4o | 5 слов | 91% |
| GPT-4o | 10 слов | 57% |
| GPT-4o | 20 слов | 22% |
| GPT-4o | 40 слов | 15% |
| Claude 3.5 Sonnet | 20 слов | 76% |
| Claude 3.5 Sonnet | 40 слов | 24% |
Claude 3.5 Sonnet выглядел крепче на 20 словах. Но на 40 словах он тоже просел до 24%. Для модели такого класса это плохой результат, если сравнивать с человеческим вниманием.
Формулировка авторов жесткая: «значительная деградация двух LLM указывает на фундаментальные ограничения по сравнению с человеческим вниманием». Тут речь не про одну неудачную подсказку. Исследователи видят проблему в самом способе обработки конфликтов.
Старые модели — не вся история
У исследования есть уязвимое место: основные тесты провели на GPT-4o и Claude 3.5 Sonnet. На момент эксперимента это были передовые модели, но к публикации они уже не верх линейки.

Этот нюанс важен. Если бы работа остановилась только на старых версиях, вывод легко было бы списать на темпы рынка. Но авторы добавили проверку новых моделей в сентябре 2025 года: GPT-5, Claude Opus 4.1 и Gemini 2.5 Pro.
По их данным, свежие модели улучшились лишь немного. Они по-прежнему показывали дефицит исполнительного внимания. Выборка там меньше, поэтому этот блок слабее основной части. Но он не дает просто закрыть тему фразой «модели устарели».
Есть и хитрый обходной путь. GPT-5 в режиме Thinking может написать код, запустить его и идеально пройти тест. Но авторы считают это обходом ограничения, а не изменением мышления модели. Машина не стала лучше подавлять конфликт. Она просто вынесла задачу во внешний алгоритм.
Почему это важно для AGI
Авторы связывают провал с архитектурой трансформерных LLM. По их версии, развитие моделей слишком часто упирается в память и контекст, но хуже закрывает механизмы внимания: alerting, orienting и executive control.
Если перевести с академического на человеческий, модели отлично продолжают текст и держат огромные куски контекста. Но при конфликте целей они могут терять нить. Для обычного чат-бота это неприятный баг. Для разговоров про AGI — уже архитектурный вопрос.
Мы бы не называли этот тест доказательством, что универсальный ИИ невозможен. Один психологический эксперимент не ломает всю индустрию. Но он хорошо показывает разницу между уверенным текстом и устойчивым целевым поведением.
Финальный вывод авторов звучит так: «включение механизмов исполнительного контроля, похожих на биологическое внимание, критично для достижения искусственного общего интеллекта». Работа вышла в PNAS Nexus, а дополнительную проверку GPT-5, Claude Opus 4.1 и Gemini 2.5 Pro исследователи датируют сентябрем 2025 года.