Содержание
Pew Research Center оценил, сколько веб-страниц пишут с участием ИИ, и цифра получилась заметной: 35% страниц, опубликованных после запуска ChatGPT, показывают признаки машинной генерации или серьёзной ИИ-редактуры.
Это не означает, что треть интернета теперь целиком пишет бот. Исследователи говорят аккуратнее: автоматическая модель нашла текстовые признаки ИИ-авторства. Но для веба это уже не лабораторная история, а массовая практика.
Что измерил Pew Research Center
В отчёте «How Much of the Internet Is Written With AI?» Pew Research Center использовал машинное обучение для анализа страниц из проекта Common Crawl. Основная выборка включала 10 000 веб-страниц, собранных из большого архива открытого интернета.
По всей выборке признаки ИИ-авторства нашли у 9,6% страниц. На первый взгляд это немного. Но выборка Common Crawl охватывает веб за десятки лет, а не только свежие публикации.
Картина резко меняется на новых страницах. Среди материалов, опубликованных после запуска ChatGPT в конце 2022 года, доля страниц с признаками ИИ выросла до 35%. Это и есть главный сдвиг: генеративные модели быстро стали рабочим инструментом для массового веб-контента.
Для оценки языковых признаков Pew Research Center отдельно изучил 490 000 англоязычных страниц. Эта часть нужна не для красивой цифры, а для поиска повторяющихся текстовых следов.
.com-домены приняли ИИ быстрее остальных
Большая часть подозрительных страниц, опубликованных в 2026 году, пришлась на домены .com. Обычно это коммерческие сайты: витрины, блоги компаний, SEO-страницы, контентные фермы и сервисные разделы.
У образовательных и государственных доменов картина спокойнее. Среди страниц с признаками ИИ, опубликованных в 2026 году, только 1% пришёлся на .edu, а 0,8% — на .gov. Речь идёт об американских образовательных и государственных доменных зонах.
Это хорошо ложится на здравый смысл. Коммерческому сайту дешевле быстро нарастить десятки страниц под поиск. Университеты и государственные структуры меняют редакционные процессы медленнее, а публикации часто проходят больше согласований.
Похожие выводы ранее показывал исследовательский проект AI on the Internet. Там тоже говорили, что свежий веб заметно быстрее наполняется текстами, написанными или доработанными генеративными моделями.
Как Pew искал машинный текст
Исследователи не сводят ИИ-текст к одному признаку. Длинное тире часто считают маркером ChatGPT, но Pew прямо оговаривает: люди тоже так пишут. Один знак препинания не доказывает машинное авторство.
- Длинное тире: встречается вдвое чаще на страницах после 2023 года.
- Оксфордская запятая: частота выросла на 63%.
- Слова-маркеры: delve, interplay и testament более чем удвоили использование.
- Отрицательный параллелизм: такие конструкции стали встречаться почти втрое чаще.
Последний пункт особенно показателен для тех, кто много читает англоязычные тексты от чат-ботов. Модель любит строить фразу через контраст: сначала отсекает простое объяснение, затем подставляет более широкую формулировку.
Но детектор всё равно остаётся вероятностным инструментом. Он ищет совокупность признаков, а не ловит автора за руку. Поэтому корректнее говорить о страницах с признаками ИИ, а не о доказанном машинном происхождении каждого текста.
Почему это касается обычного читателя
Для пользователя проблема не в самом факте ИИ-редактуры. Нейросеть может помочь исправить структуру, убрать повторы или подготовить черновик. Плохо начинается там, где сайты гонят тысячи похожих страниц без экспертизы, проверки и ответственности.
Поисковики и читатели получают больше текстов, которые звучат гладко, но не добавляют знания. В технике это особенно заметно. Страница может уверенно сравнивать процессоры, видеокарты или софт, но внутри не будет тестов, методики и нормальных исходных данных.
Для редакций это тоже маркер. Теперь ценность текста всё чаще держится не на грамотной подаче, а на происхождении фактов: кто тестировал, чем измерял, где исходные цифры, что редакция проверила руками.
Отчёт Pew Research Center опубликован 20 августа 2026 года; основная оценка построена на выборке из 10 000 страниц Common Crawl, а языковые признаки проверили на 490 000 англоязычных страниц.