Аналитики Pew Research Center опубликовали данные масштабного анализа веб-контента, которые фиксируют заметный сдвиг в том, кем создаются тексты в глобальной сети. Согласно подсчетам, среди публикаций, появившихся после массового запуска ChatGPT, доля материалов с явными признаками машинной генерации достигла 35%. Иными словами, более трети новых страниц в интернете написаны не людьми, а алгоритмами.
Для оценки ситуации специалисты использовали инструмент Open Pangram. Алгоритм проверил выборку из почти полумиллиона англоязычных веб-страниц, а временной охват включил период начиная с ноября 2022 года (с момента релиза ChatGPT) и заканчивая серединой 2026 года.
Если рассматривать весь массив опубликованных за последние годы страниц (включая старые материалы, созданные задолго до бума нейросетей), то доля ИИ-текстов составляет около 10%. Однако этот показатель сильно размывается архивными данными. Как только исследователи отфильтровали выборку и оставили только страницы, опубликованные после ноября 2022 года, картина резко изменилась. Здесь участие искусственного интеллекта выявляется в 35% случаев. Ситуация имеет четкую восходящую динамику и чем ближе к сегодняшнему дню дата публикации, тем выше вероятность обнаружить в тексте следы алгоритмической генерации.
Распределение синтетического контента по доменным зонам оказалось неравномерным. Наибольшая концентрация наблюдается в коммерческом сегменте. На сайтах в зоне .com признаки использования ИИ фиксируются примерно в два раза чаще, чем на ресурсах .org (4.6%). Наименьшее проникновение нейросетей зафиксировано в образовательном и государственном секторах. На доменах .edu и .gov доля текстов, написанных или значительно отредактированных машиной, колеблется в районе 1%. Это может объясняться более строгими стандартами публикаций и меньшей коммерческой мотивацией к автоматической генерации контента ради трафика.
Аналитики подчеркивают, что детекторы ИИ не дают стопроцентной гарантии и могут ошибаться в частных случаях. Однако при анализе больших массивов данных статистические закономерности видны достаточно четко. Выяснилось, что модели чаще человека используют определенные лингвистические конструкции. В частности, за последние годы в вебе значительно выросла частота употребления слов delve (копаться, углубляться) и interplay (взаимодействие). Кроме того, алгоритмы грешат избыточным использованием длинных тире и оксфордских запятых. Ещё один маркер — конструкция «отрицательного параллелизма», когда мысль строится по принципу «это не просто X, это Y». Частота её использования в сети выросла почти втрое.
Исследователи отмечают, что наличие одного такого признака не является доказательством. Но совокупность стилистических особенностей и статистических паттернов позволяет модели классифицировать текст как машинный с высокой долей уверенности.
Рост доли автоматически сгенерированного текста ставит вопрос о качестве данных, на которых будут обучаться следующие поколения моделей. Если интернет все больше наполняется синтетикой, существует риск попадания такого контента в обучающие выборки, что может привести к деградации качества выдачи и распространению однотипных формулировок.
Станет ли текст, написанный человеком, дефицитом, или пользователи перестанут обращать внимание на происхождение контента, если он решает их задачу? Делитесь мнением в комментариях.
-
Новая модель от создателей ChatGPT во время обычного теста устроила на Mac разгром, которого никто не ждал -
Пастор подал в суд на OpenAI: он уверяет, что ChatGPT отговаривал его от больницы и едва не убил -
OpenAI изменила поведение ChatGPT: нейросеть стала отвечать короче и реже ошибаться -
Обнаружен промпт для ChatGPT, который помогает подчистить цифровой след: находит упоминания и удаляет метаданные -
В ChatGPT начали разворачивать специальный режим для подростков


