whynotAI Lab

Какая часть интернета уже написана ИИ

Опубликовано Aug 23, 20262 мин чтенияНачальный

Что произошло

Четыре года спустя после релиза ChatGPT исследователи проанализировали почти полмиллиона англоязычных веб-страниц. Оказалось, что алгоритмы уже пишут значительную часть интернет-контента — особенно заметен их вклад в новых материалах.

«Это не просто информация, это влияние» — типичная для ИИ конструкция, которая встречается в три раза чаще, чем до 2022 года.

Детали

  • Методология: Использовался инструмент Open Pangram, анализирующий лингвистические паттерны. ИИ часто злоупотребляет:

    • Тире (—) — +100% с 2023 года
    • Оксфордскими запятыми (+63%)
    • Штампованными фразами ("углубляться", "взаимодействие", "ключевой")
  • Сферы распространения:

    • .com — 10% контента с ИИ
    • .org — 4.6%
    • .edu/.gov — около 1%
Как определяют ИИ-текст

Модели ищут статистические аномалии: не только отдельные слова, но и структуру предложений, частоту конструкций. Человеческий текст разнообразнее.

Почему это важно

  1. Доверие к контенту: Чем больше ИИ-материалов, тем сложнее отличить человеческое мнение от алгоритмической генерации.
  2. SEO-гонка: Коммерческие сайты активнее используют ИИ для создания контента, что меняет правила ранжирования.
  3. Языковая эрозия: Штампованные фразы и конструкции вытесняют живое разнообразие речи.

Что дальше

  • Детекторы эволюционируют: Сейчас модели улавливают явные паттерны, но ИИ учится мимикрии.
  • Новые стандарты прозрачности: Возможно, появятся метки для ИИ-контента (как «спонсировано»).
  • Пересмотр авторства: Как оценивать творческий вклад, если текст написан по промпту человека, но сгенерирован ИИ?
Практический вывод

Проверяйте сомнительные материалы через несколько детекторов (например, Originality.ai или Crossplag). Ищите неестественные повторы и "идеально" структурированные абзацы.

Это разбор
Самостоятельный разбор новости. Оригинал на pewresearch.org — по ссылке ниже.

Источники

Было полезно?