ИИ-лаборатории закупают старые книги ради качественных данных
По данным Search Engine Journal, разработчики ИИ скупают книги, изданные до 2022 года, чтобы обучать модели на оригинальных текстах и избегать «мусора», созданного самим ИИ, а также внедряют водяные знаки для текста.
- ИИ-лаборатории закупают книги, изданные до 2022 года, чтобы обучать модели на качественных текстах и избегать контента, созданного самим ИИ.
- Параллельно компании внедряют водяные знаки для маркировки текстов, сгенерированных ИИ.
- Стратегии массовой генерации контента для SEO становятся неэффективными.
Как сообщает Search Engine Journal, для борьбы с «мусорным» контентом от ИИ разработчики меняют подход к сбору данных для обучения моделей. Они закупают книги, изданные до 2022 года, чтобы заполнить датасеты оригиналами человеческих текстов.
Проблема в том, что качество обучения ИИ падает, когда в данных преобладает контент, созданный самим ИИ. Чтобы этого избежать, компании, по данным Google Search Central, прибегают не только к очистке данных, но и используют более старые, проверенные материалы — например, библиотеки книг, выпущенных до бума генеративного ИИ.
Параллельно, как отмечается в публикации, разработчики активно внедряют технические механизмы для маркировки текстов, созданных искусственным интеллектом, включая водяные знаки. Это делается не ради этики, а для того, чтобы в будущих циклах обучения такие тексты было легче отсеивать.
Массовый контент больше не работает
Для вебмастеров и SEO-специалистов это сигнал: стратегии, построенные на генерации огромных объемов контента «для поисковиков», становятся все менее эффективными. Поисковые системы, в свою очередь, все активнее фильтруют автоматизированные материалы, отдавая предпочтение экспертным и уникальным. Инвестиции в бессмысленные тексты теперь не только не приносят результата, но и загрязняют интернет, ухудшая качество обучения собственных ассистентов.
Владельцам сайтов и SEO-специалистам стоит перестать рассматривать контент-фермы как рабочий инструмент. ИИ-лаборатории и поисковые системы уже учатся отсеивать автоматизированные тексты, поэтому вложения в такую стратегию скорее приведут к потере бюджета и репутации, чем к росту позиций.
Вместо этого нужно сосредоточиться на создании материалов, которые отражают реальный опыт и экспертизу авторов. Такой контент не только лучше проходит алгоритмические фильтры, но и становится частью качественных данных для обучения будущих моделей ИИ.
Оригинал публикации: www.searchenginejournal.com. Разбор и выводы — редакции «SEO-зоны».