Поиск и SEO
· 1 мин чтения

Скрипт на Python для кластеризации ключевых слов: TF-IDF и HDBSCAN

SEO-специалист представил открытый скрипт для автоматической группировки тысяч ключевых слов по темам. Инструмент использует TF-IDF и HDBSCAN, умеет находить шум и не требует заранее задавать число кластеров.

Скрипт на Python для кластеризации ключевых слов: TF-IDF и HDBSCAN
Коротко
  • Опубликован скрипт на Python, который кластеризует ключевые слова с помощью TF-IDF и алгоритма HDBSCAN.
  • HDBSCAN не требует указывать число кластеров заранее и умеет отбрасывать «шумные» запросы, не вписывающиеся в темы.
  • Скрипт можно запустить в Google Colab, он принимает список ключей в txt-файле и выдает Excel с готовыми группами.

Как сообщает Search Engine Land, SEO-специалист поделился опытом создания инструмента для автоматической кластеризации ключевых слов. Ручная группировка перестает работать, когда в таблице тысячи строк, а простое правило поиска одинаковых слов не учитывает смысловое пересечение фраз, которые не имеют общих лексем.

В основе решения — связка TF-IDF и HDBSCAN. Первый преобразует ключевые слова в числовые векторы, подчеркивая различия. Второй — алгоритм плотностной кластеризации, которому не нужно заранее задавать число групп. Это важное преимущество перед k-means, поскольку при анализе запросов обычно неизвестно, сколько тем получится в итоге.

Как устроен скрипт

На вход подается текстовый файл, где каждое ключевое слово — с новой строки. Скрипт очищает данные от мусора: убирает стоп-слова, спецсимволы и не-английские записи. Затем TF-IDF оценивает значимость слов, а HDBSCAN формирует кластеры. Особенность алгоритма — он помечает «шум» отдельным ярлыком, не пытаясь втиснуть каждую фразу в какую-либо тему. Это полезно для SEO-выгрузок, где часто встречаются специфические длиннохвостовые запросы.

Готовые кластеры получают автоматические названия по наиболее характерным словам. Результат выгружается в Excel с двумя листами: общий вид по группам и детальная разбивка по каждому ключу.

Автор рекомендует использовать BigQuery как источник ключевых слов: в отличие от выгрузки из Search Console, там нет ограничения в 1000 строк и данные не семплируются. При этом для работы подойдет и обычный экспорт из интерфейса GSC — скрипту важен лишь список фраз.

Что это меняет

Для российских SEO-специалистов и владельцев сайтов это готовый способ перейти от ручной группировки запросов к автоматической. Особенно если вы работаете с большими семантическими ядрами в тысячах строк — такой скрипт экономит дни рутинной работы и избавляет от ошибок.

Обратите внимание: инструмент рассчитан на англоязычные ключи — в коде заложена чистка не-английских записей. Для русского языка потребуется адаптация стоп-слов и настройка токенизации. Если вы работаете только с русской семантикой, сначала доработайте preprocessing-часть.

Кому важно
Владельцам сайтовSEO-специалистамРазработчикам
Источник

Оригинал публикации: searchengineland.com. Разбор и выводы — редакции «SEO-зоны».

Обновлено 31.07.2026