Внутри retrieval-системы ChatGPT: индексы, кэш и страницы, которые ИИ реально читает
RESONEO разобрала 1200 ответов ChatGPT и выяснила, как ИИ находит, читает и цитирует страницы. Открытие: кнопка Think удваивает объём источников, но меняет их происхождение.
- ChatGPT использует три слоя: индекс обнаружения, кэш чтения и страницы, открываемые вживую
- Кнопка Think у бесплатных пользователей удваивает число источников, но 74,7% из них — из собственного индекса OpenAI, а не из Google
- Поле result_source, раскрывавшее внутренние пайплайны, исчезло из потока данных 21 июля
Когда ChatGPT цитирует веб-страницу, откуда она берётся? Команда RESONEO в июле проанализировала 1200 ответов ChatGPT, 88 000 результатов поиска и 26 900 уникальных страниц и обнаружила три слоя в работе ИИ: индекс обнаружения, кэш чтения и небольшой набор страниц, открываемых вживую. Каждый слой имеет свои правила, свою свежесть данных и свои слепые зоны.
Как устроен retrieval у ChatGPT
Расширение Chrome от RESONEO записывает поток данных, который ChatGPT отправляет в браузер, включая поля, невидимые в интерфейсе. До 21 июля в этом потоке было поле result_source, которое называло внутренний пайплайн для каждого результата поиска. Четыре значения повторялись: labrador, bright, oxylabs и serp. Ни одно из них не документировано OpenAI, которая публично говорит лишь о «сторонних поисковых провайдерах».
Затем поле исчезло из потока за одну ночь на всех аккаунтах. Теперь исследователи определяют пайплайны по сигнатурам форматирования — длине сниппетов, форме заголовков — с точностью около 98%. Также они запустили флот аккаунтов разных тарифов и стран, повторили одинаковые запросы через API OpenAI и опубликовали canary-страницы с полными серверными логами.
Кнопка Think меняет веб, который видит ChatGPT
Через шесть недель после июльского исследования RESONEO повторила те же запросы во всех конфигурациях: бесплатной и платной, Instant, Think и Thinking. У бесплатных пользователей теперь два режима retrieval. На бесплатном аккаунте нажатие Think более чем удваивает пул источников: с 15,1 до 35,3 URL на диалог и с 9,8 до 16,3 уникальных доменов. Это почти совпадает с платным Thinking при среднем усилии.
Но режимы ищут в разных вебах. Бесплатный Think получает 74,7% результатов из labrador — собственного индекса OpenAI, лишь 3,1% из классического скрейпнутого Google и 22,2% из oxylabs. Платный Thinking — почти зеркальное отражение: 75,3% из скрейпнутого Google и 24,7% из labrador. Два человека могут задать один и тот же вопрос, получить примерно одинаковое число источников, но ответы будут построены на разных корпусах страниц.
Платный Thinking также сузился с июля по август: на одинаковых запросах среднего усилия число URL упало с 47,2 до 33,9, доменов — с 21,9 до 15,5. Запросы стали более навигационными: оператор site: появляется в 3,5% бесплатных Instant-запросов, 10,8% бесплатных Think, 41,9% платных Thinking среднего усилия и 58,1% при высоком усилии. ChatGPT ищет менее широко и чаще идёт напрямую к доменам и брендам, которые уже ожидает найти полезными.
Для российских владельцев сайтов вывод двойной. Если ваша аудитория — бесплатные пользователи ChatGPT, ранжирование в собственном индексе OpenAI важнее, чем позиции в Google: именно этот индекс отбирает 75% источников для бесплатного Think. Следите за видимостью сайта в выдаче ChatGPT напрямую, а не только через Google-метрики.
Если же ваша цель — платные пользователи Thinking, классическое SEO в Google продолжает работать: 75% источников там — скрейпнутые результаты Google. При этом с ростом использования оператора site: стоит инвестировать в узнаваемость бренда и прямые переходы — ChatGPT всё чаще идёт к известным доменам, а не исследует широкую выдачу.
Оригинал публикации: searchengineland.com. Разбор и выводы — редакции «SEO-зоны».