Поиск и SEO
· 1 мин чтения

Внутри retrieval-системы ChatGPT: индексы, кэш и страницы, которые ИИ реально читает

RESONEO разобрала 1200 ответов ChatGPT и выяснила, как ИИ находит, читает и цитирует страницы. Открытие: кнопка Think удваивает объём источников, но меняет их происхождение.

Внутри retrieval-системы ChatGPT: индексы, кэш и страницы, которые ИИ реально читает
Коротко
  • ChatGPT использует три слоя: индекс обнаружения, кэш чтения и страницы, открываемые вживую
  • Кнопка Think у бесплатных пользователей удваивает число источников, но 74,7% из них — из собственного индекса OpenAI, а не из Google
  • Поле result_source, раскрывавшее внутренние пайплайны, исчезло из потока данных 21 июля

Когда ChatGPT цитирует веб-страницу, откуда она берётся? Команда RESONEO в июле проанализировала 1200 ответов ChatGPT, 88 000 результатов поиска и 26 900 уникальных страниц и обнаружила три слоя в работе ИИ: индекс обнаружения, кэш чтения и небольшой набор страниц, открываемых вживую. Каждый слой имеет свои правила, свою свежесть данных и свои слепые зоны.

Как устроен retrieval у ChatGPT

Расширение Chrome от RESONEO записывает поток данных, который ChatGPT отправляет в браузер, включая поля, невидимые в интерфейсе. До 21 июля в этом потоке было поле result_source, которое называло внутренний пайплайн для каждого результата поиска. Четыре значения повторялись: labrador, bright, oxylabs и serp. Ни одно из них не документировано OpenAI, которая публично говорит лишь о «сторонних поисковых провайдерах».

Затем поле исчезло из потока за одну ночь на всех аккаунтах. Теперь исследователи определяют пайплайны по сигнатурам форматирования — длине сниппетов, форме заголовков — с точностью около 98%. Также они запустили флот аккаунтов разных тарифов и стран, повторили одинаковые запросы через API OpenAI и опубликовали canary-страницы с полными серверными логами.

Кнопка Think меняет веб, который видит ChatGPT

Через шесть недель после июльского исследования RESONEO повторила те же запросы во всех конфигурациях: бесплатной и платной, Instant, Think и Thinking. У бесплатных пользователей теперь два режима retrieval. На бесплатном аккаунте нажатие Think более чем удваивает пул источников: с 15,1 до 35,3 URL на диалог и с 9,8 до 16,3 уникальных доменов. Это почти совпадает с платным Thinking при среднем усилии.

Но режимы ищут в разных вебах. Бесплатный Think получает 74,7% результатов из labrador — собственного индекса OpenAI, лишь 3,1% из классического скрейпнутого Google и 22,2% из oxylabs. Платный Thinking — почти зеркальное отражение: 75,3% из скрейпнутого Google и 24,7% из labrador. Два человека могут задать один и тот же вопрос, получить примерно одинаковое число источников, но ответы будут построены на разных корпусах страниц.

Платный Thinking также сузился с июля по август: на одинаковых запросах среднего усилия число URL упало с 47,2 до 33,9, доменов — с 21,9 до 15,5. Запросы стали более навигационными: оператор site: появляется в 3,5% бесплатных Instant-запросов, 10,8% бесплатных Think, 41,9% платных Thinking среднего усилия и 58,1% при высоком усилии. ChatGPT ищет менее широко и чаще идёт напрямую к доменам и брендам, которые уже ожидает найти полезными.

Что это меняет

Для российских владельцев сайтов вывод двойной. Если ваша аудитория — бесплатные пользователи ChatGPT, ранжирование в собственном индексе OpenAI важнее, чем позиции в Google: именно этот индекс отбирает 75% источников для бесплатного Think. Следите за видимостью сайта в выдаче ChatGPT напрямую, а не только через Google-метрики.

Если же ваша цель — платные пользователи Thinking, классическое SEO в Google продолжает работать: 75% источников там — скрейпнутые результаты Google. При этом с ростом использования оператора site: стоит инвестировать в узнаваемость бренда и прямые переходы — ChatGPT всё чаще идёт к известным доменам, а не исследует широкую выдачу.

Кому важно
Владельцам сайтовSEO-специалистамКонтент-маркетологамАналитикам
Источник

Оригинал публикации: searchengineland.com. Разбор и выводы — редакции «SEO-зоны».

Обновлено 17.08.2026