RESONEO провели reverse engineering ChatGPT Retrieval: 27 000 страниц, 58 000 извлеченных URL и 1 249 реальных ответов ChatGPT, собранных в июле 2026 года.
И цифры здесь действительно интересные:
📊 58 000 URL были извлечены ChatGPT
📊 7 600 были повышены до источников
📊 5 000 реально процитированы в тексте ответа
📊 Только 760 страниц модель фактически открыла и прочитала
То есть страница может попасть в retrieval, но модель в большинстве случаев работает не с ее полным содержимым.
Что реально видит ChatGPT?
В обычном retrieval результат часто представлен всего тремя элементами:
Title + URL + примерно 200 символов сниппета.
Для собственного индекса OpenAI:
🟣snippet ограничивается примерно 202 символами;
🟣в 83,6% случаев он содержит H1;
🟣в 77% случаев H1 находится прямо с первого символа;
🟣после H1 остается около 146 символов для основного текста;
🟣Meta Description при этом игнорируется.
Еще интереснее: первый
alt у изображения может съесть около 50 символов этого ограниченного пространства.А что с самим поиском?
Здесь важно понимать, что у ChatGPT есть разные режимы работы с поиском и рассуждением.
🟣Free Think - режим "Thinking" в бесплатной версии ChatGPT, где модель дополнительно анализирует запрос и ищет информацию.
🟣Paid Thinking - аналогичный режим для платных пользователей, но с более широким доступом к поиску и моделям.
RESONEO сравнили, какие источники ChatGPT использует в этих двух режимах. Под URL здесь понимаются найденные веб-страницы, которые система рассматривает как потенциальные источники ответа.
Free Think - в среднем 35,3 найденных URL на разговор:
🟣74,7% - из собственного поискового индекса OpenAI;
🟣3,1% - из Google;
🟣22,2% - через Oxylabs.
Paid Thinking - в среднем 35,1 найденных URL:
🟣24,7% - из индекса OpenAI;
🟣75,3% - из Google.
То есть разница очень существенная: бесплатный Thinking в исследовании в основном опирался на индекс OpenAI, а платный Thinking - на Google.
Поэтому один и тот же запрос в разных режимах ChatGPT может формировать ответ, опираясь на разные наборы веб-страниц.
Еще один показатель: обычный Free Instant давал в среднем 15,1 URL, а Free Think - уже 35,3 URL.
И еще один важный момент
OpenAI фактически использует два разных хранилища:
🟣Search index - короткий сниппет для поиска страницы.
🟣Read cache - полная страница, преобразованная в Markdown.
И они обновляются по-разному.
Исследователи обнаружили, что 13% сниппетов отставали от фактического crawl более чем на месяц.
А read cache может сохраняться несколько недель или даже месяцев.
Причем после открытия страницы одним пользователем ее копия может быть использована другим пользователем без нового обращения к сайту.
🟣🟣🟣Главный вывод для GEO
Оптимизировать нужно не только "всю статью".
Нужно контролировать тот небольшой фрагмент, который retrieval реально показывает модели.
Кстати о чанках и их ранжировании - я дал небольшой комментарий Евгению Гуменюку, можете почитать на украинском.
Title, H1, первые ~150 символов после H1, структура страницы и отсутствие лишнего контента перед H1 могут напрямую влиять на то, какую информацию ChatGPT получит о вашей странице еще до ее открытия.
И это уже совсем другой подход к GEO: оптимизация не только под ranking, а под retrieval → extraction → citation.
Полное исследование RESONEO (анг оригинал)
Как ChatGPT выбирает контент для ответа (подробный анализ на русском)
