Как OpenAI использует свой собственный индекс для выдачи результатов ChatGPT: анализ данных Resoneo
Французская SEO-консалтинговая компания Resoneo провела исследование, которое показало, что сотни сайтов, не имеющих контракта с OpenAI, обслуживались с использованием внутреннего поискового индекса компании так же, как и ее лицензированные партнеры. В данных, собранных с бесплатных аккаунтов, этот индекс обрабатывал большинство результатов поиска ChatGPT. Resoneo проанализировала 1249 ответов ChatGPT, полученных в июле, используя расширение Chrome, которое они предоставляют бесплатно.
Основные выводы исследования
Результаты исследования подтверждают исправление, опубликованное Сугантаном Моханадсаном в июле, после того как он изначально интерпретировал индекс как в значительной степени закрытый для небольших сайтов. Resoneo измерила поток серверов ChatGPT, который помечал каждый веб-результат именем используемого канала, одним из которых было ‘labrador’ — собственный индекс OpenAI. При сравнении страниц из этого канала Resoneo обнаружила, что наличие лицензионного соглашения не влияло на способ обслуживания страницы. Формат, длина и свежесть результатов были одинаковыми как для партнеров, так и для непартнеров.Структура индекса OpenAI
Resoneo описывает индекс ‘labrador’ как индекс, который пополняется пресс-лентами и архивами открытой науки. OpenAI имеет возможность получать доступ к этому индексу напрямую, без необходимости платить третьим лицам, что отличает его от других источников. В данных Resoneo с бесплатных аккаунтов вопросы с установленными ответами, местные бизнесы и продукты почти всегда появлялись через этот индекс. Результаты новостей делились довольно равномерно между индексом и данными, собранными из Google.Анализ результатов поиска
В платных аккаунтах в режиме «мышления» данные Resoneo показали, что сбор данных из Google обеспечивал около 75% из 16,407 результатов поиска, в то время как внутренний индекс составил около 24%. Эти данные были собраны на основе обратного анализа сетевого трафика ChatGPT.Изменения в интерпретации индекса
Ранее Моханадсан описывал тот же индекс как список разрешенных издателей, после анализа сетевого трафика ChatGPT. В июне он упоминал, что это «выглядит как лицензированный уровень», включая такие домены, как Reuters, The Guardian, WSJ и Wikipedia. Однако 14 июля он изменил свое мнение после того, как читатель из Италии, использующий бесплатный аккаунт, предоставил ему данные, показывающие, что каждая цитата издателя проходила через тот же канал, включая небольшие итальянские сайты. Моханадсан пересмотрел свои тесты и признал, что его первоначальные выводы были преувеличены.Как ChatGPT видит ваши страницы
Resoneo проанализировала 534 страницы, которые упоминал ChatGPT, и сравнила каждую из них с фрагментами, хранящимися в индексе OpenAI. Из 463 страниц с заголовком H1, 387 фрагментов включали его, что составляет 83.6%. Фрагмент обрезается после 200 символов, обычно из начала контента страницы, в то время как сбор данных из Google захватывает метаописание примерно в одной трети случаев.Почему это важно
Сайты без контракта с OpenAI все равно появляются в индексе, который управляет большинством результатов ChatGPT для бесплатных пользователей. Выводы Resoneo подтверждают это, как и обновление Моханадсана. После его повторного тестирования он рекомендовал проверять данные с нескольких аккаунтов, чтобы получить более четкую картину, так как один аккаунт показывает лишь, как ChatGPT взаимодействует с ним.Перспективы
Издатели подписывают контракты с OpenAI по нескольким причинам. Появление в ответах ChatGPT для бесплатных пользователей выглядит слабым аргументом, поскольку сайты без контракта уже находятся в индексе, который обрабатывает большинство таких ответов. Вопрос о том, помогает ли соглашение чаще упоминать страницу, остается открытым, и ни одно из исследований не углублялось в него. Resoneo сосредоточилась на том, как страницы хранятся и обслуживаются. На момент публикации страница краулера OpenAI не содержит подробностей о внутреннем индексе и не уточняет, что включает в себя соглашение с издателями.
Источник:
Search Engine Journal