Как Reddit использует ИИ для поиска: анализ комментариев и их влияние на ответы
Недавнее исследование, проведенное командой ученых из Университета Иллинойс в Урбана-Шампейн, выявило интересные закономерности в том, как ИИ-поиск Reddit обрабатывает комментарии пользователей. В ходе работы было проанализировано 10,000 вопросов и 30,000 ответов, что позволило исследователям проследить за 14.68 миллиона комментариев, чтобы понять, какие из них чаще всего используются в ответах.
Формальность языка и вероятность выбора комментариев
Исследование показало, что ИИ-поиск Reddit предпочитает формальные, уже оцененные комментарии, а не те, которые содержат личный опыт пользователей. Ученые сравнили комментарии, на которые ссылаются ответы, с теми, которые были проигнорированы. Оказалось, что уровень формальности языка является самым сильным предиктором выбора комментариев. Конкретно, комментарий, который был на одну стандартную девиацию более формальным, имел на 49% больше шансов быть выбранным (отношение шансов 1.488). Кроме того, использование слов вроде "должен" и "обязан" также повышало вероятность выбора (1.070), в то время как комментарии с большим количеством личного опыта имели меньшие шансы на выбор (0.789). Поддерживающий язык также снижал шансы на выбор (0.924). Авторы исследования назвали первый показатель "экспериментальным голосом", который оценивался по таким признакам, как использование местоимений первого лица и прошедшего времени.Влияние голосования на выбор комментариев
Наиболее значительное влияние на выбор комментариев оказывало их голосование в рамках обсуждения. Увеличение на одну стандартную девиацию в рейтинге голосов умножало шансы на выбор в 2.88 раз. Средний выбранный комментарий находился на 91-м процентиле по оценке в своем обсуждении, в то время как невыбранные комментарии находились на 45-м процентиле. Из выбранных комментариев 92% были прямыми ответами на оригинальный пост, который составил 53% всех комментариев. Выбранные комментарии появлялись в среднем через 1.2 часа после публикации поста, тогда как невыбранные комментарии появлялись через 5.9 часов. Увеличение длины комментария на одну стандартную девиацию также повышало шансы на выбор (отношение шансов 1.79). Комментарии, содержащие внешние ссылки, имели еще более высокие шансы (2.25). Комментарии с оценкой ноль или ниже составили лишь 0.53% выбранных комментариев и 5.1% всех собранных комментариев.Снижение использования первого лица в ответах
В ходе анализа 1,000 запросов исследователи сравнили цитируемые комментарии Reddit с ответами, созданными на их основе. Использование слов, таких как "я" и "мой", снизилось с 3.3% в цитируемых комментариях до 0.06% в ответах. Модели GPT-4o-mini и GPT-5, использованные для обработки тех же запросов, также использовали меньше первого лица, причем ответы Reddit продемонстрировали наибольшее снижение.Методология исследования
Исследователи использовали языковую модель для переписывания реальных постов из 20 сабреддитов в короткие поисковые запросы. Десять из них представляли собой крупные сообщества, такие как r/personalfinance и r/AskDocs, а десять других — более мелкие, такие как r/UKJobs и r/AusLegal. Три запуска были разделены примерно на пять часов, чтобы различия отражали работу системы, а не изменения на Reddit. При этом, когда два запуска использовали одни и те же исходные посты, ответы были почти идентичны, что указывает на то, что большинство различий происходило из-за выбора постов.Значение результатов
Reddit ценен для исследования аудитории благодаря тому, что пользователи делятся своим опытом с продуктами или проблемами. Однако в этих 20 сообществах комментарии с большим количеством признаков личного опыта имели меньшие шансы попасть в ответ ИИ, а большинство формулировок от первого лица исчезло, когда они все же попадали. Генеральный директор Reddit Стив Хаффман отметил, что Reddit особенно хорош в вопросах, где "ответ действительно состоит из множества точек зрения от разных людей". Это исследование измеряет, какие из этих точек зрения достигают ответа ИИ.Перспективы
Авторы исследования предупреждают, что выявленные закономерности могут не применяться к другим типам сообществ или к другим системам поиска на основе ИИ. Обновления по результатам исследования будут опубликованы в случае появления рецензируемой версии.
Источник:
Search Engine Journal