Interpreter.ru 🛡 В админку
Интернет-маркетинг 28.07.2026 рейтинг 6

Неожиданные последствия: как Claude и его правила индексации стали причиной утечек данных

На выходных в результатах поиска Google неожиданно появились страницы с общими чатами Claude. Это событие вызвало множество вопросов о том, как работают правила индексации и что это значит для пользователей. В частности, 27 июля я проверил правила обхода на страницах Claude и обнаружил директиву noindex, скрытую за блокировкой, что препятствовало доступу Google к этим страницам.

Правила обхода и их противоречия

Путь для общего доступа был заблокирован в файле robots.txt на сайте claude.ai. Эти страницы также возвращают заголовок X-Robots-Tag, установленный в значение none, что согласно рекомендациям Google эквивалентно noindex и nofollow. Однако, согласно указаниям Google, директива noindex работает только в том случае, если краулер может получить доступ к странице и прочитать ее. Если страница заблокирована в robots.txt, она все равно может быть проиндексирована, если на нее ссылаются другие страницы, так как Googlebot фиксирует URL, не открывая его. Это противоречие не уникально для компаний в сфере ИИ. Если Google обнаруживает заблокированный URL в другом месте, он может отобразить его в результатах поиска, не обходя noindex.

Что произошло

Издание 404 Media сообщило в понедельник, что страницы с общими чатами Claude стали видны через оператор site:. TechCrunch также смог найти медицинские материалы, внутренние документы компаний и файлы с именами и номерами телефонов детей младшего школьного возраста. Артефакты, документы и мини-приложения, созданные внутри Claude, также появились через другой путь. Многие публикации, включая The Decoder, сообщали, что страницы с общими чатами не имели тега noindex. На 27 июля на страницах действительно был установлен заголовок noindex, но он находился за блокировкой в robots.txt. Неясно, был ли этот заголовок установлен до выходных, так как я не смог это подтвердить.

Результаты проверки

По данным моей проверки 27 июля, файл robots.txt на claude.ai запрещает доступ к /share/* для группы User-agent: *, без отдельной группы для Googlebot. Таким образом, именно эта группа и используется Google. Живой URL общего доступа отвечает заголовком x-robots-tag: none на запрос GET. Этот же заголовок появляется, когда запрос делает Googlebot, и ответ включает Vary: User-Agent. Путь /public/artifacts/ не указан в robots.txt, и я не проверял, возвращают ли URL артефактов заголовок noindex на уровне страницы, поэтому эти два пути нельзя сравнивать по их контролям. Независимый IT-консультант Дэниел Дж. Гловер также сообщил о том же конфликте 26 июля. Моя проверка показала, что настройка все еще была в силе 27 июля, после того как было сообщено, что чаты больше не отображаются в результатах поиска, но я не смог установить, что именно было отправлено Google, когда эти URL впервые были обнаружены.

Почему блокировка страницы не удаляет ее

Файл robots.txt помогает направлять, как поисковые системы обходят ваш сайт, но не решает, что будет проиндексировано. Google разъясняет это уже много лет. Например, Джон Мюллер объясняет, что даже страницы, заблокированные в robots.txt, могут появляться в результатах поиска, если на них ссылаются другие страницы. Если вы хотите исключить страницу из результатов поиска, правильным решением будет использование тега "noindex". Мартин Сплитт также рекомендует избегать размещения обоих правил на одной странице. Google недавно вновь подчеркнул это различие, как видно из их обновления на прошлой неделе. Блокировка URL в robots.txt не удаляет уже проиндексированные страницы. Для более постоянного удаления Google рекомендует использовать тег "noindex", который его краулер может прочитать.

Ответ Anthropic

Компания Anthropic сообщила TechCrunch, что ссылки на общие чаты будут появляться в результатах поиска только в том случае, если люди размещают их в доступных для краулеров местах, и что ссылки, отправленные через личные сообщения, не будут индексироваться. Представительница компании Эми Ротерхэм добавила, что эти ссылки "не могут быть угаданы или обнаружены, если люди не решат поделиться ими сами". Это касается одного из способов, как публичный URL общего доступа может быть обнаружен, но не решает проблему конфликтующих правил, которые я обнаружил 27 июля. Представитель Google Нед Адрианс заявил, что поисковые системы не определяют, какие страницы становятся публичными, и что Google предоставляет владельцам сайтов контроль над обходом и индексацией и следует этим правилам.

Почему это важно

Любые чаты или артефакты, которые вы не отменили, все еще доступны для всех, у кого есть ссылка. В Claude вы можете перейти в Настройки > Конфиденциальность > Общие чаты, чтобы увидеть полный список. Отмена общего доступа к чату отключает прямую ссылку, но удаление URL из Google — это другое дело. Как пользователь Claude, вы не можете контролировать, что он отправляет Googlebot или подать запрос на удаление, так как это управляется Anthropic. Артефакты публикуются через свой собственный процесс, что делает отмену общего доступа к чату и удаление артефакта из этого чата двумя отдельными действиями. Помимо изменений в настройках, стоит установить правило относительно обмена чатами и артефактами ИИ. Если чат содержит что-то, что вы не хотели бы публиковать, не делитесь им через ссылку, которая может быть проиндексирована позже.

Взгляд в будущее

Эта ситуация не уникальна для Anthropic. OpenAI убрала общие чаты ChatGPT из поиска в августе 2025 года, а Google заблокировал транскрипты Bard от индексации в 2023 году. В каждом случае речь шла о публичном URL общего доступа, который распространился дальше, чем его владелец мог ожидать. Три компании теперь столкнулись с тем, что чаты клиентов появляются в поиске. Это достаточно веская причина, чтобы рассматривать публичную ссылку общего доступа как публичную веб-страницу с момента ее создания.
Источник:   Search Engine Journal