Связаться

Выберите страну и город

Наши офисы в США

  • Нью-Йорк
    Division Street 40, New York, 10002
    +1 (347) 620-09-02
  • Вашингтон
    L Street Northwest 1200, Washington, 20005
    +1 (347) 620-09-02

GPTBot, YandexBot и другие AI-краулеры: кого пустить на сайт, а кого закрыть

Сергей Карасев из Нью-Йорка, Сооснователь / CTO

Типичная история с GEO-аудита. Компания год вкладывается в контент, пишет экспертные статьи, обновляет страницы услуг, а в ответах ChatGPT и Perplexity её нет. Открываем robots.txt, и там запрет для всех «незнакомых» роботов, который когда-то поставили от парсеров. Или robots.txt в порядке, но хостинг режет все запросы с зарубежных IP-адресов, и роботы OpenAI получают отказ. Сайт есть, контент есть, а для части нейросетей его не существует.

Бывает и наоборот: владелец узнаёт, что GPTBot скачивает его статьи для обучения моделей, и в сердцах закрывает всех ИИ-роботов разом. А вместе с ними и тех, кто приводит клиентов. Разберёмся, какие AI-краулеры бывают, чем робот обучения отличается от робота поиска и как настроить доступ, чтобы не потерять ни контент, ни клиентов.

Главное

Роботов поиска и запросов пользователей стоит пускать, роботов обучения — по политике компании. Проверяйте не только robots.txt, но и защиту CDN: она часто блокирует нужных роботов молча.

Зачем нейросети заходить на ваш сайт

Когда человек спрашивает у ChatGPT, Алисы AI, Claude или Perplexity «где заказать аудит бухгалтерии для ООО», он получает ответ нейросети. Это готовый текст с рекомендациями, названиями компаний и ссылками на сайты-источники. В чат-ботах ответ приходит в окне диалога со сносками, в Яндексе и Google он показывается над обычными результатами поиска. Человек читает ответ и часто выбирает прямо из него.

Чтобы написать такой ответ, нейросеть должна прочитать страницы. Их обходят и скачивают специальные программы — роботы, или краулеры. Каждый робот представляется серверу своим именем, это строка User-agent. Именно по этому имени в файле robots.txt ему разрешают или запрещают доступ. Если нужный робот не может открыть страницу, сослаться на неё нейросеть не сможет.

Три типа ИИ-роботов: обучение, поиск, запрос пользователя

Главное, что нужно понять: «ИИ-робот» — это не один робот. У крупных компаний их несколько, и задачи у них разные.

  • Роботы обучения собирают тексты, которые могут использоваться для обучения будущих версий моделей. Если их закрыть, ваш контент не попадёт в «память» модели, но на поиск в реальном времени это обычно не влияет.
  • Роботы поиска индексируют страницы, чтобы нейросеть могла найти их и сослаться на них в ответе. Если закрыть такого робота, сайт выпадет из ответов с источниками.
  • Роботы по запросу пользователя открывают конкретную страницу, когда человек в чате просит «посмотри этот сайт» или когда ассистенту нужно заглянуть на страницу по ходу ответа. Это не массовый обход, а разовое действие от имени человека.

Для коммерческого сайта логика простая. Роботов поиска и роботов по запросу пользователя почти всегда стоит пускать: через них приходят упоминания и переходы. Роботов обучения можно пустить или закрыть, это вопрос политики компании, а не продвижения.

Таблица AI-краулеров: кто есть кто

Имена роботов и их роли периодически меняются, компании добавляют новых и уточняют назначение старых. Ниже актуальная на момент написания картина. Перед настройкой сверяйтесь с документацией для владельцев сайтов, которую публикует каждая компания.

Компания Робот (User-agent) Назначение Что будет, если закрыть
OpenAI GPTBot Сбор данных для обучения моделей Контент не используется для обучения; на поиск в ChatGPT не влияет
OpenAI OAI-SearchBot Поиск в ChatGPT Сайт может пропасть из ответов ChatGPT со ссылками
OpenAI ChatGPT-User Открытие страниц по запросу пользователя ChatGPT не сможет открыть страницу, когда об этом просит человек
Google Googlebot Индексация для Google Поиска Сайт пропадёт из поиска Google и из «Обзоров от ИИ»
Google Google-Extended (токен, не отдельный робот) Управление использованием данных для обучения Gemini Данные не используются для обучения; на Google Поиск не влияет
Anthropic ClaudeBot Сбор данных для обучения моделей Контент не используется для обучения
Anthropic Claude-SearchBot Поиск для ответов Claude Сайт может реже появляться в ответах Claude с источниками
Anthropic Claude-User Открытие страниц по запросу пользователя Claude не сможет открыть страницу по просьбе человека
Perplexity PerplexityBot Индексация для поиска Perplexity Сайт может пропасть из ответов Perplexity
Perplexity Perplexity-User Открытие страниц по запросу пользователя Perplexity не сможет открыть страницу по просьбе человека
Microsoft Bingbot Индексация для Bing, на который опирается Copilot Сайт пропадёт из Bing и из ответов Copilot
Яндекс YandexBot Индексация для поиска Яндекса, на который опирается Алиса AI Сайт пропадёт из поиска Яндекса и из ответов Алисы AI

Отдельно о Google. Google-Extended — это не робот, который ходит по сайту, а токен в robots.txt. Обходит сайт по-прежнему Googlebot, а токен лишь сообщает, можно ли использовать ваши данные для обучения Gemini. На Google Поиск он не влияет. «Обзоры от ИИ» строятся на индексе Google, поэтому закрыть сайт от них через Google-Extended не выйдет, а закрыть Googlebot значит уйти из поиска целиком.

С Яндексом ещё проще: отдельного «робота Алисы» для владельцев сайтов нет, Алиса AI опирается на поиск Яндекса. Если YandexBot закрыт, вас нет ни в выдаче, ни в ответах. Подробнее о нём — в статье про Алису AI и поиск с Алисой.

И последнее. Роботы, которые открывают страницу по прямой просьбе человека, компании иногда описывают как действие самого пользователя, а не автоматический обход. Правила robots.txt к ним могут применяться иначе, чем к обычным краулерам. Если вам важно ограничить именно такой доступ, изучите актуальную документацию конкретной компании.

GPTBot: закрывать или нет

Вопрос про gptbot мы слышим чаще всего, потому что это самый известный ИИ-робот. Нужно понимать, что GPTBot отвечает за обучение, а не за ответы с источниками в ChatGPT. За поиск отвечает OAI-SearchBot, за открытие страниц по просьбе пользователя — ChatGPT-User.

Значит, возможны три осознанных сценария:

  • Открыть всех. Подходит большинству сайтов услуг и магазинов: чем больше нейросеть знает о компании, тем лучше. Уникальных данных, которые жалко отдавать, у такого сайта обычно нет.
  • Закрыть обучение, открыть поиск. Подходит медиа, авторам платного контента, владельцам уникальных баз и методик. GPTBot, ClaudeBot и Google-Extended закрыты, поисковые роботы и роботы по запросу пользователя открыты.
  • Закрыть всё, кроме классического поиска. Бывает оправдано для закрытых корпоративных порталов. Для сайта, которому нужны клиенты, это почти всегда ошибка.

Имя, которым представляется робот, в журналах сервера выглядит как строка user agent GPTBot. В ней есть слово GPTBot и ссылка на страницу с описанием робота. Подделать такую строку может любой скрипт, поэтому в спорных случаях сверяйтесь с опубликованными диапазонами IP-адресов. OpenAI и другие компании их публикуют.

Примеры robots.txt

В каждом примере адрес example.com условный, а служебные разделы (личный кабинет, корзина, поиск по сайту) подставьте свои.

Пример 1. Открыть всех, закрыть служебные разделы

User-agent: *
Disallow: /cabinet/
Disallow: /cart/
Disallow: /search/

Sitemap: https://example.com/sitemap.xml

Самый простой вариант. Отдельных групп для ИИ-роботов нет, поэтому все они подчиняются общей группе со звёздочкой.

Пример 2. Закрыть обучение, оставить поиск и запросы пользователей

# Роботы обучения: запрещаем
User-agent: GPTBot
Disallow: /

User-agent: ClaudeBot
Disallow: /

User-agent: Google-Extended
Disallow: /

# Роботы поиска и запросов пользователей: разрешаем, кроме служебных разделов
User-agent: OAI-SearchBot
User-agent: ChatGPT-User
User-agent: Claude-SearchBot
User-agent: Claude-User
User-agent: PerplexityBot
User-agent: Perplexity-User
Disallow: /cabinet/
Disallow: /cart/
Disallow: /search/

# Все остальные, включая YandexBot, Googlebot и Bingbot
User-agent: *
Disallow: /cabinet/
Disallow: /cart/
Disallow: /search/

Sitemap: https://example.com/sitemap.xml

Здесь есть техническая тонкость, на которой ошибаются чаще всего. Робот ищет в robots.txt группу со своим именем, и если находит её, общую группу со звёздочкой он не читает. Поэтому запреты на служебные разделы нужно повторять в каждой именной группе. Иначе получится, что для всех кабинет закрыт, а для OAI-SearchBot открыт.

Пример 3. Частая ошибка

User-agent: *
Disallow: /

User-agent: Yandex
Allow: /

User-agent: Googlebot
Allow: /

Так выглядит «защита от всех, кроме Яндекса и Google». Сайт остаётся в двух поисковиках, но полностью закрыт от роботов ChatGPT, Claude, Perplexity и Bing, а значит, и от Copilot. Мы видим такие файлы регулярно, и владельцы обычно о них даже не помнят.

А как же llms txt в robots txt?

Отдельной директивы для llms.txt в robots.txt нет, прописывать его не нужно: файл ищут по стандартному адресу example.com/llms.txt. Достаточно, чтобы robots.txt не запрещал к нему доступ. Что писать в самом файле, рассказываем в полном руководстве по llms.txt.

Защита от ботов в CDN и на хостинге: невидимый запрет

robots.txt — это просьба, а не замок. Настоящий замок стоит на сервере, и он нередко срабатывает против тех, кого вы хотели пустить. Что встречается чаще всего:

  • Переключатель «блокировать ИИ-ботов» в CDN. У ряда CDN появились настройки, которые одним нажатием закрывают известных ИИ-роботов, а на новых проектах они могут быть включены по умолчанию. Такой переключатель не всегда различает роботов обучения и роботов поиска.
  • Защита от DDoS и проверка браузера. Робот не проходит JavaScript-проверку или капчу и получает вместо страницы заглушку.
  • Блокировка зарубежных IP-адресов. Российские сайты часто закрываются от иностранного трафика. Роботы многих нейросетей ходят с зарубежных адресов и тоже получают отказ.
  • Ограничение частоты запросов. Робот, который открывает несколько страниц подряд, упирается в лимит и получает код 429.
  • Файрвол на уровне CMS. Модули безопасности 1С-Битрикс, WordPress и других CMS блокируют «подозрительные» User-agent по своим спискам.

Решение — не отключать защиту, а добавить нужных роботов в исключения, желательно с проверкой по опубликованным диапазонам IP-адресов, а не только по имени. Тогда настоящий робот пройдёт, а бот, который выдаёт себя за GPTBot, нет.

Как проверить по журналам сервера, кто заходит и что получает

Единственный надёжный способ узнать правду — журналы доступа сервера (access log). В них записан каждый запрос: адрес, код ответа и User-agent. Вот пара команд для Linux-сервера с nginx. Путь к журналу у вас может отличаться.

# Сколько запросов сделал GPTBot
grep -ci "GPTBot" /var/log/nginx/access.log

# Какие коды ответа получает OAI-SearchBot
grep -i "OAI-SearchBot" /var/log/nginx/access.log | cut -d' ' -f9 | sort | uniq -c

# Какие страницы запрашивал PerplexityBot
grep -i "PerplexityBot" /var/log/nginx/access.log | cut -d' ' -f7 | sort | uniq -c | sort -rn | head -20

Как читать результат:

  • Запросов нет совсем — робот к вам ещё не приходил или его режут до сервера, на уровне CDN. Тогда смотрите журналы CDN.
  • Коды 200 — всё в порядке, робот получает страницы.
  • Коды 403, 429, 503 — робот приходит, но получает отказ. Ищите причину в защите.
  • Много кодов 301 и 404 — робот тратит время на редиректы и битые ссылки, пора навести порядок.

Если доступа к серверу нет, например на конструкторе сайтов, частично помогут отчёты о сканировании в Яндекс Вебмастере и Google Search Console, но об ИИ-роботах они ничего не расскажут. В этом случае вопрос нужно задавать платформе.

Пошаговый план настройки доступа

  • решите, пускаете ли вы роботов обучения, и зафиксируйте это как политику компании;
  • откройте robots.txt и проверьте, нет ли запретов для YandexBot, Googlebot, Bingbot и роботов поиска нейросетей;
  • перепишите файл по одному из примеров выше, повторив запреты служебных разделов в каждой группе;
  • проверьте настройки CDN, защиты от DDoS, гео-блокировки и файрвола CMS;
  • через неделю-две посмотрите журналы сервера: кто приходил и какие коды ответа получил;
  • повторяйте проверку раз в месяц и после каждого обновления сайта или смены хостинга.

Доступ роботов — первый раздел нашего чек-листа оптимизации сайта под нейросети. Без него остальные 25 пунктов не имеют смысла.

Результат: сайт открыт тем, кто приводит клиентов

После настройки картина становится управляемой. Роботы поиска получают страницы с кодом 200, служебные разделы закрыты для всех, решение об обучении моделей принято осознанно и записано в robots.txt, а защита сервера пропускает проверенных роботов и отсекает поддельных. Это не гарантирует места в ответах нейросетей, но убирает самую обидную причину отсутствия в них — «нас просто не пустили».

Как мы работаем с доступом ИИ-роботов и всем остальным

«Продвижение в нейросетях» продвигает сайты с 2002 года. У нас 100+ клиентов в России и по всему миру, сертификаты Яндекса и Google и полный комплекс работ по сайту и продвижению из одних рук. Мы работаем со всеми нейросетями — Алисой AI, ChatGPT, Gemini, Claude, Perplexity, Copilot, DeepSeek, GigaChat — для бизнеса в Нью-Йорке, по всей России и на международных рынках.

Настройка доступа ИИ-роботов входит в технические изменения на сайте. Вся услуга состоит из нескольких частей:

  • GEO-аудит: robots.txt, защита сервера, журналы, ответы нейросетей о вас и конкурентах;
  • сбор ИИ-ядра — вопросов клиентов к нейросетям;
  • технические изменения на сайте;
  • создание нового контента;
  • наращивание упоминаний компании на внешних площадках;
  • создание и публикация статей во внешних источниках для рейтинга компании и её экспертов;
  • регулярный мониторинг ответов ИИ.

Нейросеть оценивает сайт целиком, поэтому мы сразу берём его на комплексное обслуживание, от технических правок до GEO-продвижения. Гарантируем исполнение задач по GEO-оптимизации, исправление ошибок и быструю адаптацию сайта под меняющиеся требования нейросетей, включая появление новых роботов.

Абонентская плата — 8 900 ₽ в месяц, в неё входят первые 10 часов работы специалиста. Каждый следующий час стоит 1 800 ₽. Работы по GEO оплачиваются по факту (time & material): сколько сделали и сдали за месяц, столько и выставляем. Скидок и бесплатных периодов нет.

Запишитесь на звонок. Проверим, каких роботов ваш сайт сейчас не пускает, и откроем его для тех нейросетей, где ищут ваши клиенты.

Ещё статьи

Продвижение сайта в нейросетях: где клиенты теперь видят ответы ИИ и как в них попасть

Ответ ИИ теперь стоит над выдачей Яндекса и Google и в чатах. Чтобы нейросеть назвала вашу компанию, нужны порядок на сайте, контент под вопросы клиентов и внешние упоминания.

Прочитать статью

Что такое GEO-продвижение и чем оно отличается от SEO: разбор для владельца бизнеса

GEO, AEO, LLMO и AI SEO — названия одной задачи: попасть в ответы нейросетей. GEO — надстройка над SEO: без индексации нет ответов ИИ, без GEO позиции не дают рекомендаций.

Прочитать статью

Запишитесь на звонок со специалистом по продвижению в нейросетях

Разберём, что ChatGPT, Алиса AI и другие нейросети отвечают о вашей компании и конкурентах, и покажем, что нужно изменить на сайте и за его пределами.

Нью-Йорк, США

Акулова Челси

Division Street 40, New York, 10002, Нью-Йорк

+1 (347) 620-09-02

united-states-new-york-city-ru@promo-yar.ru