# Кто из нейросетей заходит на твой сайт и зачем

Четыре вида роботов нейросетей, что закрывать в robots.txt и почему классификация по имени врёт. Разбираю на данных блога, где имя завысило цифру в 9 раз.

URL: https://posts.danashkin.ru/guides/boty-neyrosetey-na-sayte
Обновлено: 2026-09-20

---

## Коротко

**Главное**

- Нейросети ходят на сайты четырьмя разными роботами: за ответом на вопрос живого человека, для своего поиска, для обучения моделей и классическим поисковым обходом. Для бизнеса это четыре разных сигнала.
- Классифицировать робота по имени нельзя. На моём блоге такая классификация завысила главную цифру «пришли за ответом» в девять раз.
- Запрет в robots.txt работает по-разному: закрыть обучение и остаться в поиске нейросети можно, закрыть поиск и остаться в ответах - нет.
- Роботов видно в журнале сервера, а в счётчике на странице их почти нет. Людей, пришедших из чатов, видно в аналитике, но часть переходов теряется без источника.
- Самое ценное - упоминание бренда в ответе без перехода - в логах не видно вообще. Его показывает только замер ответов.

## Зачем нейросети приходят на сайт?

**Главное**

За четырьмя разными вещами: забрать страницу под вопрос конкретного человека, проиндексировать её для своего поиска, взять в обучение будущих моделей или обойти для обычной выдачи. Каждая цель описана в документации самих компаний, и значат они для тебя разное.

В журнале сервера это выглядит как строка с именем робота. За именем стоит цель, и именно цель важна для бизнеса.

| Вид визита | Примеры роботов | Что это значит для тебя |
|---|---|---|
| За ответом | ChatGPT-User, Claude-User, Perplexity-User | живой человек прямо сейчас задал вопрос, и модель пошла за ответом на твою страницу |
| Поиск нейросети | OAI-SearchBot, Claude-SearchBot, PerplexityBot, YandexAdditionalBot | сервис строит индекс, из которого потом собирает ответы |
| Обучение | GPTBot, ClaudeBot | страница уходит в обучение будущих версий модели, ссылки на тебя не будет |
| Классический поиск | YandexBot, Googlebot, Bingbot | обычная индексация для выдачи со ссылками |

Ближе всего к деньгам первая строка: на другом конце человек с вопросом, и чем чаще люди отдают поиск [ИИ-агентам](/concepts/ai-agent), тем больше будет таких визитов. Вторая строка - работа на будущее: если страницы нет в индексе нейросети, в её ответах с поиском тебя не будет. Третья срабатывает через месяцы и без ссылки, четвёртая - фон, привычный по обычному SEO.

Для российского рынка в этой таблице есть особенно важная строка - YandexAdditionalBot. Этот робот собирает материал для быстрых ответов с YandexGPT и для ответов Яндекса с нейросетью. Про то, почему Яндекс в российской картине главный, подробно в материале [о том, как нейросети видят твой бренд](/guides/kak-neyroseti-vidyat-tvoy-brend).

## Почему нельзя верить имени робота?

**Главное**

Потому что имя обманывает. OAI-SearchBot звучит как робот за ответом, а по документации OpenAI он строит поисковый индекс ChatGPT. На моём блоге классификация по имени завысила главную метрику в девять раз: 55 визитов «за ответом» вместо честных шести за тридцать дней.

Эту ошибку я поймал на собственном блоге. В дашборде аналитики был блок про нейросети с главной цифрой: сколько раз модели приходили на страницы за ответом живому человеку. В конце августа за тридцать дней она показывала 55.

Цифру я перепроверил по документации самих компаний. OpenAI пишет прямо: OAI-SearchBot нужен, чтобы показывать сайты в результатах поиска ChatGPT. Perplexity про своего PerplexityBot пишет то же самое. Оба робота индексируют, а за ответом для конкретного человека ходят другие.

После переразметки честная цифра оказалась шесть визитов за тридцать дней. За последнюю неделю вместо двенадцати - ноль: все двенадцать визитов давал индексатор ChatGPT.

Правило, которое я вынес: классификацию чужой системы брать из документации её владельца. Имя робота - ярлык, а его цель описана в документации.

По ходу нашёлся и обратный пропуск. В словаре роботов не было YandexAdditionalBot - того самого, от которого зависят ответы Яндекса с нейросетью. Ошибки в классификации редко бывают только в одну сторону.

## Что закрывать в robots.txt, а что оставлять открытым?

**Главное**

Решение принимается отдельно для каждого вида робота. Закрыть обучение и остаться в поиске нейросети можно: у OpenAI и Google эти настройки независимы. Закрыть поиск нейросети и ждать своих страниц в её ответах с поиском бессмысленно: закрытая страница туда не попадёт.

Файл robots.txt - это инструкция для роботов, какие разделы сайта им можно обходить. Нейросети добавили в него новые имена, и у каждого имени свои последствия.

| Если хочешь | Что делать | Что говорит документация |
|---|---|---|
| Не отдавать тексты в обучение | закрыть GPTBot, ClaudeBot, Google-Extended | OpenAI: настройки роботов независимы; Google: Google-Extended не влияет на Google Поиск |
| Остаться в поиске ChatGPT | не закрывать OAI-SearchBot | OpenAI: закрытые для него сайты не показываются в поисковых ответах ChatGPT |
| Остаться в ответах Яндекса с нейросетью | не закрывать YandexAdditional | Яндекс: запрет убирает страницы из ответов, учитывается за 2-14 дней |
| Не пускать никого | закрыть всё | сайт выпадает и из ответов нейросетей, и из их поиска |

Отдельная история - визиты за ответом. Perplexity пишет, что его робот по запросу пользователя в целом не следует robots.txt: страницу запросил человек, а не обход. У OpenAI похожая оговорка про ChatGPT-User.

Практический вывод для бизнеса, которому нужна видимость: поисковые роботы нейросетей держать открытыми. Решение про обучение - отдельное и зависит от того, продаёшь ли ты сам текст. Издателю есть что защищать, компании, которая хочет, чтобы о ней знали, - скорее нет.

**Проверь, что не закрыто случайно**

Готовые шаблоны защиты сайта и настройки хостинга иногда закрывают всех незнакомых роботов разом. Открой свой robots.txt и найди в нём имена из таблицы выше: одна строка может отрезать сайт от поиска нейросети без всякого твоего решения.

## Как увидеть этих роботов у себя?

**Главное**

В журнале сервера, где записан каждый запрос с именем программы. Счётчик аналитики на странице роботов почти не видит: он работает через скрипт, а роботы нейросетей скрипты обычно не выполняют. Людей из чатов видно в аналитике по источнику перехода.

Роботы и люди видны в разных местах, и смешивать их нельзя. На этом блоге роботов на два порядка больше, чем людей: общая сумма посещений врала бы о чём угодно, кроме аудитории.

1. **Роботы - в журнале сервера.** Хостинг или сервер записывает каждый запрос вместе с именем программы. Там ищутся строки с именами из таблицы выше.
2. **Люди из чатов - в аналитике.** Переход из ChatGPT, Perplexity или Алисы виден как источник визита, если сервис передал адрес, откуда пришёл человек.
3. **Потерянные источники - через метки.** Часть переходов приходит без источника. На этом блоге больше половины визитов в Метрике помечены как неопределённые, и разобрать их можно только метками в своих ссылках.

Со скриптами есть важная деталь. По данным исследования Vercel на конец 2024 года, крупные роботы нейросетей JavaScript не выполняют. Если важный текст страницы появляется только после работы скрипта, робот его просто не увидит.

## Слепые зоны: кого не видно в логах

**Главное**

Роботов без опубликованного имени, роботов, которые не называют себя роботами, и главное - упоминаний без перехода. Модель могла назвать твою компанию сотне людей, и ни один из них не оставил следа на сайте.

Первая слепая зона - роботы, имени которых никто не публиковал. За те же тридцать дней на мой блог не пришёл ни GigaChat, ни DeepSeek, ни Qwen под каким-либо узнаваемым именем. Опубликованного имени робота GigaChat я не нашёл ни у Сбера, ни в сводных списках, поэтому честный ответ звучит так: в данных его нет, но счётчик его бы и не узнал.

Вторая - программы, которые не называют себя роботами. Если в имени нет слов вроде bot или crawler, запись выглядит как обычный браузер.

Третья и самая большая - ответ без клика. Человек спросил, модель назвала три компании, человек запомнил название и позже набрал его в поиске. В журнале сервера и в аналитике этот эпизод не оставил ни одной строки.

## От журнала к замеру ответов

**Главное**

Журнал сервера показывает, кто пришёл, а замер ответов показывает, кого назвали. Для видимости бренда важнее второе: упоминание в ответе случается чаще, чем переход. Поэтому журнал и замер работают в паре, и заменить одно другим нельзя.

Журнал отвечает на технический вопрос: доходят ли роботы нейросетей до сайта и видят ли его содержимое. Если поисковый робот нейросети не заходит месяц, работать над текстами рано - сначала надо чинить доступ.

Вопрос бизнеса другой: называет ли модель тебя, когда покупатель спрашивает о твоей категории. На него отвечает только замер - регулярный прогон вопросов покупателя через нейросети с записью ответов целиком. Его мы делаем в [Prodvig.ai](https://prodvig.ai): там видно, кого называют вместо тебя и из каких источников собран ответ.

Как устроен такой замер и почему одного вопроса мало, разобрано в материале о том, [как измерить видимость бренда в нейросетях](/guides/kak-izmerit-vidimost-brenda-v-neyrosetyah). Разница между ответом по памяти и ответом с поиском, которая объясняет роль поисковых роботов, - в разборе о том, [когда нейросеть ищет в интернете, а когда отвечает по памяти](/guides/neyroset-ishchet-ili-otvechaet-po-pamyati).

## Частые вопросы

**Главное**

Что спрашивают чаще всего: нужен ли файл llms.txt, вредит ли закрытие обучения, как часто смотреть журнал и что делать, если роботов нейросетей нет совсем.

### Частые вопросы

**Нужен ли сайту файл llms.txt?**

Это пока предложенный формат, а не общепринятый стандарт. Вреда от него нет, но начинать стоит с robots.txt и с того, чтобы важный текст был виден без скриптов.

**Если закрыть обучение, я пропаду из ответов?**

Из поиска нейросети - нет, если не закрыты её поисковые роботы. А вот в памяти будущих версий модели твоих текстов не будет: они учатся без них.

**Как часто смотреть журнал сервера?**

Раз в месяц достаточно, чтобы убедиться, что поисковые роботы нейросетей заходят и получают страницы без ошибок.

**Роботов нейросетей на сайте нет совсем. Что делать?**

Проверить robots.txt и настройки защиты хостинга, затем убедиться, что сайт есть в обычном поиске. Ответы Яндекса с нейросетью, по его же справке, собираются из проиндексированных страниц.

## Главный вывод

**Главное**

Роботы нейросетей бывают четырёх видов, и путать их дорого: по имени выходит завышенная картина. Поисковых роботов нейросетей стоит держать открытыми, обучение решается отдельно. Упоминание без перехода в журнале не видно, его показывает только замер ответов.

Начни с двух проверок. Открой robots.txt и убедись, что поисковые роботы нейросетей не закрыты случайно. Потом попроси у хостинга журнал за месяц и найди в нём строки с именами из таблицы.

Дальше вопрос переходит из техники в маркетинг: пускать роботов мало, нужно, чтобы по итогу называли тебя.

А ты знаешь, заходил ли на твой сайт в этом месяце хоть один поисковый робот нейросети?

### Источники

- [Prodvig.ai - сервис ежедневного замера видимости бренда в ответах нейросетей: что называют вместо тебя и из каких источников](https://prodvig.ai)
- [Overview of OpenAI Crawlers - назначение OAI-SearchBot, ChatGPT-User и GPTBot, документация OpenAI](https://developers.openai.com/api/docs/bots)
- [Does Anthropic crawl data from the web - роботы ClaudeBot, Claude-User и Claude-SearchBot, справка Anthropic](https://support.claude.com/en/articles/8896518-does-anthropic-crawl-data-from-the-web-and-how-can-site-owners-block-the-crawler)
- [Perplexity Crawlers - PerplexityBot и Perplexity-User, документация Perplexity](https://docs.perplexity.ai/docs/resources/perplexity-crawlers)
- [Быстрый ответ - запрет YandexAdditional в robots.txt, справка Яндекс Вебмастера](https://yandex.ru/support/webmaster/ru/search-appearance/fast.html)
- [Google's common crawlers - в том числе Google-Extended, документация Google](https://developers.google.com/crawling/docs/crawlers-fetchers/google-common-crawlers?hl=en)
- [The rise of the AI crawler - исследование Vercel: роботы нейросетей не выполняют JavaScript](https://vercel.com/blog/the-rise-of-the-ai-crawler)
