Коротко
Зачем нейросети приходят на сайт?
В журнале сервера это выглядит как строка с именем робота. За именем стоит цель, и именно цель важна для бизнеса.
| Вид визита | Примеры роботов | Что это значит для тебя |
|---|---|---|
| За ответом | ChatGPT-User, Claude-User, Perplexity-User | живой человек прямо сейчас задал вопрос, и модель пошла за ответом на твою страницу |
| Поиск нейросети | OAI-SearchBot, Claude-SearchBot, PerplexityBot, YandexAdditionalBot | сервис строит индекс, из которого потом собирает ответы |
| Обучение | GPTBot, ClaudeBot | страница уходит в обучение будущих версий модели, ссылки на тебя не будет |
| Классический поиск | YandexBot, Googlebot, Bingbot | обычная индексация для выдачи со ссылками |
Ближе всего к деньгам первая строка: на другом конце человек с вопросом, и чем чаще люди отдают поиск ИИ-агентам, тем больше будет таких визитов. Вторая строка - работа на будущее: если страницы нет в индексе нейросети, в её ответах с поиском тебя не будет. Третья срабатывает через месяцы и без ссылки, четвёртая - фон, привычный по обычному SEO.
Для российского рынка в этой таблице есть особенно важная строка - YandexAdditionalBot. Этот робот собирает материал для быстрых ответов с YandexGPT и для ответов Яндекса с нейросетью. Про то, почему Яндекс в российской картине главный, подробно в материале о том, как нейросети видят твой бренд.
Почему нельзя верить имени робота?
Эту ошибку я поймал на собственном блоге. В дашборде аналитики был блок про нейросети с главной цифрой: сколько раз модели приходили на страницы за ответом живому человеку. В конце августа за тридцать дней она показывала 55.
Цифру я перепроверил по документации самих компаний. OpenAI пишет прямо: OAI-SearchBot нужен, чтобы показывать сайты в результатах поиска ChatGPT. Perplexity про своего PerplexityBot пишет то же самое. Оба робота индексируют, а за ответом для конкретного человека ходят другие.
После переразметки честная цифра оказалась шесть визитов за тридцать дней. За последнюю неделю вместо двенадцати - ноль: все двенадцать визитов давал индексатор ChatGPT.
Правило, которое я вынес: классификацию чужой системы брать из документации её владельца. Имя робота - ярлык, а его цель описана в документации.
По ходу нашёлся и обратный пропуск. В словаре роботов не было YandexAdditionalBot - того самого, от которого зависят ответы Яндекса с нейросетью. Ошибки в классификации редко бывают только в одну сторону.
Что закрывать в robots.txt, а что оставлять открытым?
Файл robots.txt - это инструкция для роботов, какие разделы сайта им можно обходить. Нейросети добавили в него новые имена, и у каждого имени свои последствия.
| Если хочешь | Что делать | Что говорит документация |
|---|---|---|
| Не отдавать тексты в обучение | закрыть GPTBot, ClaudeBot, Google-Extended | OpenAI: настройки роботов независимы; Google: Google-Extended не влияет на Google Поиск |
| Остаться в поиске ChatGPT | не закрывать OAI-SearchBot | OpenAI: закрытые для него сайты не показываются в поисковых ответах ChatGPT |
| Остаться в ответах Яндекса с нейросетью | не закрывать YandexAdditional | Яндекс: запрет убирает страницы из ответов, учитывается за 2-14 дней |
| Не пускать никого | закрыть всё | сайт выпадает и из ответов нейросетей, и из их поиска |
Отдельная история - визиты за ответом. Perplexity пишет, что его робот по запросу пользователя в целом не следует robots.txt: страницу запросил человек, а не обход. У OpenAI похожая оговорка про ChatGPT-User.
Практический вывод для бизнеса, которому нужна видимость: поисковые роботы нейросетей держать открытыми. Решение про обучение - отдельное и зависит от того, продаёшь ли ты сам текст. Издателю есть что защищать, компании, которая хочет, чтобы о ней знали, - скорее нет.
Готовые шаблоны защиты сайта и настройки хостинга иногда закрывают всех незнакомых роботов разом. Открой свой robots.txt и найди в нём имена из таблицы выше: одна строка может отрезать сайт от поиска нейросети без всякого твоего решения.
Как увидеть этих роботов у себя?
Роботы и люди видны в разных местах, и смешивать их нельзя. На этом блоге роботов на два порядка больше, чем людей: общая сумма посещений врала бы о чём угодно, кроме аудитории.
- Роботы - в журнале сервера. Хостинг или сервер записывает каждый запрос вместе с именем программы. Там ищутся строки с именами из таблицы выше.
- Люди из чатов - в аналитике. Переход из ChatGPT, Perplexity или Алисы виден как источник визита, если сервис передал адрес, откуда пришёл человек.
- Потерянные источники - через метки. Часть переходов приходит без источника. На этом блоге больше половины визитов в Метрике помечены как неопределённые, и разобрать их можно только метками в своих ссылках.
Со скриптами есть важная деталь. По данным исследования Vercel на конец 2024 года, крупные роботы нейросетей JavaScript не выполняют. Если важный текст страницы появляется только после работы скрипта, робот его просто не увидит.
Слепые зоны: кого не видно в логах
Первая слепая зона - роботы, имени которых никто не публиковал. За те же тридцать дней на мой блог не пришёл ни GigaChat, ни DeepSeek, ни Qwen под каким-либо узнаваемым именем. Опубликованного имени робота GigaChat я не нашёл ни у Сбера, ни в сводных списках, поэтому честный ответ звучит так: в данных его нет, но счётчик его бы и не узнал.
Вторая - программы, которые не называют себя роботами. Если в имени нет слов вроде bot или crawler, запись выглядит как обычный браузер.
Третья и самая большая - ответ без клика. Человек спросил, модель назвала три компании, человек запомнил название и позже набрал его в поиске. В журнале сервера и в аналитике этот эпизод не оставил ни одной строки.
От журнала к замеру ответов
Журнал отвечает на технический вопрос: доходят ли роботы нейросетей до сайта и видят ли его содержимое. Если поисковый робот нейросети не заходит месяц, работать над текстами рано - сначала надо чинить доступ.
Вопрос бизнеса другой: называет ли модель тебя, когда покупатель спрашивает о твоей категории. На него отвечает только замер - регулярный прогон вопросов покупателя через нейросети с записью ответов целиком. Его мы делаем в Prodvig.ai: там видно, кого называют вместо тебя и из каких источников собран ответ.
Как устроен такой замер и почему одного вопроса мало, разобрано в материале о том, как измерить видимость бренда в нейросетях. Разница между ответом по памяти и ответом с поиском, которая объясняет роль поисковых роботов, - в разборе о том, когда нейросеть ищет в интернете, а когда отвечает по памяти.
Частые вопросы
Частые вопросы
Главный вывод
Начни с двух проверок. Открой robots.txt и убедись, что поисковые роботы нейросетей не закрыты случайно. Потом попроси у хостинга журнал за месяц и найди в нём строки с именами из таблицы.
Дальше вопрос переходит из техники в маркетинг: пускать роботов мало, нужно, чтобы по итогу называли тебя.
А ты знаешь, заходил ли на твой сайт в этом месяце хоть один поисковый робот нейросети?
Источники
- Prodvig.ai - сервис ежедневного замера видимости бренда в ответах нейросетей: что называют вместо тебя и из каких источников
- Overview of OpenAI Crawlers - назначение OAI-SearchBot, ChatGPT-User и GPTBot, документация OpenAI
- Does Anthropic crawl data from the web - роботы ClaudeBot, Claude-User и Claude-SearchBot, справка Anthropic
- Perplexity Crawlers - PerplexityBot и Perplexity-User, документация Perplexity
- Быстрый ответ - запрет YandexAdditional в robots.txt, справка Яндекс Вебмастера
- Google's common crawlers - в том числе Google-Extended, документация Google
- The rise of the AI crawler - исследование Vercel: роботы нейросетей не выполняют JavaScript
