Значит, сейчас вы откроете логи сервера и попытаетесь разобраться, где там те самые роботы. Первое, что нужно понять: в логах сервера хранится запись каждого обращения, включая запросы от поисковых ботов. Каждая строка логов — это отдельный запрос, и в этой строке закодирована вся информация о том, кто пришёл на сайт и что он запрашивал.
Структура записи в логах сервера
Когда Googlebot запрашивает страницу вашего сайта, сервер записывает это в логи сервера точно так же, как и запрос от обычного посетителя. Но внутри этой записи есть детали, которые выдают робота.
Вот как выглядит типичная строка из логов Apache:
192.168.1.1 - - [01/Oct/2026:12:34:56 +0200] "GET /article HTTP/1.1" 200 5432 "-" "Mozilla/5.0 (compatible; Googlebot/2.1; +http://www.google.com/bot.html)"
Разберём эту строку по частям. Первый блок — IP-адрес источника запроса. Потом идёт дата и время запроса. Затем сам HTTP-запрос: метод (GET), путь (URL) и версия протокола. Дальше — код ответа сервера (в данном примере 200, что означает успех). Цифра 5432 — размер ответа в байтах. И самое важное для нас — последняя часть, в кавычках: это User-Agent строка.
User-Agent: как узнать, кто это
User-Agent — это строка, которую отправляет браузер или робот, чтобы представиться серверу. Для поисковых ботов эта строка содержит название робота и ссылку на информацию о нём.
Вот реальные примеры User-Agent строк из логов, которые вы встретите:
Googlebot:
Mozilla/5.0 (compatible; Googlebot/2.1; +http://www.google.com/bot.html)
Это стандартный User-Agent, который использует Googlebot при обходе большинства сайтов. В строке есть слово «compatible» и явное указание «Googlebot/2.1». Версия может отличаться, но формат остаётся тем же.
Yandexbot:
Mozilla/5.0 (compatible; YandexBot/3.0; +http://yandex.com/bots)
Яндекс использует «YandexBot» в User-Agent строке. Версия может быть 3.0, 3.1 или новее. Ссылка указывает на yandex.com/bots.
Bingbot:
Mozilla/5.0 (compatible; Bingbot/2.0; +http://www.bing.com/bingbot.htm)
Microsoft Bing использует «Bingbot» и ссылку на bing.com.
Почему в User-Agent строке написано Mozilla? Потому что именно так началась история: давным-давно браузеры представлялись как Mozilla, и роботы скопировали этот формат для совместимости. Ключевое слово всё равно «compatible» плюс явное название робота.
Коды ответа сервера и индексация
Когда робот запрашивает страницу, сервер отвечает кодом. Три цифры в середине строки логов — это код ответа. Для индексации и SEO вашего сайта эти коды критически важны.
200 — успех. Робот получил страницу целиком. Это хороший сигнал: контент был загружен, про него есть что рассказать поисковым системам. Если большинство кодов ответа вашего сайта — 200, это означает, что Googlebot и другие боты видят сайт полностью.
301 — постоянный редирект. Страница переехала на новый адрес. Робот следует по редиректу и индексирует конечный URL. Это нормально, но чем больше этих редиректов, тем больше ресурсов сервера уходит впустую, и тем медленнее робот может обойти больше страниц.
404 — не найдено. Робот запрашивает страницу, которой нет. Это случается, когда вы удалили контент или ссылка нарушена. Много кодов 404 в логах означает, что роботы тратят краулинговый бюджет на несуществующие страницы вместо индексации полезного контента.
5xx (500, 503 и другие) — ошибки сервера. Если робот получает такой код, это означает проблемы с сервером. Если это случается часто, поисковые системы могут временно снизить частоту обхода сайта, опасаясь проблем.
Анализ логов показывает, какие коды ответа возвращаются ботам. Если вы видите много 404 или 5xx для важных страниц, это прямо влияет на индексацию и видимость в поиске.
Краулинговый бюджет: почему не все страницы посещаются одинаково
У каждого сайта есть краулинговый бюджет — это количество запросов, которое робот может сделать в день. Бюджет зависит от выделенной нагрузки на сервер, скорости ответов и авторитета домена. Google может отправить боту 10 тысяч запросов в день на крупный сайт типа Aliexpress, но для маленького сайта это может быть всего 50 запросов в день.
Вот почему частота обхода разных страниц отличается. Роботы посещают чаще:
- главную страницу;
- популярные разделы с большим количеством внутренних ссылок;
- страницы, которые часто обновляются;
- страницы, где много ссылок с других сайтов.
Редко посещаемые:
- архивные статьи;
- страницы глубоко в разделах;
- страницы с малым количеством ссылок;
- новые страницы, на которые ещё мало ссылок.
В логах сервера это видно наглядно. Если вы посчитаете, сколько раз каждая страница была запрошена Googlebot и другими ботами, вы получите реальную картину того, как робот видит приоритеты вашего сайта. Это прямо связано с видимостью в поиске — страницы, которые обходят чаще, проверяют на изменения чаще и переиндексируют быстрее.
Как отличить поддельных ботов от легитимных
Но не все боты в логах — это Googlebot, Yandexbot или другие известные системы поиска. В логах часто встречаются поддельные боты, которые притворяются легитимными. Это скреперы, боты для сбора данных, парсеры контента и просто программы, которые сканируют сайт в поисках уязвимостей.
Вот пример поддельного бота в User-Agent строке:
«Mozilla/5.0 (compatible; MagicBot/1.0; +http://example-crawler.com/bot)»
Или вообще без указания названия:
«Python-Requests/2.28.0»
Как отличить? Есть несколько способов.
Во-первых, проверьте обратный DNS для IP-адреса. Легитимные боты Googlebot идут с IP-адресов в диапазонах Google, которые можно проверить геолокацией. Яндекс использует IP-адреса Яндекса. Если IP-адрес зарегистрирован на неизвестного хостинг-провайдера, это подозрительно.
Во-вторых, официальные боты указывают в User-Agent ссылку на свою справку. Googlebot ссылается на google.com/bot.html, Yandexbot — на yandex.com/bots. Если это ссылка на unknown-domain.com, это явно поддельный бот.
В-третьих, посмотрите на паттерны запросов. Поддельные боты часто запрашивают кучу одинаковых страниц подряд, пытаясь скачать весь контент. Или запрашивают несуществующие адреса параметров типа ?id=1, ?id=2, ?id=3. Легитимные боты обычно следуют по ссылкам вашего сайта более логично.
Анализ логов поможет найти этих поддельных ботов и ограничить их запросы на уровне сервера, поскольку недобросовестные боты могут игнорировать robots.txt.
Краулинговый бюджет и видимость в поиске
Для SEO-специалиста это самое важное. Если краулинговый бюджет вашего сайта используется неэффективно — например, робот обходит много дублей страниц или старые архивные страницы — то он просто не доберётся до новых статей вашего блога.
Представьте: у сайта есть 100 хороших статей, но краулинговый бюджет позволяет ботам обойти в день только 50 страниц. Если в логах видно, что половина этого бюджета уходит на параметризованные версии страниц (вроде ?sort=price или ?color=red), то новые статьи остаются необнаруженными неделями.
Анализ логов показывает эту проблему. Посчитайте в логах, сколько раз в день каждый URL запрашивается ботами. Если видите, что параметризованные версии одной страницы запрашиваются отдельно десятки раз, нужно их объединить с помощью canonical тегов или настройки параметров URL в Search Console.
Частота обхода страниц напрямую влияет на то, как часто они переиндексируются. Если важная страница обходится один раз в неделю, а конкурент получает обновления каждый день, то изменения на странице конкурента попадут в индекс быстрее, и веб-система поиска будет видеть его контент свежее.
Вот почему анализ логов — это больше, чем просто проверка безопасности. Это инструмент SEO-оптимизации. Логи показывают, куда робот ходит на вашем сайте, сколько ресурсов он тратит, какие проблемы встречает. На основе этих данных можно оптимизировать краулинговый бюджет, ускорить переиндексацию важных страниц и улучшить видимость в поиске.
