Новый формат
Логи сервера и поведение поисковых роботов
Логи сервера фиксируют, кто и что запрашивал: люди, CDN, мониторинг и поисковые боты. По ним видно реальный обход — не только то, что показывают панели вебмастеров.
Ниже — что смотреть в access-логах, как оценить бюджет обхода, найти лишние URL и ошибки сканирования. Закрытие от индексации и полный техаудит — смежные темы в отдельных статьях.
Что такое логи сервера
Access-лог — хронология HTTP-запросов: IP, время, метод, URL, код ответа, User-Agent, иногда referrer и размер ответа. Error-лог — сбои приложения/сервера; для SEO чаще важнее access.
Роботы оставляют характерные User-Agent (Googlebot, YandexBot и др.). Не все «ботоподобные» строки — официальные краулеры: сверяйте IP/документацию поисковика при сомнениях.
Типичные поля:
- дата и время;
- запрошенный URL;
- код HTTP (200, 301, 404, 500…);
- User-Agent;
- метод GET/POST.
Как открыть и разобрать лог
Файлы `.log` удобно смотреть в редакторе или импортировать в таблицу (часто через CSV/разделитель пробел). Несколько дневных файлов склеивают (`cat` / объединение в панели) перед анализом периода.
Отфильтруйте строки с нужным User-Agent, отсортируйте по URL и коду ответа. Сводные таблицы: сколько хитов на URL, доля 404 у бота, топ «съедающих» бюджет путей.
Быстрый порядок:
- взять срез за неделю–месяц;
- отфильтровать Googlebot / YandexBot;
- топ URL по числу запросов;
- доля не-200 ответов;
- URL с `?` и явными дублями.
Бюджет обхода и приоритеты
Если бот постоянно ходит по фильтрам, сессиям, фавиконам и пустым пагинациям, важные услуги обновляются реже. В логах это видно как частые хиты на «мусорные» пути при редких заходах на деньги-страницы.
Снижайте шум: canonical и единые URL, закрытие служебного от обхода/индекса по задаче, ускорение ответа, меньше цепочек редиректов, нормальная перелинковка на приоритет.
Что обычно ест бюджет:
- дубли с параметрами;
- бесконечные фильтры и сортировки;
- битые ссылки (массовые 404);
- тяжёлые медиа без нужды в индексе;
- служебные кабинеты, если их не закрыли от обхода.
Ошибки сканирования и что править
Смотрите 4xx/5xx у ботов: битые внутренние ссылки, протухшие редиректы, таймауты. Сверяйте с отчётами обхода в Яндекс Вебмастере и Google Search Console — расхождения бывают из‑за CDN и выборки.
Частый обход каталога при пустом контенте — сигнал упростить структуру или закрыть раздел. Редкие важные URL — усилить внутренние ссылки и sitemap.
Чеклист после разбора логов:
- починить топ-404, на которые есть внутренние ссылки;
- убрать/склеить дубли параметров;
- согласовать robots.txt и noindex с целью;
- обновить sitemap приоритетных URL;
- повторить срез логов через 2–4 недели.
Частые вопросы
Зачем логи, если есть Вебмастер / Search Console?
Панели дают сводки и выборки. Логи — полный поток запросов к серверу: редкие боты, медиа, странные URL и точные коды ответа.
Где взять access.log?
На хостинге / VPS: каталог логов веб-сервера (часто `/var/log/nginx/` или панель хостера). Формат зависит от Apache/Nginx и настроек.
Что такое бюджет обхода?
Условный лимит внимания робота к сайту за период. Его «съедают» дубли, параметры, тяжёлые разделы и 4xx/5xx. Цель — чтобы бот чаще ходил по важным URL.
Можно ли править SEO только логами?
Нет. Логи — диагностика обхода. Дальше — правки robots/canonical/структуры, контент и техника. См. техаудит и закрытие от индексации.
Нужен ли платный Log File Analyzer?
На старте хватит выгрузки + Excel/Google Sheets или скрипта. Анализаторы ускоряют большие объёмы; названия и тарифы меняются.
Роботы плохо обходят сайт?
Разберём access-логи и бюджет обхода — найдём дубли, 404 и лишний crawl.
Обсудить задачу