К содержанию

Главная · Блог · Дубли страниц: чем опасны и как устранять

Оставить заявку

Новый формат

Дубли страниц: чем опасны и как устранять

Дубли — когда один и тот же или почти один смысл доступен по разным адресам. Поисковик тратит обход на копии, размывает сигналы и может показать в выдаче не ту версию, которую вы считаете главной.

Ниже — что считать дублем, какие бывают виды, типичные причины на сайтах, риски для SEO и практичный порядок: найти → выбрать канон → склеить или закрыть. Отдельно про инструменты закрытия и редиректы — в смежных статьях.

Поделиться
Telegram VK

Что такое дубли страниц

Дубликат в SEO — несколько URL, которые для поиска выглядят как один документ или конкурируют за один интент без явной пользы от разделения. Пользователь может открыть обе версии; робот решает, какую считать основной.

Не путайте с осознанной структурой: разные товары, разные услуги и разные статьи — не дубли, даже если шаблон похож. Проблема начинается, когда смысл и ценность почти совпадают, а адресов много.

Признаки:

  • один title/H1 на нескольких URL;
  • одинаковый основной текст при разных параметрах;
  • www и без www / http и https отдают 200 без склейки;
  • фильтры и сортировки плодят бесконечные комбинации в индексе.

URL-адрес

Точные и неточные дубли

Точные (или почти точные) — один и тот же документ по разным адресам: смена регистра, слэш в конце, session id, зеркала. Неточные — пересечение контента: категория «как есть» и та же с сортировкой, карточка и print-версия, тонкие пересечения фильтров.

Неточные коварнее: краулер видит «разные» страницы, а ценность для пользователя почти нулевая. Именно они раздувают индекс интернет-магазинов.

Примеры точных:

  • `example.ru` и `www.example.ru` без 301;
  • http и https оба в индексе;
  • URL с `?utm_…` рядом с чистым;
  • копия в `/index.php` и ЧПУ.

Примеры неточных:

  • сортировка и пагинация как отдельные «полные» документы;
  • фильтр цвет+размер vs цвет при одном и том же листинге;
  • страница «для печати» с тем же текстом;
  • дубли тегов/рубрик блога с одинаковыми подборками.

Пагинация

Откуда берутся дубли

Чаще всего это не «злой копирайтер», а настройки CMS, магазина и маркетинга: параметры сессий, несколько путей к одной карточке, генерация посадочных из рекламы, тестовые копии на поддоменах, выгрузки в каталоги с параметрами.

Контентные неточные дубли появляются, когда под каждый ключ штампуют почти одинаковый текст или когда автонаполнение плодит тонкие страницы. Тогда лечат и технику URL, и редакционную политику.

Типовые источники:

  • зеркала и протоколы без единой склейки;
  • GET-параметры (сорт, фильтр, метки, сессия);
  • несколько шаблонов одной сущности;
  • копии разделов при редизайне без 301;
  • внешние ссылки на «грязные» URL, которые попали в индекс.

Автонаполнение сайта

Чем опасны дубли для SEO

Бюджет обхода уходит на копии вместо новых и важных URL. Ссылочный и поведенческий сигналы расползаются по версиям. В выдаче может закрепиться неудобный или устаревший адрес.

Внутри сайта возникает каннибализация: несколько URL претендуют на один запрос, ни один не набирает устойчивости. Для магазина это ещё и шум в аналитике: цели и ассоциированные конверсии «размазаны».

Что заметите:

  • в индексе тысячи URL при сотнях полезных;
  • скачки выбранного канона в панелях;
  • дубли title в крауле;
  • слабая индексация новых разделов при жирных фильтрах.

Логи сервера и обход

Проверьте себя

Мини-тест: дубли страниц

Два вопроса.

1 robots.txt как основной способ убрать дубли…
2 Если старый URL не должен открываться…

Как найти дубли

Начните с зеркал и протокола: все ли варианты отдают 301 на один канон. Дальше — краулер по сайту: группируйте по title, H1, hash контента, смотрите canonical и коды ответа.

В Яндекс Вебмастере и Google Search Console смотрите примеры проиндексированных URL, дубли и выбранный канон. Поиск `site:domain.ru` и выборочная проверка подозрительных шаблонов дополняют картину.

Мини-порядок аудита:

  • склейка www / https / слэш;
  • выборка параметров (?sort, ?utm, session);
  • пагинация и фильтры каталога;
  • повторяющиеся title/H1;
  • поддомены и staging в индексе.

Технический SEO-аудит

Как устранять: канон, 301, noindex

Выберите один предпочтительный URL на сущность. Внутренние ссылки, sitemap и реклама должны вести на него. Остальные — 301 (если не нужны) или canonical / согласованный noindex (если нужны для UX).

Не закрывайте в robots.txt то, что хотите вычистить noindex’ом без обхода — робот может не увидеть директиву. Не копите цепочки редиректов. После правок переобход и мониторинг индекса — часть работы, не «разово нажал и забыл».

Инструменты склейки:

  • 301 между зеркалами и устаревшими путями;
  • `rel="canonical"` на предпочтительный документ;
  • meta robots / X-Robots-Tag для служебного и части параметрических;
  • настройки параметров URL в панелях вебмастеров;
  • правка шаблонов CMS, чтобы не плодить новые дубли.

Редирект Закрытие от индексации HTTPS и склейка

Практика

Чеклист борьбы с дублями

После нахождения системной причины.

0 / 8 готово

Частые вопросы

Дубль — это всегда полный копипаст HTML?

Нет. Точный дубль — почти идентичный документ. Неточный — сильное пересечение смысла/блоков при разных URL (часто фильтры, пагинация, «похожие» карточки).

Чем дубли отличаются от плагиата с чужого сайта?

Внутренние дубли — проблема вашего домена. Внешний копипаст — другая история (уникальность, жалобы). Здесь про внутреннюю гигиену URL.

Редирект или canonical?

Если старый URL не должен открываться — 301. Если обе версии нужны пользователю, но в индекс одна — чаще `rel="canonical"` + аккуратная индексация. См. статью про редиректы.

robots.txt лечит дубли?

Нет как основной метод. Disallow режет обход, но не заменяет склейку и каноникал. Для «убрать из индекса» — noindex при доступности документа или 301.

Опасны ли UTM-метки?

Как отдельные индексные URL — да, если робот их обходит и индексирует. Обычно каноникал на чистый URL + настройки параметров в панелях вебмастеров.

Как быстро проверить масштаб?

Краулер (список title/H1/canonical), выгрузка «страницы в поиске» в Вебмастере/Search Console, поиск `site:` по повторяющимся title. Для больших каталогов — приоритет по разделам.

Дубли = фильтр «за дубли» навсегда?

Чаще это потеря эффективности: бюджет обхода, каннибализация, слабые сниппеты. Жёсткие санкции — отдельный разговор; сначала уберите системные причины дублей.

Сколько ждать после склейки?

Переобход и смена канона в выдаче — не мгновенно: дни–недели, на крупных сайтах дольше. Следите за отчётами индексации, не за «завтра ТОП».

В индексе куча копий URL?

Найдём системные дубли и склеим канон — без «всё на главную».

Обсудить задачу