Новый формат
Дубли страниц: чем опасны и как устранять
Дубли — когда один и тот же или почти один смысл доступен по разным адресам. Поисковик тратит обход на копии, размывает сигналы и может показать в выдаче не ту версию, которую вы считаете главной.
Ниже — что считать дублем, какие бывают виды, типичные причины на сайтах, риски для SEO и практичный порядок: найти → выбрать канон → склеить или закрыть. Отдельно про инструменты закрытия и редиректы — в смежных статьях.
Что такое дубли страниц
Дубликат в SEO — несколько URL, которые для поиска выглядят как один документ или конкурируют за один интент без явной пользы от разделения. Пользователь может открыть обе версии; робот решает, какую считать основной.
Не путайте с осознанной структурой: разные товары, разные услуги и разные статьи — не дубли, даже если шаблон похож. Проблема начинается, когда смысл и ценность почти совпадают, а адресов много.
Признаки:
- один title/H1 на нескольких URL;
- одинаковый основной текст при разных параметрах;
- www и без www / http и https отдают 200 без склейки;
- фильтры и сортировки плодят бесконечные комбинации в индексе.
Точные и неточные дубли
Точные (или почти точные) — один и тот же документ по разным адресам: смена регистра, слэш в конце, session id, зеркала. Неточные — пересечение контента: категория «как есть» и та же с сортировкой, карточка и print-версия, тонкие пересечения фильтров.
Неточные коварнее: краулер видит «разные» страницы, а ценность для пользователя почти нулевая. Именно они раздувают индекс интернет-магазинов.
Примеры точных:
- `example.ru` и `www.example.ru` без 301;
- http и https оба в индексе;
- URL с `?utm_…` рядом с чистым;
- копия в `/index.php` и ЧПУ.
Примеры неточных:
- сортировка и пагинация как отдельные «полные» документы;
- фильтр цвет+размер vs цвет при одном и том же листинге;
- страница «для печати» с тем же текстом;
- дубли тегов/рубрик блога с одинаковыми подборками.
Откуда берутся дубли
Чаще всего это не «злой копирайтер», а настройки CMS, магазина и маркетинга: параметры сессий, несколько путей к одной карточке, генерация посадочных из рекламы, тестовые копии на поддоменах, выгрузки в каталоги с параметрами.
Контентные неточные дубли появляются, когда под каждый ключ штампуют почти одинаковый текст или когда автонаполнение плодит тонкие страницы. Тогда лечат и технику URL, и редакционную политику.
Типовые источники:
- зеркала и протоколы без единой склейки;
- GET-параметры (сорт, фильтр, метки, сессия);
- несколько шаблонов одной сущности;
- копии разделов при редизайне без 301;
- внешние ссылки на «грязные» URL, которые попали в индекс.
Чем опасны дубли для SEO
Бюджет обхода уходит на копии вместо новых и важных URL. Ссылочный и поведенческий сигналы расползаются по версиям. В выдаче может закрепиться неудобный или устаревший адрес.
Внутри сайта возникает каннибализация: несколько URL претендуют на один запрос, ни один не набирает устойчивости. Для магазина это ещё и шум в аналитике: цели и ассоциированные конверсии «размазаны».
Что заметите:
- в индексе тысячи URL при сотнях полезных;
- скачки выбранного канона в панелях;
- дубли title в крауле;
- слабая индексация новых разделов при жирных фильтрах.
Как найти дубли
Начните с зеркал и протокола: все ли варианты отдают 301 на один канон. Дальше — краулер по сайту: группируйте по title, H1, hash контента, смотрите canonical и коды ответа.
В Яндекс Вебмастере и Google Search Console смотрите примеры проиндексированных URL, дубли и выбранный канон. Поиск `site:domain.ru` и выборочная проверка подозрительных шаблонов дополняют картину.
Мини-порядок аудита:
- склейка www / https / слэш;
- выборка параметров (?sort, ?utm, session);
- пагинация и фильтры каталога;
- повторяющиеся title/H1;
- поддомены и staging в индексе.
Как устранять: канон, 301, noindex
Выберите один предпочтительный URL на сущность. Внутренние ссылки, sitemap и реклама должны вести на него. Остальные — 301 (если не нужны) или canonical / согласованный noindex (если нужны для UX).
Не закрывайте в robots.txt то, что хотите вычистить noindex’ом без обхода — робот может не увидеть директиву. Не копите цепочки редиректов. После правок переобход и мониторинг индекса — часть работы, не «разово нажал и забыл».
Инструменты склейки:
- 301 между зеркалами и устаревшими путями;
- `rel="canonical"` на предпочтительный документ;
- meta robots / X-Robots-Tag для служебного и части параметрических;
- настройки параметров URL в панелях вебмастеров;
- правка шаблонов CMS, чтобы не плодить новые дубли.
Частые вопросы
Дубль — это всегда полный копипаст HTML?
Нет. Точный дубль — почти идентичный документ. Неточный — сильное пересечение смысла/блоков при разных URL (часто фильтры, пагинация, «похожие» карточки).
Чем дубли отличаются от плагиата с чужого сайта?
Внутренние дубли — проблема вашего домена. Внешний копипаст — другая история (уникальность, жалобы). Здесь про внутреннюю гигиену URL.
Редирект или canonical?
Если старый URL не должен открываться — 301. Если обе версии нужны пользователю, но в индекс одна — чаще `rel="canonical"` + аккуратная индексация. См. статью про редиректы.
robots.txt лечит дубли?
Нет как основной метод. Disallow режет обход, но не заменяет склейку и каноникал. Для «убрать из индекса» — noindex при доступности документа или 301.
Опасны ли UTM-метки?
Как отдельные индексные URL — да, если робот их обходит и индексирует. Обычно каноникал на чистый URL + настройки параметров в панелях вебмастеров.
Как быстро проверить масштаб?
Краулер (список title/H1/canonical), выгрузка «страницы в поиске» в Вебмастере/Search Console, поиск `site:` по повторяющимся title. Для больших каталогов — приоритет по разделам.
Дубли = фильтр «за дубли» навсегда?
Чаще это потеря эффективности: бюджет обхода, каннибализация, слабые сниппеты. Жёсткие санкции — отдельный разговор; сначала уберите системные причины дублей.
Сколько ждать после склейки?
Переобход и смена канона в выдаче — не мгновенно: дни–недели, на крупных сайтах дольше. Следите за отчётами индексации, не за «завтра ТОП».
В индексе куча копий URL?
Найдём системные дубли и склеим канон — без «всё на главную».
Обсудить задачу