Новый формат
Закрытие сайта или страниц от индексации: robots, meta и когда это нужно
Не всё на сайте должно попадать в индекс: служебные разделы, черновики, дубли фильтров, тестовые поддомены. Закрытие от индексации — штатный инструмент SEO, а не «пряталки» для обмана роботов.
Ниже — зачем закрывать URL, какие методы работают в 2026 и чего избегать (клоакинг через JS, «скрытие» контента от ботов). Опора — robots.txt, meta robots / X-Robots-Tag, canonical и коды ответа.
Когда закрывать от индексации
Цель — не засорять индекс и не конкурировать сами с собой дублями. Закрывают то, что не должно отвечать на спрос в поиске.
Типовые случаи:
- корзина, личный кабинет, поиск по сайту, фильтры с бесконечными URL;
- черновики, thank-you, технические лендинги;
- дубли (www/без, http/https, параметры UTM — лучше каноникал/редиректы);
- staging и демо-поддомены;
- устаревшие разделы до 301 на актуальные.
robots.txt: обход, не «магия индекса»
Файл `/robots.txt` задаёт правила обхода для User-agent. Им удобно закрывать папки (`/admin/`, `/cgi-bin/`), служебные скрипты и иногда тяжёлые разделы от лишнего краулинга.
Ограничение: запрет обхода ≠ гарантия отсутствия в индексе. Если URL уже известен поисковику, Disallow может помешать отдать noindex.
Практика:
- не закрывайте CSS/JS, нужные для отрисовки ключевых страниц;
- проверяйте файл после деплоя (опечатка Disalllow ломает обход);
- для «весь сайт» на проде почти никогда не ставьте `Disallow: /` без крайней нужды.
meta robots и X-Robots-Tag
На HTML-странице: `<meta name="robots" content="noindex, follow">` (или `noindex, nofollow` — осознанно). Для PDF и не-HTML удобнее заголовок `X-Robots-Tag: noindex`.
Чтобы noindex сработал, робот должен получить документ. Не блокируйте такие URL в robots.txt, если цель — именно убрать из индекса.
Частые директивы:
- `noindex` — не показывать в выдаче;
- `nofollow` — не передавать вес по ссылкам со страницы (смысл эволюционировал; не путайте с rel на одной ссылке);
- `noarchive` — без сохранённой копии;
- `none` — сокращение для noindex, nofollow.
Дубли, разделы, папки, поддомены
Дубли лучше не «прятать вечно», а свести к одному URL: 301, `rel="canonical"`, единые параметры. robots/noindex — запасной контур, если дубль пока нельзя убрать.
Раздел или папку закрывают правилами в robots и/или шаблоном meta на всех URL раздела. Поддомен для поисковика — отдельный хост: правила задают на нём же.
Что выбрать
| Задача | Предпочтительный метод |
|---|---|
| Служебная папка | Disallow в robots.txt |
| Страница «не в поиске» | noindex (+ доступна для обхода) |
| Дубль контента | 301 или canonical |
| Staging | Авторизация / IP, плюс noindex |
| Удалено навсегда | 410 или 301 на замену |
Ссылки, картинки и устаревшие трюки
Отдельные исходящие ссылки помечают `rel="nofollow"` / `sponsored` / `ugc` по смыслу — это не «закрытие сайта от индексации». Картинки: `noimageindex` редко нужен; важнее не воровать чужие фото и отдавать нормальные размеры.
Старые гайды предлагали `<noindex>`, SEOhide и кодирование блоков в Base64/JS «чтобы бот не видел». Так делать не стоит: это клоакинг и ломкая схема. Нужный контент показывайте всем одинаково или честно закрывайте URL.
Чего избегать:
- разный HTML для бота и человека;
- скрытие коммерческого текста только от роботов;
- вечный Disallow всего сайта на проде «на всякий случай»;
- забытый noindex после запуска.
Серверные ответы и пароль
403/401 с авторизацией — жёсткое закрытие: робот не получит контент. 410 — «удалено навсегда». 404 — «не найдено» (для временных дыр ок, для переездов лучше 301).
Пароль на staging надёжнее надежды на robots: случайные ссылки и сканеры не утащат черновик в индекс.
Краткий вывод
Закрытие от индексации — часть гигиены сайта: служебное и дубли не должны отвечать в поиске. Используйте robots для обхода, noindex/X-Robots-Tag для индекса, canonical/301 для дублей. Без клоакинга и «хитрых» JS-пряталок.
Частые вопросы
robots.txt запрещает индексацию?
Нет: Disallow просит не обходить URL. Страница всё равно может появиться в выдаче по ссылкам без сниппета. Для «не индексировать» надёжнее meta robots / X-Robots-Tag noindex (при доступности для обхода) или закрытый доступ.
Чем noindex отличается от Disallow?
Disallow — не ходить. noindex — можно сходить, но не класть в индекс (или убрать). Часто комбинируют осознанно: служебное закрывают и обходом, и noindex.
Нужен ли тег <noindex> Яндекса?
Устаревшая практика. Современный стандарт — meta name="robots" content="noindex" и/или HTTP-заголовок X-Robots-Tag.
Как закрыть весь сайт на время разработки?
Лучше пароль / IP allowlist / отдельный staging. Временный noindex на всех страницах — допустим, но легко забыть снять. Не полагайтесь только на robots.txt.
Можно ли прятать текст от роботов через JavaScript?
Нет как SEO-тактика. Скрытие разного контента людям и ботам — клоакинг, риск санкций. Нужный контент либо в индексе, либо страница честно закрыта.
Нужно навести порядок в индексе?
Разберём robots, noindex и дубли — без клоакинга и забытых запретов на проде.
Обсудить задачу