Saltar al contenido

Inicio · Blog · Bloquear un sitio o páginas a la indexación: robots,…

Enviar solicitud

Formato nuevo

Bloquear un sitio o páginas a la indexación: robots, meta y cuándo hace falta

No todo en un sitio debe entrar al índice: secciones de utilidad, borradores, duplicados de filtros, subdominios de test. Bloquear a la indexación es una herramienta SEO normal — no un escondite para engañar a los robots.

Abajo: por qué bloqueas URLs, qué métodos funcionan en 2026 y qué evitar (cloaking con JS, «esconder» contenido a los bots). La columna vertebral es robots.txt, meta robots / X-Robots-Tag, canonical y códigos de respuesta.

Compartir
Telegram

Cuándo bloquear a la indexación

La meta no es contaminar el índice ni competir contigo mismo vía duplicados. Bloquea lo que no debería responder a la demanda de búsqueda.

Casos típicos:

  • carrito, área de cuenta, búsqueda del sitio, filtros con URLs infinitas
  • borradores, thank-you pages, landings técnicas
  • duplicados (www/sin-www, http/https, params UTM — mejor canonical/redirects)
  • subdominios staging y demo
  • secciones desfasadas hasta un 301 a las actuales

Auditoría SEO técnica

robots.txt: reglas de crawl, no magia de índice

El archivo `/robots.txt` fija reglas de crawl por User-agent. Es práctico para bloquear carpetas (`/admin/`, `/cgi-bin/`), scripts de utilidad y a veces secciones pesadas de crawl extra.

Límite: un ban de crawl ≠ garantía de ausencia del índice. Si la búsqueda ya conoce la URL, Disallow puede bloquear entregar noindex.

Práctica:

  • no bloquees CSS/JS necesarios para renderizar páginas clave
  • revisa el archivo tras el deploy (un typo en Disallow rompe el crawl)
  • para todo el sitio en producción casi nunca uses `Disallow: /` sin necesidad dura

meta robots y X-Robots-Tag

En una página HTML: `<meta name="robots" content="noindex, follow">` (o `noindex, nofollow` — a propósito). Para PDF y no-HTML, el header `X-Robots-Tag: noindex` es más fácil.

Para que noindex funcione, el robot debe obtener el documento. No bloquees esas URLs en robots.txt si la meta es sacarlas del índice.

Directivas habituales:

  • `noindex` — no mostrar en resultados
  • `nofollow` — no pasar equity de enlaces desde la página (el sentido evolucionó; no lo confundas con rel en un enlace suelto)
  • `noarchive` — sin copia en caché
  • `none` — atajo de noindex, nofollow

Copia en caché de Yandex

Duplicados, secciones, carpetas, subdominios

Los duplicados es mejor no esconderlos para siempre, sino colapsarlos a una URL: 301, `rel="canonical"`, params unificados. robots/noindex es respaldo si el duplicado aún no se puede quitar.

Una sección o carpeta se bloquea con reglas robots y/o una plantilla meta en todas las URLs de la sección. Un subdominio es un host aparte para la búsqueda: fija reglas también ahí.

Qué elegir

TrabajoMétodo preferido
Carpeta de utilidadDisallow en robots.txt
Página «no en búsqueda»noindex (+ crawlable)
Duplicado de contenido301 o canonical
StagingAuth / IP, más noindex
Fuera para siempre410 o 301 a un reemplazo

Enlaces, imágenes y trucos desfasados

Los enlaces salientes individuales llevan `rel="nofollow"` / `sponsored` / `ugc` por sentido — eso no es bloquear el sitio a la indexación. Imágenes: `noimageindex` rara vez hace falta; más importante no robar fotos y servir tamaños sensatos.

Guías viejas sugerían `<noindex>`, SEOhide y bloques codificados en Base64/JS «para que el bot no los vea». No: eso es cloaking y un esquema frágil. Muestra el contenido necesario igual a todos, o bloquea la URL con honestidad.

Qué evitar:

  • HTML distinto para bots y personas
  • esconder texto comercial solo a los robots
  • Disallow eterno de todo el sitio de producción «por si acaso»
  • noindex olvidado tras el lanzamiento

Respuestas del servidor y contraseñas

403/401 con auth es un bloqueo duro: el robot no obtendrá contenido. 410 — fuera para siempre. 404 — no encontrado (OK para huecos temporales; para mudanzas prefiere 301).

Una contraseña en staging gana a esperar a robots: enlaces aleatorios y scanners no arrastrarán un borrador al índice.

Resumen corto

Bloquear a la indexación es higiene del sitio: URLs de utilidad y duplicados no deberían responder en búsqueda. Usa robots para crawl, noindex/X-Robots-Tag para el índice, canonical/301 para duplicados. Sin cloaking ni trucos ingeniosos de escondite con JS.

FAQ

¿robots.txt prohíbe indexar?

No: Disallow pide no rastrear una URL. La página aún puede aparecer en resultados vía enlaces sin snippet. Para «no indexar», meta robots / X-Robots-Tag noindex (cuando es crawlable) o acceso restringido es más fiable.

¿En qué se diferencia noindex de Disallow?

Disallow — no rastrear. noindex — puede rastrear, pero no meter en el índice (o sacar). A menudo se combinan a propósito: URLs de utilidad cerradas al crawl y con noindex.

¿Sigue haciendo falta el viejo tag Yandex <noindex>?

Práctica obsoleta. El estándar moderno es meta name="robots" content="noindex" y/o el header HTTP X-Robots-Tag.

¿Cómo bloqueo todo el sitio durante el desarrollo?

Mejor contraseña / allowlist de IP / un host staging aparte. Temporary noindex en todas las páginas vale, pero es fácil olvidar quitarlo. No te apoyes solo en robots.txt.

¿Puedo esconder texto a los robots con JavaScript?

No como táctica SEO. Mostrar contenido distinto a personas y bots es cloaking — riesgo de sanción. El contenido necesario o está en el índice, o la página se bloquea con honestidad.

¿Staging o filtros aún en el índice?

Separamos crawl y noindex con claridad — sin cloaking ni Disallow eterno en producción.

Hablar del proyecto