Formato nuevo
Bloquear un sitio o páginas a la indexación: robots, meta y cuándo hace falta
No todo en un sitio debe entrar al índice: secciones de utilidad, borradores, duplicados de filtros, subdominios de test. Bloquear a la indexación es una herramienta SEO normal — no un escondite para engañar a los robots.
Abajo: por qué bloqueas URLs, qué métodos funcionan en 2026 y qué evitar (cloaking con JS, «esconder» contenido a los bots). La columna vertebral es robots.txt, meta robots / X-Robots-Tag, canonical y códigos de respuesta.
Cuándo bloquear a la indexación
La meta no es contaminar el índice ni competir contigo mismo vía duplicados. Bloquea lo que no debería responder a la demanda de búsqueda.
Casos típicos:
- carrito, área de cuenta, búsqueda del sitio, filtros con URLs infinitas
- borradores, thank-you pages, landings técnicas
- duplicados (www/sin-www, http/https, params UTM — mejor canonical/redirects)
- subdominios staging y demo
- secciones desfasadas hasta un 301 a las actuales
robots.txt: reglas de crawl, no magia de índice
El archivo `/robots.txt` fija reglas de crawl por User-agent. Es práctico para bloquear carpetas (`/admin/`, `/cgi-bin/`), scripts de utilidad y a veces secciones pesadas de crawl extra.
Límite: un ban de crawl ≠ garantía de ausencia del índice. Si la búsqueda ya conoce la URL, Disallow puede bloquear entregar noindex.
Práctica:
- no bloquees CSS/JS necesarios para renderizar páginas clave
- revisa el archivo tras el deploy (un typo en Disallow rompe el crawl)
- para todo el sitio en producción casi nunca uses `Disallow: /` sin necesidad dura
meta robots y X-Robots-Tag
En una página HTML: `<meta name="robots" content="noindex, follow">` (o `noindex, nofollow` — a propósito). Para PDF y no-HTML, el header `X-Robots-Tag: noindex` es más fácil.
Para que noindex funcione, el robot debe obtener el documento. No bloquees esas URLs en robots.txt si la meta es sacarlas del índice.
Directivas habituales:
- `noindex` — no mostrar en resultados
- `nofollow` — no pasar equity de enlaces desde la página (el sentido evolucionó; no lo confundas con rel en un enlace suelto)
- `noarchive` — sin copia en caché
- `none` — atajo de noindex, nofollow
Duplicados, secciones, carpetas, subdominios
Los duplicados es mejor no esconderlos para siempre, sino colapsarlos a una URL: 301, `rel="canonical"`, params unificados. robots/noindex es respaldo si el duplicado aún no se puede quitar.
Una sección o carpeta se bloquea con reglas robots y/o una plantilla meta en todas las URLs de la sección. Un subdominio es un host aparte para la búsqueda: fija reglas también ahí.
Qué elegir
| Trabajo | Método preferido |
|---|---|
| Carpeta de utilidad | Disallow en robots.txt |
| Página «no en búsqueda» | noindex (+ crawlable) |
| Duplicado de contenido | 301 o canonical |
| Staging | Auth / IP, más noindex |
| Fuera para siempre | 410 o 301 a un reemplazo |
Enlaces, imágenes y trucos desfasados
Los enlaces salientes individuales llevan `rel="nofollow"` / `sponsored` / `ugc` por sentido — eso no es bloquear el sitio a la indexación. Imágenes: `noimageindex` rara vez hace falta; más importante no robar fotos y servir tamaños sensatos.
Guías viejas sugerían `<noindex>`, SEOhide y bloques codificados en Base64/JS «para que el bot no los vea». No: eso es cloaking y un esquema frágil. Muestra el contenido necesario igual a todos, o bloquea la URL con honestidad.
Qué evitar:
- HTML distinto para bots y personas
- esconder texto comercial solo a los robots
- Disallow eterno de todo el sitio de producción «por si acaso»
- noindex olvidado tras el lanzamiento
Respuestas del servidor y contraseñas
403/401 con auth es un bloqueo duro: el robot no obtendrá contenido. 410 — fuera para siempre. 404 — no encontrado (OK para huecos temporales; para mudanzas prefiere 301).
Una contraseña en staging gana a esperar a robots: enlaces aleatorios y scanners no arrastrarán un borrador al índice.
Resumen corto
Bloquear a la indexación es higiene del sitio: URLs de utilidad y duplicados no deberían responder en búsqueda. Usa robots para crawl, noindex/X-Robots-Tag para el índice, canonical/301 para duplicados. Sin cloaking ni trucos ingeniosos de escondite con JS.
FAQ
¿robots.txt prohíbe indexar?
No: Disallow pide no rastrear una URL. La página aún puede aparecer en resultados vía enlaces sin snippet. Para «no indexar», meta robots / X-Robots-Tag noindex (cuando es crawlable) o acceso restringido es más fiable.
¿En qué se diferencia noindex de Disallow?
Disallow — no rastrear. noindex — puede rastrear, pero no meter en el índice (o sacar). A menudo se combinan a propósito: URLs de utilidad cerradas al crawl y con noindex.
¿Sigue haciendo falta el viejo tag Yandex <noindex>?
Práctica obsoleta. El estándar moderno es meta name="robots" content="noindex" y/o el header HTTP X-Robots-Tag.
¿Cómo bloqueo todo el sitio durante el desarrollo?
Mejor contraseña / allowlist de IP / un host staging aparte. Temporary noindex en todas las páginas vale, pero es fácil olvidar quitarlo. No te apoyes solo en robots.txt.
¿Puedo esconder texto a los robots con JavaScript?
No como táctica SEO. Mostrar contenido distinto a personas y bots es cloaking — riesgo de sanción. El contenido necesario o está en el índice, o la página se bloquea con honestidad.
¿Staging o filtros aún en el índice?
Separamos crawl y noindex con claridad — sin cloaking ni Disallow eterno en producción.
Hablar del proyecto