Formato nuevo
Sitemap: XML y HTML — por qué hacen falta y cómo hacer uno
Un sitemap ayuda a los buscadores a conocer URLs importantes más rápido. Lo más habitual es `sitemap.xml` para bots; un mapa HTML es ayuda de orientación para personas. No es un interruptor de ranking — higiene de crawl junto a estructura sólida y enlaces internos.
Abajo: la diferencia entre formatos, cómo montar XML, cómo avisar a Yandex y Google, y qué evitar. Trátalo como la toma principal sobre sitemaps entre posts relacionados.
XML y HTML: dos mapas distintos
Un sitemap XML es una lista de URLs legible por máquinas (a menudo con lastmod). El bot la usa como pista de qué rastrear. Un mapa HTML es una página normal que enlaza secciones; útil para personas y como enlaces internos extra, pero no sustituye XML en un sitio grande.
No lo confundas con un «mapa en el footer» de diez enlaces o un diagrama visual de IA para diseño.
Quién necesita qué:
- XML — índice y crawl
- HTML — orientación humana
- ninguno arregla duplicados ni contenido fino
Por qué hace falta sitemap.xml
Secciones nuevas, nesting profundo, enlazado interno flojo — el bot puede tardar en llegar a una URL. Un sitemap acelera el discovery. En un brochure de cinco páginas el efecto es menor que en un catálogo de miles.
Un sitemap no garantiza indexación: lo bloqueado por robots, noindex, soft 404s y duplicados sigue filtrándose.
Especialmente útil si:
- hay muchas landings y fichas de producto
- publicas URLs nuevas a menudo
- media/docs viven en URLs aparte
- algunas páginas están poco enlazadas desde el menú
Cómo crear un sitemap XML
En un CMS — módulo o plugin integrado (generar + auto-update). En estático/custom — genera en el deploy o un script sobre URLs canónicas. Confirma que el archivo tenga direcciones https sin cadenas de redirects.
Sitemap index: productos, blog, categorías aparte — más fácil diagnosticar errores por tipo.
Mini requisitos para URLs en el mapa:
- canónica (una variante www/https)
- respuesta 200
- permitida para indexar
- sin sesiones ni UTM
- actual, no borrada
Cómo avisar a los buscadores
En `robots.txt`: una línea `Sitemap: https://example.com/sitemap.xml`. Además añade el archivo en Yandex Webmaster y Google Search Console. Tras un cambio de dominio/HTTPS, actualiza los paths.
El recrawl no es instantáneo: un sitemap es una cola, no un comando de «indexa todo mañana».
Tras publicar:
- abre el sitemap en el navegador — XML válido
- revisa informes de errores en los paneles
- cruza el conteo de URLs con lo esperado
- quita del mapa lo que cerraste al índice
Mapa HTML: cuándo tiene sentido
Para personas: un portal grande, servicios públicos, un catálogo con estructura poco clara. Haz una jerarquía legible — no una hoja de 5.000 enlaces en una página; usa secciones.
Para SEO un mapa HTML es un sustituto flojo de un menú normal y breadcrumbs. No generes un «seo-sitemap.html» aparte con anclas spam.
Práctica:
- un enlace «Sitemap» en el footer
- agrupación por sección
- solo URLs públicas importantes
Errores típicos y control
XML roto, http en un sitio https, redirects dentro del mapa, archivo obsoleto tras migración, mezclar URLs indexables y cerradas, un archivo gigante sin índice.
Trimestralmente cruza: crawler vs sitemap vs páginas en búsqueda. Un hueco es motivo para limpiar el generador.
Control:
- errores de sitemap en Search Console / tools de webmaster
- cuota de 404/301 entre URLs del mapa
- hora de la última actualización del archivo
- sin subdominio de test en producción
FAQ
¿Son lo mismo sitemap XML y HTML?
No. XML es para bots (una lista de URLs). HTML es una página de enlaces para personas. Para SEO importan más un XML correcto más el enlazado interno.
¿Es obligatorio un sitemap?
No es la única forma de descubrir URLs, pero en sitios medianos y grandes ayuda mucho a rastrear páginas nuevas y profundas.
¿Dónde debo poner el archivo?
Suele ser `/sitemap.xml` en la raíz o un índice `/sitemap_index.xml`. Apúntalo en robots.txt y en Search Console / paneles de webmaster.
¿Hacen falta priority y changefreq?
Los motores llevan tiempo apoyándose poco en ellos. Importa más una lista al día de URLs canónicas sin basura.
¿Qué no incluir?
Páginas de utilidad, carrito, duplicados de filtros, páginas noindex, URLs de test, cadenas de redirects — solo canónicos finales con 200.
¿Cómo lo actualizo?
Autogeneración del CMS/plugin o un script cuando aparecen URLs. Tras secciones grandes — reenvía en los paneles.
¿Cuántas URLs por archivo?
Límites del protocolo: unas 50k URLs o ~50 MB por archivo; más — usa un sitemap index. En la práctica parte por sección por comodidad.
¿Un sitemap sustituye al menú?
No. La navegación y los enlaces internos importan más para personas y a menudo para el crawl. XML es un complemento.
¿Sitemap con filtros y redirects dentro?
Dejamos XML canónico y limpio — sin priority mágico ni mapa HTML spam de 5.000 enlaces.
Hablar del proyecto