Formato nuevo
Logs del servidor y comportamiento de los crawlers
Los logs del servidor registran quién pidió qué: personas, CDN, monitoring y bots de búsqueda. Muestran la actividad real de crawl — no solo lo que resumen los paneles de Search Console y Webmaster.
Abajo: qué mirar en access logs, cómo estimar crawl budget, encontrar URLs que desperdician y pillar errores de escaneo. Cerrar páginas del índice y una auditoría técnica completa son temas relacionados en artículos aparte.
Qué son los logs del servidor
Un access log es una cronología de peticiones HTTP: IP, hora, método, URL, código de estado, User-Agent, a veces referrer y tamaño de respuesta. Un error log son fallos de app/servidor; para SEO suele importar más el access.
Los crawlers dejan User-Agents característicos (Googlebot, YandexBot y otros). No toda cadena «tipo bot» es un crawler oficial: verifica IP/docs del buscador cuando haya duda.
Campos típicos:
- fecha y hora
- URL pedida
- código HTTP (200, 301, 404, 500…)
- User-Agent
- método GET/POST
Cómo abrir y parsear un log
Los archivos `.log` se ven fácil en un editor o se importan a una hoja (a menudo CSV / separados por espacios). Varios archivos diarios se unen (`cat` / merge del panel) antes de analizar un periodo.
Filtra líneas del User-Agent necesario, ordena por URL y código de estado. Tablas dinámicas: hits por URL, cuota de 404 para el bot, paths que queman más crawl budget.
Orden rápido:
- toma un corte de semana–mes
- filtra Googlebot / YandexBot
- URLs con más conteo de peticiones
- cuota de respuestas no-200
- URLs con `?` y duplicados claros
Crawl budget y prioridades
Si el bot pega sin parar a filtros, sesiones, favicons y paginación vacía, las páginas de servicio importantes se actualizan menos. En logs eso se ve como hits frecuentes a paths «basura» y visitas raras a money pages.
Corta ruido: canonicals y URLs unificadas, cierra paths de utilidad del crawl/índice según haga falta, respuestas más rápidas, menos cadenas de redirect, linking interno sólido a prioridades.
Qué suele comer presupuesto:
- duplicados por parámetros
- filtros y sorts sin fin
- enlaces rotos (404 masivos)
- media pesada que no necesita indexarse
- áreas admin dejadas abiertas al crawl
Errores de crawl y qué arreglar
Mira 4xx/5xx para bots: enlaces internos rotos, redirects obsoletos, timeouts. Cruza con informes de crawl en Google Search Console y otras tools de webmaster — CDN y sampling pueden dejar huecos.
Crawl pesado de un catálogo con contenido vacío es señal de simplificar estructura o cerrar la sección. URLs importantes raras — refuerza linking interno y el sitemap.
Checklist tras revisar el log:
- arreglar los 404 más frecuentes que tienen enlaces internos
- quitar/fusionar duplicados por parámetros
- alinear robots.txt y noindex con el goal
- actualizar el sitemap de URLs prioritarias
- volver a chequear un corte de log en 2–4 semanas
FAQ
¿Para qué logs si ya tengo Webmaster / Search Console?
Los paneles dan resúmenes y muestras. Los logs son el stream completo de peticiones al servidor: bots raros, media, URLs raras y códigos de estado exactos.
¿Dónde saco access.log?
En hosting / VPS: el directorio de logs del web server (a menudo `/var/log/nginx/` o el panel del hosting). El formato depende de Apache/Nginx y los ajustes.
¿Qué es crawl budget?
Un límite aproximado de atención del crawler al sitio en un periodo. Duplicados, parámetros, secciones pesadas y 4xx/5xx lo comen. El goal — que el bot visite URLs importantes con más frecuencia.
¿Puedo arreglar SEO solo con logs?
No. Los logs diagnostican el crawl. Luego — arreglos de robots/canonical/estructura, contenido y técnica. Ver los artículos de auditoría técnica y cierre de indexación.
¿Necesito un Log File Analyzer de pago?
Al empezar basta un export + Excel/Google Sheets o un script. Los analyzers aceleran volúmenes grandes; nombres y planes cambian.
¿Los crawlers gastan budget en URLs basura mientras las money pages reciben hits raros?
Parseamos access logs, limpiamos ruido de crawl y alineamos robots/sitemap con prioridades.
Hablar del proyecto