Saltar al contenido

Inicio · Blog · Logs del servidor y comportamiento de los crawlers

Enviar solicitud

Formato nuevo

Logs del servidor y comportamiento de los crawlers

Los logs del servidor registran quién pidió qué: personas, CDN, monitoring y bots de búsqueda. Muestran la actividad real de crawl — no solo lo que resumen los paneles de Search Console y Webmaster.

Abajo: qué mirar en access logs, cómo estimar crawl budget, encontrar URLs que desperdician y pillar errores de escaneo. Cerrar páginas del índice y una auditoría técnica completa son temas relacionados en artículos aparte.

Compartir
Telegram

Qué son los logs del servidor

Un access log es una cronología de peticiones HTTP: IP, hora, método, URL, código de estado, User-Agent, a veces referrer y tamaño de respuesta. Un error log son fallos de app/servidor; para SEO suele importar más el access.

Los crawlers dejan User-Agents característicos (Googlebot, YandexBot y otros). No toda cadena «tipo bot» es un crawler oficial: verifica IP/docs del buscador cuando haya duda.

Campos típicos:

  • fecha y hora
  • URL pedida
  • código HTTP (200, 301, 404, 500…)
  • User-Agent
  • método GET/POST

Bases del web server

Cómo abrir y parsear un log

Los archivos `.log` se ven fácil en un editor o se importan a una hoja (a menudo CSV / separados por espacios). Varios archivos diarios se unen (`cat` / merge del panel) antes de analizar un periodo.

Filtra líneas del User-Agent necesario, ordena por URL y código de estado. Tablas dinámicas: hits por URL, cuota de 404 para el bot, paths que queman más crawl budget.

Orden rápido:

  • toma un corte de semana–mes
  • filtra Googlebot / YandexBot
  • URLs con más conteo de peticiones
  • cuota de respuestas no-200
  • URLs con `?` y duplicados claros

Crawl budget y prioridades

Si el bot pega sin parar a filtros, sesiones, favicons y paginación vacía, las páginas de servicio importantes se actualizan menos. En logs eso se ve como hits frecuentes a paths «basura» y visitas raras a money pages.

Corta ruido: canonicals y URLs unificadas, cierra paths de utilidad del crawl/índice según haga falta, respuestas más rápidas, menos cadenas de redirect, linking interno sólido a prioridades.

Qué suele comer presupuesto:

  • duplicados por parámetros
  • filtros y sorts sin fin
  • enlaces rotos (404 masivos)
  • media pesada que no necesita indexarse
  • áreas admin dejadas abiertas al crawl

Excluir páginas del índice Redirects

Errores de crawl y qué arreglar

Mira 4xx/5xx para bots: enlaces internos rotos, redirects obsoletos, timeouts. Cruza con informes de crawl en Google Search Console y otras tools de webmaster — CDN y sampling pueden dejar huecos.

Crawl pesado de un catálogo con contenido vacío es señal de simplificar estructura o cerrar la sección. URLs importantes raras — refuerza linking interno y el sitemap.

Checklist tras revisar el log:

  • arreglar los 404 más frecuentes que tienen enlaces internos
  • quitar/fusionar duplicados por parámetros
  • alinear robots.txt y noindex con el goal
  • actualizar el sitemap de URLs prioritarias
  • volver a chequear un corte de log en 2–4 semanas

Auditoría SEO técnica

FAQ

¿Para qué logs si ya tengo Webmaster / Search Console?

Los paneles dan resúmenes y muestras. Los logs son el stream completo de peticiones al servidor: bots raros, media, URLs raras y códigos de estado exactos.

¿Dónde saco access.log?

En hosting / VPS: el directorio de logs del web server (a menudo `/var/log/nginx/` o el panel del hosting). El formato depende de Apache/Nginx y los ajustes.

¿Qué es crawl budget?

Un límite aproximado de atención del crawler al sitio en un periodo. Duplicados, parámetros, secciones pesadas y 4xx/5xx lo comen. El goal — que el bot visite URLs importantes con más frecuencia.

¿Puedo arreglar SEO solo con logs?

No. Los logs diagnostican el crawl. Luego — arreglos de robots/canonical/estructura, contenido y técnica. Ver los artículos de auditoría técnica y cierre de indexación.

¿Necesito un Log File Analyzer de pago?

Al empezar basta un export + Excel/Google Sheets o un script. Los analyzers aceleran volúmenes grandes; nombres y planes cambian.

¿Los crawlers gastan budget en URLs basura mientras las money pages reciben hits raros?

Parseamos access logs, limpiamos ruido de crawl y alineamos robots/sitemap con prioridades.

Hablar del proyecto