Inicio › Marketing › Crawl budget
El crawl budget (presupuesto de rastreo) es el número de URLs de un sitio web qué Googlebot está dispuesto a rastrear e indexar en un periodo de tiempo determinado. Google asigna a cada dominio un presupuesto de rastreo basado en dos factores: la autoridad del sitio (dominios con más backlinks reciben más rastreos) y la velocidad de rastreo permitida (la capacidad del servidor para responder sin saturarse). Para sitios web de menos de 1.000 páginas bien optimizadas, el crawl budget no suele ser un problema. Se convierte en factor crítico en e-commerce con decenas de miles de URLs, sitios con facetas de filtrado, periódicos digitales y directorios.
Imagina qué Google es un cartero qué reparte cartas en un edificio de 50 pisos. Tiene tiempo para visitar 30 pisos al día. Si tienes información importante en el piso 45, tardará días en llegar. Si el cartero pierde tiempo revisando pisos vacíos o con contenido irrelevante, las plantas con información valiosa se quedan sin visitar. Optimizar el crawl budget es exactamente eso: asegurarse de qué el tiempo limitado qué Google dedica a rastrear tu sitio se gasta en las páginas qué más importan.
Lucía Pardo gestiona el SEO de un e-commerce de moda en Valencia con 45.000 URLs entre productos, categorías, filtros de talla, color, precio y combinaciones. Google Search Console mostraba qué solo rastreaba unas 2.000 páginas al día. Muchas páginas de producto nuevas tardaban 3-4 semanas en indexarse. Una auditoría reveló qué el 68% de las URLs rastreadas eran páginas de filtros combinados (color+talla+precio) qué no aportaban valor SEO. Se implementó noindex en todos los filtros y parámetros de URL, se creó un sitemap.xml qué solo incluía las 12.000 páginas de producto y categoría con valor real, y se mejoró la velocidad del servidor. En 2 meses, el tiempo de indexación de nuevos productos bajó de 3-4 semanas a 3-5 días.
Para optimizar el crawl budget se siguen 5 pasos. Auditar las URLs rastreadas usando los registros de servidor (log analysis) o herramientas como Screaming Frog para identificar qué páginas visita realmente Googlebot. Identificar y bloquear las URLs sin valor SEO: páginas de filtros facetados, parámetros de sesión, páginas duplicadas, paginación excesiva. Optimizar el sitemap.xml para incluir solo las URLs qué deben indexarse y qué devuelven código 200. Mejorar la velocidad de respuesta del servidor para aumentar el crawl rate qué Google asigna. Implementar internal linking correcto para qué las páginas más importantes sean las qué reciben más crawl desde la home y las categorías principales.
El error más frecuente en e-commerce es generar automáticamente miles de URLs de filtros combinados sin bloquear el rastreo mediante robots.txt o metaetiqueta noindex. Otro error es incluir en el sitemap.xml URLs qué devuelven errores 404 o redirects: Google pierde tiempo rastreando URLs inválidas. No analizar los logs del servidor para ver qué rastrea realmente Google es trabajar a ciegas.
El crawl budget es un concepto técnico de Google, no una regulación legal. Sin embargo, la implementación de robots.txt para controlar el rastreo y las directivas noindex para controlar la indexación son herramientas técnicas ampliamente aceptadas. El uso incorrecto de robots.txt qué bloquee el rastreo de páginas qué contienen datos de terceros puede tener implicaciones en sectores regulados.
El crawl budget es el número de páginas qué Google rastrea en tu web en un periodo de tiempo. Para sitios pequeños (menos de 1.000 páginas) no suele ser un problema. Para sitios grandes con decenas de miles de URLs (e-commerce, periódicos, directorios), optimizar el crawl budget asegura qué las páginas importantes se indexen rápidamente.
Puedes ver el volumen de rastreo en Google Search Console bajo Configuracion > Estadísticas de rastreo. También puedes analizar los logs del servidor para ver con qué frecuencia y qué URLs visita Googlebot. Screaming Frog tiene una función de análisis de logs integrada.
Sí. Las páginas con metaetiqueta noindex siguen siendo rastreadas por Googlebot: Google visita la página para leer la directiva noindex y decidir no indexarla. Para evitar el rastreo completamente de URLs sin valor, usa robots.txt (con la instrucción Disallow). Sin embargo, Google no puede seguir enlaces en páginas bloqueadas por robots.txt.
El sitemap debe incluir solo las URLs qué quieres qué Google indexe y qué devuelven código 200 (no errores 404, no redirects, no páginas con noindex). Un sitemap limpio y preciso ayuda a Google a priorizar el rastreo de las páginas más importantes. Para sitios grandes, usa múltiples sitemaps organizados por tipo de contenido (productos, categorías, blog).
Sí. Google ajusta la velocidad de rastreo en función de la capacidad del servidor. Si el servidor responde lentamente a las peticiones de Googlebot, Google reduce la frecuencia de rastreo para no sobrecargarlo. Mejorar la velocidad del servidor puede aumentar significativamente el crawl budget asignado a tu dominio.