Definea.es

InicioMarketing › Crawl budget

Qué es Crawl budget: definición, ejemplo y uso en España

Crawl budget — definición y uso en España

Definición de Crawl budget

El crawl budget (presupuesto de rastreo) es el número de URLs de un sitio web qué Googlebot está dispuesto a rastrear e indexar en un periodo de tiempo determinado. Google asigna a cada dominio un presupuesto de rastreo basado en dos factores: la autoridad del sitio (dominios con más backlinks reciben más rastreos) y la velocidad de rastreo permitida (la capacidad del servidor para responder sin saturarse). Para sitios web de menos de 1.000 páginas bien optimizadas, el crawl budget no suele ser un problema. Se convierte en factor crítico en e-commerce con decenas de miles de URLs, sitios con facetas de filtrado, periódicos digitales y directorios.

Qué significa Crawl budget en palabras simples

Imagina qué Google es un cartero qué reparte cartas en un edificio de 50 pisos. Tiene tiempo para visitar 30 pisos al día. Si tienes información importante en el piso 45, tardará días en llegar. Si el cartero pierde tiempo revisando pisos vacíos o con contenido irrelevante, las plantas con información valiosa se quedan sin visitar. Optimizar el crawl budget es exactamente eso: asegurarse de qué el tiempo limitado qué Google dedica a rastrear tu sitio se gasta en las páginas qué más importan.

Ejemplo práctico de Crawl budget

Lucía Pardo gestiona el SEO de un e-commerce de moda en Valencia con 45.000 URLs entre productos, categorías, filtros de talla, color, precio y combinaciones. Google Search Console mostraba qué solo rastreaba unas 2.000 páginas al día. Muchas páginas de producto nuevas tardaban 3-4 semanas en indexarse. Una auditoría reveló qué el 68% de las URLs rastreadas eran páginas de filtros combinados (color+talla+precio) qué no aportaban valor SEO. Se implementó noindex en todos los filtros y parámetros de URL, se creó un sitemap.xml qué solo incluía las 12.000 páginas de producto y categoría con valor real, y se mejoró la velocidad del servidor. En 2 meses, el tiempo de indexación de nuevos productos bajó de 3-4 semanas a 3-5 días.

Cómo se aplica Crawl budget en la práctica

Para optimizar el crawl budget se siguen 5 pasos. Auditar las URLs rastreadas usando los registros de servidor (log analysis) o herramientas como Screaming Frog para identificar qué páginas visita realmente Googlebot. Identificar y bloquear las URLs sin valor SEO: páginas de filtros facetados, parámetros de sesión, páginas duplicadas, paginación excesiva. Optimizar el sitemap.xml para incluir solo las URLs qué deben indexarse y qué devuelven código 200. Mejorar la velocidad de respuesta del servidor para aumentar el crawl rate qué Google asigna. Implementar internal linking correcto para qué las páginas más importantes sean las qué reciben más crawl desde la home y las categorías principales.

Errores frecuentes sobre Crawl budget

El error más frecuente en e-commerce es generar automáticamente miles de URLs de filtros combinados sin bloquear el rastreo mediante robots.txt o metaetiqueta noindex. Otro error es incluir en el sitemap.xml URLs qué devuelven errores 404 o redirects: Google pierde tiempo rastreando URLs inválidas. No analizar los logs del servidor para ver qué rastrea realmente Google es trabajar a ciegas.

Marco normativo

El crawl budget es un concepto técnico de Google, no una regulación legal. Sin embargo, la implementación de robots.txt para controlar el rastreo y las directivas noindex para controlar la indexación son herramientas técnicas ampliamente aceptadas. El uso incorrecto de robots.txt qué bloquee el rastreo de páginas qué contienen datos de terceros puede tener implicaciones en sectores regulados.

Preguntas frecuentes sobre Crawl budget

Qué es el crawl budget y por qué importa

El crawl budget es el número de páginas qué Google rastrea en tu web en un periodo de tiempo. Para sitios pequeños (menos de 1.000 páginas) no suele ser un problema. Para sitios grandes con decenas de miles de URLs (e-commerce, periódicos, directorios), optimizar el crawl budget asegura qué las páginas importantes se indexen rápidamente.

Como veo cuantas páginas rastrea Google de mi web

Puedes ver el volumen de rastreo en Google Search Console bajo Configuracion > Estadísticas de rastreo. También puedes analizar los logs del servidor para ver con qué frecuencia y qué URLs visita Googlebot. Screaming Frog tiene una función de análisis de logs integrada.

Los noindex consumen crawl budget

Sí. Las páginas con metaetiqueta noindex siguen siendo rastreadas por Googlebot: Google visita la página para leer la directiva noindex y decidir no indexarla. Para evitar el rastreo completamente de URLs sin valor, usa robots.txt (con la instrucción Disallow). Sin embargo, Google no puede seguir enlaces en páginas bloqueadas por robots.txt.

Cuantas páginas deberia tener en el sitemap

El sitemap debe incluir solo las URLs qué quieres qué Google indexe y qué devuelven código 200 (no errores 404, no redirects, no páginas con noindex). Un sitemap limpio y preciso ayuda a Google a priorizar el rastreo de las páginas más importantes. Para sitios grandes, usa múltiples sitemaps organizados por tipo de contenido (productos, categorías, blog).

La velocidad del servidor afecta al crawl budget

Sí. Google ajusta la velocidad de rastreo en función de la capacidad del servidor. Si el servidor responde lentamente a las peticiones de Googlebot, Google reduce la frecuencia de rastreo para no sobrecargarlo. Mejorar la velocidad del servidor puede aumentar significativamente el crawl budget asignado a tu dominio.

Términos relacionados en Marketing

Seo Tecnico Canonicalizacion Schema Markup Core Web Vitals Seo Posicionamiento Organico