Rastreo e indexación

Qué son el rastreo y la indexación

El rastreo es el proceso por el que un buscador recorre una web siguiendo enlaces para descubrir sus páginas; la indexación es la decisión posterior de guardarlas en su índice. Son dos pasos consecutivos y ninguna página puede posicionar si falla alguno.

Un ejemplo: se publica una página nueva y Google la rastrea a los dos días, pero decide no indexarla porque repite lo que ya dice otra página del mismo sitio. Está descubierta, pero no existe en los resultados.

Qué condiciona el rastreo

Sobre todo que existan enlaces que lleven a la página. Una página a la que no apunta nada es prácticamente invisible, y por eso el enlazado interno es determinante.

También influyen el archivo robots.txt, que puede bloquear zonas enteras del sitio, el mapa del sitio en XML y la velocidad del servidor: si tarda en responder, el buscador rastrea menos páginas por visita.

Cómo comprobar la indexación en Google

La forma rápida es buscar site:tudominio.com/pagina/ en Google. Si no aparece, no está indexada.

La forma buena es Search Console. En «Inspección de URLs» se pega la dirección y el informe dice si está indexada, cuándo se rastreó por última vez y qué versión ha guardado el buscador. El informe de «Páginas» muestra además cuántas están indexadas y los motivos de las que no lo están.

Cómo solicitar la indexación en Google

Desde la misma herramienta de Inspección de URLs, con el botón «Solicitar indexación». Sirve para páginas nuevas o para pedir que se revise una que se acaba de corregir.

Tiene un límite diario y no garantiza nada: acelera la revisión, no obliga a indexar. Si la página no se indexa después de solicitarlo varias veces, el problema es de contenido o de duplicación, no de rastreo.

Cómo evitar la indexación de una página

Con la etiqueta noindex en la cabecera del documento. Es lo apropiado para páginas de gracias, resultados de búsqueda internos o zonas privadas.

Un error frecuente es intentarlo con robots.txt: bloquear el rastreo impide que el buscador lea la página, y por tanto que vea el noindex, de modo que puede acabar indexándola igualmente sin descripción. Para no indexar, se permite el rastreo y se marca noindex.

Qué conviene tener en cuenta

Que una página esté publicada no significa que esté indexada. Se comprueba en Search Console, sin coste, y es habitual encontrar decenas de páginas descubiertas y nunca indexadas.

Términos relacionados: enlazado interno, etiqueta canonical, Core Web Vitals. Vuelta al glosario completo.

Scroll al inicio