Rastreo e indexación

Qué son el rastreo y la indexación
El rastreo es el proceso por el que un buscador recorre una web siguiendo enlaces para descubrir sus páginas; la indexación es la decisión posterior de guardarlas en su índice. Son dos pasos consecutivos y ninguna página puede posicionar si falla alguno.
Un ejemplo: se publica una página nueva y Google la rastrea a los dos días, pero decide no indexarla porque repite lo que ya dice otra página del mismo sitio. Está descubierta, pero no existe en los resultados.
Qué condiciona el rastreo
Sobre todo que existan enlaces que lleven a la página. Una página a la que no apunta nada es prácticamente invisible, y por eso el enlazado interno es determinante.
También influyen el archivo robots.txt, que puede bloquear zonas enteras del sitio, el mapa del sitio en XML y la velocidad del servidor: si tarda en responder, el buscador rastrea menos páginas por visita.
Cómo saber si mi web está indexada en Google
La forma rápida es buscar site:tudominio.com/pagina/ en Google. Si no aparece, no está indexada.
La forma buena es Search Console. En «Inspección de URLs» se pega la dirección y el informe dice si está indexada, cuándo se rastreó por última vez y qué versión ha guardado el buscador. El informe de «Páginas» muestra además cuántas están indexadas y los motivos de las que no lo están.
Cómo indexar una página web en Google
Desde la misma herramienta de Inspección de URLs, con el botón «Solicitar indexación». Sirve para páginas nuevas o para pedir que se revise una que se acaba de corregir.
Tiene un límite diario y no garantiza nada: acelera la revisión, no obliga a indexar. Si la página no se indexa después de solicitarlo varias veces, el problema es de contenido o de duplicación, no de rastreo.
Cómo evitar la indexación de una página
Con la etiqueta noindex en la cabecera del documento. Es lo apropiado para páginas de gracias, resultados de búsqueda internos o zonas privadas.
Un error frecuente es intentarlo con robots.txt: bloquear el rastreo impide que el buscador lea la página, y por tanto que vea el noindex, de modo que puede acabar indexándola igualmente sin descripción. Para no indexar, se permite el rastreo y se marca noindex.
Por qué Google no indexa mi página
Las causas habituales son pocas y se comprueban en orden: que la página esté bloqueada en el archivo robots.txt; que lleve una etiqueta noindex; que tenga una canonical apuntando a otra dirección; que no reciba ningún enlace interno; o que Google la haya rastreado y la considere de poco valor, en cuyo caso aparece en Search Console como «Detectada, actualmente sin indexar».
Ejemplo frecuente: una página nueva sin ningún enlace desde el menú ni desde otra página. Google no la encuentra porque no hay camino hasta ella, y enviarla por el inspector de URL solo resuelve el problema una vez.
Cómo controlar el rastreo y la indexación de una web
Con tres herramientas, cada una para lo suyo. El archivo robots.txt, en la raíz del dominio, dice por dónde no debe pasar el rastreador:User-agent: *
Disallow: /carrito/
Sitemap: https://ejemplo.com/sitemap_index.xml
La etiqueta noindex, en la cabecera de la página, impide que se guarde en el índice:<meta name="robots" content="noindex, follow">
Y el sitemap XML enumera las páginas que sí interesan. Un error habitual es confundir las dos primeras: bloquear una página en robots.txt no la saca del índice, porque el rastreador ya no puede entrar a leer el noindex.
Trucos y consejos sobre rastreo e indexación
Novedad práctica: Google indexa menos de lo que rastrea. Muchas páginas correctas se quedan en «Detectada, actualmente sin indexar», y eso suele ser una señal de que el contenido no aporta nada distinto, no de un fallo técnico.
Consejos: revisar el informe de indexación de Search Console una vez al mes; enlazar toda página nueva desde otra ya indexada, que funciona mejor que pedir la indexación a mano; y eliminar o unificar las páginas sin contenido propio, porque una web con doscientas páginas flojas se rastrea peor que una con veinte buenas.
Qué conviene tener en cuenta con el rastreo y la indexación
Que una página esté publicada no significa que esté indexada. Se comprueba en Search Console, sin coste, y es habitual encontrar decenas de páginas descubiertas y nunca indexadas.
Términos relacionados: enlazado interno, etiqueta canonical, Core Web Vitals. Vuelta al glosario completo.
Autora: Raquel Solsona, consultora SEO.

