Descubre la lista completa de todas las páginas disponibles en este sitio web

Hacer una lista de todas las páginas de un sitio web parece ser una operación simple. En la práctica, ningún método único es suficiente para garantizar una cobertura completa. Entre las páginas excluidas del enlazado interno, los contenidos generados por JavaScript y las URL ignoradas por los motores de búsqueda, el inventario exhaustivo sigue siendo un objetivo difícil de alcanzar sin cruzar varias fuentes de datos.

Páginas huérfanas y renderizado JavaScript: los puntos ciegos de un inventario de sitio

La mayoría de las guías sobre el tema recomiendan consultar el sitemap XML o lanzar un rastreo de enlaces internos. Estos dos enfoques cubren una gran parte de las URL, pero comparten un defecto: solo encuentran lo que está enlazado o declarado.

Leer también : Descubre todas las tendencias y análisis esenciales del mundo empresarial

Las páginas huérfanas (aquellas que existen en el servidor sin estar enlazadas desde ninguna otra página) escapan a cualquier rastreo basado en la navegación. Pueden representar contenidos antiguos, páginas de prueba o landing pages olvidadas después de una campaña.

El otro punto ciego se refiere a los sitios modernos que cargan su contenido a través de JavaScript. Un rastreador clásico envía una solicitud HTTP y lee el HTML bruto devuelto por el servidor. Si los enlaces o las páginas solo se muestran después de la ejecución del script en el navegador, el rastreo simple no los detecta en absoluto. Las recomendaciones recientes insisten en la necesidad de agregar un paso de renderizado en el navegador al proceso de rastreo para capturar estas URL invisibles.

Leer también : Descubre cómo elegir el coche ideal entre los modelos disponibles en 2024

Un directorio como el que enumera todas las páginas del sitio Voiloo ilustra un enfoque donde el sitemap se expone públicamente y se actualiza de forma centralizada, lo que reduce el riesgo de páginas faltantes para los visitantes.

Sitemap XML e indexación en Google: por qué la lista oficial sigue siendo incompleta

Hombre navegando el plan completo de un sitio web en una tableta en un espacio de coworking moderno

El archivo sitemap.xml se presenta a menudo como la fuente de referencia para conocer todas las URL de un sitio. Su función es señalar a los motores de búsqueda las páginas que el propietario desea que se indexen. No refleja la totalidad de lo que está en línea.

Varias situaciones crean un desajuste entre el sitemap y la realidad:

  • Las páginas pueden estar presentes en el servidor pero ausentes del sitemap, ya sea por olvido de actualización o por elección voluntaria (páginas en noindex, recursos internos).
  • Google puede decidir no indexar ciertas URL declaradas en el sitemap si las considera duplicadas, de bajo valor o técnicamente problemáticas.
  • Las URL generadas dinámicamente (filtros de búsqueda, parámetros de ordenación, versiones paginadas) pueden existir sin aparecer nunca en el sitemap ni en los resultados de búsqueda.

El sitemap sigue siendo un punto de partida útil, pero no constituye una prueba de exhaustividad. Indica lo que el webmaster declara, no lo que el sitio contiene realmente.

El operador site: en Google y sus límites

Escribir “site:mondomaine.fr” en Google muestra las páginas indexadas. Este método ofrece una visión rápida, pero el número mostrado fluctúa de una consulta a otra y no corresponde al total real de las páginas indexadas. Google no garantiza la visualización de la totalidad de su índice para un dominio dado.

Las páginas publicadas recientemente pueden tardar varios días en aparecer. Las páginas desindexadas o filtradas por el algoritmo ya no aparecen, incluso si todavía son accesibles a través de su URL directa. El operador site: mide la visibilidad en Google, no la existencia de las páginas.

Construir una lista exhaustiva de páginas: el enfoque en capas

El método más fiable para hacer un inventario completo se basa en el cruce de varias fuentes, cada una compensando las lagunas de las otras. Esta lógica de capas sucesivas es la única que permite acercarse a un resultado exhaustivo.

La primera capa consiste en recuperar el archivo robots.txt y los sitemaps declarados. El robots.txt puede revelar directorios enteros que el propietario del sitio desea ocultar a los robots, pero que existen realmente.

La segunda capa es el rastreo de enlaces internos. Una herramienta recorre cada página accesible desde la página de inicio siguiendo todos los enlaces. Este paso identifica la estructura de navegación real del sitio y todas las páginas enlazadas entre sí.

La tercera capa añade el renderizado JavaScript. En lugar de leer solo el HTML estático, el rastreador ejecuta el código JavaScript de cada página para descubrir los enlaces y contenidos cargados dinámicamente. Este paso se ha vuelto indispensable en los sitios construidos con frameworks como React, Vue o Angular.

Joven mujer explorando la lista de páginas de un sitio web en un portátil en un salón acogedor

La cuarta capa se centra en las páginas huérfanas. Para encontrarlas, es necesario comparar la lista obtenida por rastreo con otras fuentes: registros del servidor, Google Search Console, versiones antiguas del sitio a través de la Wayback Machine, o exportaciones desde el CMS.

Desduplicación y estabilidad de la lista

En los sitios de gran tamaño, el rastreo a menudo genera miles de URL que apuntan al mismo contenido con diferentes parámetros. Las experiencias destacan la necesidad de desduplicar las URL y limitar el ritmo de rastreo para obtener una lista estable y utilizable.

Sin desduplicación, una misma ficha de producto puede aparecer bajo decenas de variantes (ordenar por precio, por opiniones, por color). La lista final se inflará artificialmente y perderá toda utilidad para una auditoría o migración.

Casos de sitios vitrinas y pequeños sitios: un inventario más simple pero no sin trampas

En un sitio vitrina de unas pocas decenas de páginas, el problema parece menos agudo. El sitemap generalmente cubre la totalidad del contenido, y un rastreo rápido es suficiente para recorrer todo. Sin embargo, las trampas existen.

Las páginas creadas por extensiones (formularios de contacto, páginas de agradecimiento, páginas de política de privacidad generadas automáticamente) son frecuentemente olvidadas en los inventarios manuales. Las redirecciones rotas o las antiguas URL aún accesibles también pueden distorsionar el conteo.

Un propietario de un sitio vitrina que desea verificar su inventario ahorra tiempo al cruzar el sitemap con un rastreo, incluso básico. La comparación entre las dos listas resalta las discrepancias en unos minutos.

Ningún método garantiza por sí solo una lista perfecta. El cruce de fuentes sigue siendo el único enfoque que resiste a los puntos ciegos técnicos, sin importar el tamaño del sitio.

Descubre la lista completa de todas las páginas disponibles en este sitio web