La auditoría técnica de una web corporativa son diez comprobaciones y se hacen en este orden: acceso, versión única del dominio, canónicas, sitemap, códigos de estado, enlaces internos, capa HTML, datos estructurados, móvil y rendimiento. El orden no es decorativo. Si el primer bloque falla, los nueve siguientes miden algo que Google no va a ver. Aquí va cada comprobación con el comando que la resuelve y el criterio que decide si pasa.
Todas las comprobaciones se hacen con curl y el código fuente. Ninguna necesita una herramienta de pago, y al final está el resultado de pasarlas por nuestra propia web, con los dos fallos que encontramos haciéndolo.
Por qué el orden decide el resultado
Porque las comprobaciones dependen unas de otras y una sola de las primeras invalida el trabajo de todas las demás. Medir el tiempo de carga de una página que lleva noindex es tiempo perdido: por rápida que sea, no va a estar en el índice.
La cadena es esta: una página tiene que ser alcanzable por una URL, esa URL tiene que ser la única que sirve ese contenido, tiene que poder rastrearse, tiene que poder indexarse, y solo entonces tiene sentido discutir si su título es bueno o si su LCP baja de dos segundos y medio. Empezar por el rendimiento es el error más común de las auditorías que se hacen con una herramienta y se entregan tal cual.
Esta lista cubre la capa técnica. No cubre si el contenido resuelve la intención, si la arquitectura comercial tiene sentido o si las conversiones están bien medidas; eso está en qué incluye una auditoría SEO profesional.
Lo que necesitas tener delante antes de empezar
Tres cosas, y se consiguen en cinco minutos:
- La lista real de URLs del sitio, que normalmente es el sitemap. En una web corporativa suelen ser entre veinte y cien.
- Un terminal con
curl. Viene instalado en macOS, en Linux y en Windows 10 y 11. En PowerShell hay que escribirlo comocurl.exe, porque ahícurla secas es un alias de otro comando que no acepta estas opciones. - La lista de páginas que de verdad importan al negocio: los servicios, el contacto y la home. Una incidencia en una de ellas no vale lo mismo que la misma incidencia en una ficha de autor.
1. Acceso: robots.txt y la regla noindex
Lo primero es comprobar que el robots.txt no bloquea nada que deba estar en Google, y que ninguna página importante lleva la etiqueta noindex. Son dos cosas distintas que se confunden todo el rato.
El robots.txt controla el rastreo, no la indexación. Google lo dice con estas palabras: «no es un mecanismo para impedir que una página web aparezca en Google», y si la bloqueas ahí «la URL puede seguir apareciendo en los resultados de búsqueda, pero sin ninguna descripción» (Introducción a los archivos robots.txt, última actualización del 18 de diciembre de 2025).
De ahí sale la trampa clásica: bloquear una página en robots.txt y además ponerle noindex no la saca del índice, la deja atrapada. «Para que la regla noindex surta efecto, la página o el recurso en cuestión no debe haberse bloqueado mediante un archivo robots.txt ni ningún otro mecanismo que impida al rastreador acceder a ellos» (Bloquear la indexación de la Búsqueda con noindex, última actualización del 31 de diciembre de 2025). Si el rastreador no entra, nunca lee la orden de salir.
Cómo se comprueba:
curl -s https://tudominio.com/robots.txty leer las líneasDisallowuna a una preguntándose qué páginas reales caen dentro.curl -s https://tudominio.com/una-pagina | grep -i "robots"en cada página comercial, para ver si hay una etiqueta meta robots y qué dice.
Criterio para aprobar: ninguna página que quieras en Google está en un Disallow, ninguna página comercial lleva noindex, y no hay ninguna URL con las dos cosas a la vez. Aparte: el fichero vive en la raíz del host y Google solo lee los primeros «500 kibibytes (KiB)» (Introducción a la especificación de robots.txt, última actualización del 11 de septiembre de 2026). En una web corporativa eso nunca es un problema; en un ecommerce con reglas acumuladas durante años, a veces sí.
Cuando la página sigue sin aparecer y ninguna de estas dos cosas falla, el diagnóstico continúa en problemas de indexación y cómo detectarlos.
2. Una sola versión del dominio
Tu web tiene que ser alcanzable por una única combinación de protocolo, dominio y ruta; todas las demás variantes redirigen a ella de forma permanente. Son cuatro variantes y se prueban en cuatro comandos.
Las cuatro son: con y sin www, con http y con https, con y sin barra final, y la ruta en mayúsculas. El comando es el mismo para todas:
curl -s -o /dev/null -w "%{http_code} %{num_redirects} %{url_effective}\n" -L https://tudominio.com
Interesa la segunda cifra, el número de saltos. Google sigue «hasta 10 saltos de redirección» de forma predeterminada (Cómo afectan los códigos de estado HTTP a los rastreadores de Google, última actualización del 6 de marzo de 2026), así que dos o tres no rompen nada. Pero cada salto es tiempo que el usuario espera y una oportunidad más de que alguien deje una cadena a medias.
El tipo de redirección importa más que el número. La permanente es «un indicador importante de que la página de destino de la redirección debería procesarse»; la temporal, «una señal débil». El 308 es equivalente al 301 y el 307 al 302, según esa misma página.
Criterio para aprobar: todas las variantes acaban en la misma URL final, con un salto o dos como mucho, y todos los saltos son permanentes (301 o 308).
3. Canónicas
Cada página declara una etiqueta canónica y, en las páginas buenas, esa etiqueta apunta a sí misma. Google pide expresamente «incluir un enlace rel="canonical" en la propia página canónica» (Cómo especificar una URL canónica, última actualización del 15 de julio de 2026).
Lo que conviene tener claro al auditar es que la etiqueta no es una orden. Es «una señal clara de que la URL especificada debería convertirse en canónica», y en la misma página Google ordena los métodos por fuerza: primero las redirecciones, después la etiqueta, y en último lugar la inclusión en el sitemap, que es «una señal con poca influencia».
curl -s https://tudominio.com/una-pagina | grep -o '<link rel="canonical" href="[^"]*"'
Criterio para aprobar: una sola etiqueta por página, absoluta, dentro de la cabecera, idéntica carácter por carácter a la URL del sitemap, y que no apunte a una URL que redirige ni a una que lleva noindex. El detalle completo, con los casos raros, está en qué es una URL canónica.
4. Sitemap
El sitemap tiene que existir, estar declarado en el robots.txt, contener solo URLs que devuelven 200 y no contener ninguna que lleve noindex. En una web corporativa cabe entero en un fichero: el límite es que «los sitemaps no pueden tener un tamaño superior a 50 MB sin comprimir ni incluir más de 50.000 URLs» (Crear y enviar un sitemap, última actualización del 15 de julio de 2026).
Dos detalles que ahorran discusiones. El primero: «Google ignora los valores <priority> y <changefreq>». Si tu generador los escribe, no hacen daño, pero tampoco hacen nada, y conviene saberlo antes de pasar una tarde ajustándolos. El segundo: lastmod sí se usa, pero solo «si es coherente y verificable (por ejemplo, si se compara con la última modificación de la página)». Un lastmod que se actualiza solo porque ha cambiado el año del pie de página no aporta nada.
curl -s https://tudominio.com/sitemap.xml | grep -c "<loc>"para contar las URLs.- Comparar ese número con las páginas que crees que tiene el sitio. Si no cuadra, ya tienes trabajo.
Criterio para aprobar: el número de URLs coincide con lo que esperas, ninguna redirige, ninguna da error y las páginas legales con noindex no están dentro.
5. Códigos de estado
Cada URL de la lista tiene que devolver 200 sin pasar por ninguna redirección intermedia. Este es el bloque que más se salta y el que más sorpresas da en webs con cinco años encima.
Lo que hace Google con cada código, en sus palabras: un 200 pasa al siguiente paso, aunque «es posible que los sistemas de indexación indexen el contenido, pero este proceso no está garantizado». Todos los errores 4xx salvo el 429 se tratan igual, informando «de que no existe el contenido», y la URL sale del índice si estaba dentro. Con los 5xx, «las URLs que ya están indexadas se conservan en el índice, pero se acaban retirando».
Hay un caso que ninguna herramienta detecta sola: la página de error que devuelve 200. Si tu web enseña un «no encontrado» con código 200, Google lo marca como soft 404. Se comprueba pidiendo una ruta inventada y mirando el código, no la pantalla.
curl -s -o /dev/null -w "%{http_code}\n" https://tudominio.com/esta-pagina-no-existe-xyz
Criterio para aprobar: las URLs reales dan 200 directo y una ruta inventada da 404 de verdad.
6. Enlaces internos que no llevan a donde dicen
Ningún enlace interno debe apuntar a una URL que redirige, que da 404 o que lleva noindex. Es la comprobación que más incidencias produce por minuto invertido, porque los enlaces se escriben a mano y las URLs cambian sin avisar a quien los escribió.
El método: recoger todos los href internos de todas las páginas, quedarse con los únicos y pedir el código de cada uno. En una web corporativa son cien destinos distintos como mucho y se resuelve en un bucle de tres líneas.
curl -s https://tudominio.com/pagina | grep -oE 'href="/[^"]*"'para extraerlos, y después el mismocurlcon%{http_code}sobre cada destino.
Criterio para aprobar: todos los destinos internos devuelven 200 con cero saltos.
7. La capa HTML: title, description, un H1, lang
Cada página necesita un título único, una descripción propia, un solo H1 y el idioma declarado. Es la parte aburrida y es la que se rompe en silencio cuando alguien duplica una plantilla.
curl -s https://tudominio.com/pagina | grep -oE '<title>[^<]*</title>|<meta name="description"[^>]*>|<h1|<html[^>]*lang="[^"]*"'
Criterio para aprobar: ningún título repetido entre páginas, ninguna descripción vacía ni copiada, exactamente un H1 por página y un atributo lang correcto en la etiqueta html.
Sobre la longitud: nosotros cortamos los títulos en 60 caracteres contando el sufijo de marca que añade la plantilla, y el despliegue de esta web se bloquea si alguno se pasa. Es un criterio nuestro, no una regla publicada por Google, y lo aplicamos porque un título cortado en mitad de una palabra es un resultado peor, no una penalización.
8. Datos estructurados que se correspondan con lo que se ve
El marcado tiene que describir lo que el visitante lee en la página, ni más ni menos. La política de Google es explícita: «No marques contenido que no puedan ver los lectores de la página» y «los datos estructurados deben ser una representación fiel del contenido de las páginas en las que están» (Directrices generales sobre datos estructurados, última actualización del 16 de septiembre de 2026).
En una web corporativa esto suele reducirse a tres cosas: una Organization con los datos reales de la empresa, un BreadcrumbList que coincida con las migas visibles y, en el blog, un Article con el mismo titular y la misma fecha que se imprimen arriba. Lo que hay que buscar son valoraciones que nadie ha escrito, precios que ya no están y fechas de actualización que no se corresponden con ningún cambio.
curl -s https://tudominio.com/pagina | grep -o '"@type":"[^"]*"'para ver de un vistazo qué tipos declara cada página.
Criterio para aprobar: cada tipo declarado tiene su equivalente visible en la página, y ningún campo afirma algo que no aparece en pantalla.
9. Móvil: el mismo contenido, no una versión recortada
Google indexa la versión para móviles, así que el contenido que falte ahí es contenido que no existe. Textualmente: «Google indexa y posiciona las versiones para móviles del contenido de los sitios, rastreadas con el agente para smartphones», y «asegúrate de que tu sitio móvil incluya el mismo contenido que tu sitio para ordenadores» (Prácticas recomendadas para la indexación orientada a dispositivos móviles, última actualización del 20 de febrero de 2026).
En una web responsive moderna esto casi nunca falla por diseño, pero sí falla por acordeones y pestañas que en móvil cargan su contenido solo al pulsar. Si el texto no está en el HTML que llega, hay que comprobar si se pinta después y si el rastreador lo ve.
curl -s -A "Mozilla/5.0 (Linux; Android 13)" https://tudominio.com/pagina | wc -cy comparar con la misma petición sin ese agente.
Criterio para aprobar: el HTML servido al agente móvil contiene los mismos textos, enlaces y datos estructurados que el de escritorio.
10. Rendimiento, con su umbral y sin inventarse la consecuencia
Los tres umbrales son 2,5 segundos de LCP, 200 milisegundos de INP y 0,1 de CLS, medidos en el percentil 75 de las cargas. Están publicados así: el LCP «debe ocurrir dentro de los 2.5 segundos posteriores a que la página comienza a cargarse», las páginas «deben tener una INP de 200 milisegundos o menos» y «deben mantener un CLS de 0.1 o menos», con «el percentil 75 de las cargas de página» como umbral de medición (Métricas web esenciales, actualizada el 31 de octubre de 2024; la versión en español es una traducción y usa vocabulario latinoamericano).
Lo que no se puede prometer es una posición a cambio. Google escribe que «no existe una señal única» de experiencia de página y que «nuestros sistemas de posicionamiento usan las Core Web Vitals», sin más (Qué es la experiencia en la página, última actualización del 18 de diciembre de 2025). El desarrollo de ese matiz está en cuánto pesa de verdad la velocidad.
Criterio para aprobar: los tres umbrales en verde con datos de usuarios reales. Si el sitio no tiene tráfico suficiente para tener datos de campo, se dice y se trabaja con la medición de laboratorio, sabiendo que no es lo mismo.
Lo que salió al pasar este checklist por nuestra propia web
Los datos que siguen son una medición nuestra del 23 de septiembre de 2026 sobre el HTML servido en producción por potenciasoluciones.com, no una estadística del sector.
Lo que pasó limpio:
- Las 93 URLs del sitemap devuelven 200 sin ninguna redirección intermedia.
- Las 93 declaran una canónica y las 93 apuntan a sí mismas.
- Las 93 tienen exactamente un H1 y una meta description propia.
- Los 98 destinos internos distintos que encontramos enlazados desde esas páginas devuelven 200 directo. Cero enlaces a redirecciones y cero rotos.
- Una ruta inventada devuelve 404 de verdad, y las tres páginas legales llevan
noindex, followy están fuera del sitemap.
Y los dos fallos nuestros, los dos en el sitemap:
- Las 93 URLs llevan priority y changefreq. Son 186 etiquetas que Google ignora por su propia documentación. No hacen daño, pero son ruido heredado del generador y dan una falsa sensación de control.
- Quince de las 93 no llevan lastmod. Y no son quince cualesquiera: son la home, las siete páginas de
/seo, las dos de producto, la de desarrollo web, contacto, el índice del blog y la del autor. Es decir, las quince páginas comerciales. El blog sí lo lleva en sus 78 artículos. La consecuencia práctica es que la única parte del sitio donde el cambio de contenido es una decisión de negocio es la que no da ninguna señal de haber cambiado, y justo el día anterior habíamos reescrito varias de esas páginas.
Un tercer detalle, que no es un fallo pero sí conviene nombrar: entrar por http://potenciasoluciones.com encadena dos redirecciones 308, una para subir a HTTPS y otra para añadir el www. Las dos son permanentes y están dentro de los diez saltos que Google sigue, así que no rompe nada. Es el precio normal de tener las dos correcciones separadas.
Cómo separamos un bloqueo de un aviso
Este es el criterio que usamos, y es la parte que ninguna herramienta puede hacer por ti, porque exige saber qué páginas le dan de comer al negocio.
- Bloqueo: impide que una página comercial entre en el índice o que el usuario llegue a ella. Un
noindexen una página de servicio, un 404 en un enlace del menú, una cadena de redirecciones que no termina. Se corrige hoy. - Pérdida: la página entra, pero compite consigo misma o llega peor de lo que podría. Canónicas cruzadas, títulos duplicados, enlaces internos a versiones antiguas. Se planifica esta semana.
- Ruido: aparece en el informe, no cambia nada.
priorityychangefreqen el sitemap, un aviso de accesibilidad en un elemento decorativo, una imagen sinalten un icono. Se anota y se hace cuando toque.
La regla que aplicamos para ordenar: una incidencia en la home, en una página de servicio o en contacto sube un nivel; la misma incidencia en una ficha secundaria baja uno.
Preguntas relacionadas
¿Cada cuánto hay que repetir esta lista?
Completa, dos veces al año en una web corporativa que cambia poco. Los bloques 1, 5 y 6 —acceso, códigos de estado y enlaces internos— conviene automatizarlos y que corran en cada despliegue, porque son los que se rompen por accidente. En esta web, el despliegue se detiene si aparece un título de más de 60 caracteres, un título duplicado, una descripción ausente o demasiado larga, una página legal indexable o en el sitemap, o un enlace interno sin página destino.
¿Hace falta una herramienta de pago?
Para esta lista, no. Todo lo de arriba sale de curl y del código fuente. Una herramienta de rastreo ahorra tiempo cuando el sitio tiene miles de URLs y aporta informes cómodos de enseñar, pero en una web de entre veinte y cien páginas el cuello de botella no es rastrear: es decidir qué hallazgo importa, y eso lo decide una persona que conoce el negocio.
¿En qué se diferencia esto de una auditoría SEO completa?
En que esto es una capa. La auditoría completa añade la intención de cada URL, la arquitectura comercial, la canibalización entre páginas, el contenido, la medición de conversiones y la parte local o internacional cuando aplica, y termina en una hoja de ruta priorizada. El alcance está detallado en qué incluye una auditoría SEO profesional. Lo técnico es la condición necesaria: sin ello, el resto no se puede evaluar.
Cómo seguir
Si quieres pasar tú mismo la lista, empieza por los bloques 1 y 2: son quince minutos y son los que explican la mayoría de las desapariciones. Si prefieres que la pasemos nosotros y que el resultado venga ordenado por lo que le cuesta dinero a tu negocio, eso es exactamente lo que hacemos en una auditoría SEO, dentro de nuestro trabajo de visibilidad orgánica.
Fuentes consultadas
- Google Search Central, Introducción a los archivos robots.txt, última actualización del 18 de diciembre de 2025, consultada el 23 de septiembre de 2026. Robots.txt no impide la indexación; la URL bloqueada puede aparecer sin descripción.
- Google Search Central, Introducción a la especificación de robots.txt, última actualización del 11 de septiembre de 2026, consultada el 23 de septiembre de 2026. Límite de 500 kibibytes y ubicación en el directorio de nivel superior.
- Google Search Central, Bloquear la indexación de la Búsqueda con noindex, última actualización del 31 de diciembre de 2025, consultada el 23 de septiembre de 2026. Incompatibilidad entre el bloqueo en robots.txt y la regla
noindex. - Google Search Central, Cómo especificar una URL canónica con rel="canonical" y otros métodos, última actualización del 15 de julio de 2026, consultada el 23 de septiembre de 2026. Canónica autorreferencial y orden de fuerza de los métodos.
- Google Search Central, Crear y enviar un sitemap, última actualización del 15 de julio de 2026, consultada el 23 de septiembre de 2026. Límites de 50 MB y 50.000 URLs,
priorityychangefreqignorados, condiciones de uso delastmod. - Google Search Central, Cómo afectan los códigos de estado HTTP a los rastreadores de Google, última actualización del 6 de marzo de 2026, consultada el 23 de septiembre de 2026. Tratamiento de 200, 301, 302, 307, 308, 4xx y 5xx, el
soft 404y los diez saltos de redirección. - Google Search Central, Directrices generales sobre datos estructurados, última actualización del 16 de septiembre de 2026, consultada el 23 de septiembre de 2026. Contenido no visible y representación fiel de la página.
- Google Search Central, Prácticas recomendadas para la indexación orientada a dispositivos móviles, última actualización del 20 de febrero de 2026, consultada el 23 de septiembre de 2026. Rastreo con el agente para smartphones y equivalencia de contenido.
- Google Search Central, Qué es la experiencia en la página en los resultados de la Búsqueda de Google, última actualización del 18 de diciembre de 2025, consultada el 23 de septiembre de 2026. Ausencia de una señal única y uso de las Core Web Vitals.
- Google, Métricas web esenciales, actualizada el 31 de octubre de 2024, consultada el 23 de septiembre de 2026. Umbrales de LCP, INP y CLS y el percentil 75. La versión en español es una traducción; la inglesa declara la misma fecha.
- PotencIA Soluciones, medición propia del 23 de septiembre de 2026 con
curlsobre el HTML servido en producción porpotenciasoluciones.com: las 93 URLs del sitemap con su código de respuesta, sus saltos de redirección, su etiqueta canónica, su recuento de H1 y su meta description; los 98 destinos internos distintos enlazados desde esas páginas; las cuatro variantes de entrada al dominio; una ruta inexistente; las tres páginas legales; y el recuento de etiquetaspriority,changefreqylastmoddel sitemap.

