Pega la URL de tu sitemap, o solo el dominio, y este validador de sitemap XML revisa el archivo contra lo que la documentación de Google exige: un máximo de 50 MB y 50.000 URL, codificación UTF-8, el espacio de nombres exacto, URL absolutas y fechas válidas. Después hace dos cosas que casi ningún validador hace. Abre los sitemaps hijos de un índice de sitemaps y vuelve a descargar tu sitemap como 14 rastreadores distintos, de Googlebot y Bingbot a GPTBot, ClaudeBot o PerplexityBot, para que veas quién entra de verdad.
Muchas veces el hallazgo que importa no es un error de XML. Cuando pasamos el validador por el propio doctor-seo.net el 10 de octubre de 2026, todas las páginas de la muestra respondieron 200 a un navegador y al user agent de ClaudeBot, mientras que el user agent de GPTBot recibió 429 Too Many Requests en las 10 páginas de la muestra, y unos segundos después otra vez 200. El sitemap era válido. Un límite de peticiones delante de la web trataba a un rastreador de forma distinta al resto, y ningún validador de sintaxis lo habría detectado.
Qué revisa el validador de sitemap XML
El validador de sitemap XML de doctor-seo.net ejecuta unas 120 comprobaciones y nombra cada fallo como lo nombra el informe de sitemaps de Google Search Console, así que lo que veas aquí corresponde a un error que quizá ya te haya salido allí: «No se ha podido obtener», «Discrepancia de ruta», «Índices de sitemaps anidados», «Fecha no válida». Las comprobaciones se agrupan en siete bloques.
| Bloque | Qué comprueba | Ejemplo de error bloqueante |
|---|---|---|
| Descarga | Código HTTP, redirecciones, tiempo de respuesta, Content-Type, gzip y descompresión, archivo vacío, una página HTML servida en lugar de XML | La URL del sitemap devuelve 404, 403 o 5xx |
| Formato | UTF-8 (declarado y real), espacios antes de la declaración XML, DOCTYPE, XML bien formado con línea y columna, espacio de nombres exacto, prefijos sin declarar, espacios de nombres de extensiones mal escritos, etiquetas repetidas | Un error de análisis, a partir del cual Google no puede leer el resto del archivo |
| URL | <loc> ausente o vacío, URL relativas, URL de 2.048 caracteres o más, caracteres sin codificar, fragmentos #, parámetros de seguimiento, discrepancias de www y de http/https, URL fuera de la carpeta del sitemap, duplicados |
URL en otro host («URL no permitida») |
| lastmod | Cobertura, formato W3C Datetime, fechas reales del calendario, fechas futuras, la misma fecha en todas las URL, fechas que coinciden con el momento de la petición | Una fecha con formato incorrecto («Fecha no válida») |
| Índice de sitemaps | URL de hijos incompletas, hijos en otro host o fuera de la carpeta del índice, índices anidados, hijos que no cargan o redirigen | Un índice que enlaza a otro índice |
| Extensiones | Entradas de imagen, vídeo, noticias y hreflang: etiquetas obligatorias, límites, etiquetas obsoletas, códigos hreflang y enlaces de vuelta | Un vídeo sin URL de miniatura |
| Rastreo | robots.txt para el rastreador elegido (sitemap, URL de la muestra, sitemaps hijos), una prueba en vivo de hasta 10 URL del sitemap (código, redirección, noindex, canonical) y la tabla de acceso por rastreador | Una regla Disallow que afecta a la URL del sitemap |
También puedes pegar el XML directamente, hasta 5 MB, para revisar un sitemap que aún no está publicado. Si añades la URL donde va a vivir, se ejecutan además las comprobaciones de host y de carpeta.
Cómo leer el resultado
El validador clasifica los hallazgos en cuatro niveles, y solo el primero es motivo para que Google Search Console rechace un sitemap o descarte sus URL. Los errores son lo que Search Console marca como error o lo que impide a Google usar las URL: un sitemap que devuelve 404, XML roto, un espacio de nombres incorrecto, una fecha no válida. Las advertencias dejan el sitemap válido pero te cuestan algo, como URL que redirigen, un sitemap que no figura en el robots.txt o URL en otro host. Las mejoras son opcionales y merecen la pena, empezando por la cobertura de lastmod. Conviene saber es información, como un archivo comprimido con gzip o el número de imágenes declaradas.
Cada hallazgo del informe muestra cuántas veces aparece, hasta cinco ejemplos de tu archivo y un enlace a la documentación de Google en la que se basa. «Copiar informe» copia el resultado completo en texto plano para un ticket, y el enlace para compartir repite la misma comprobación con el mismo rastreador.
Un veredicto verde de «Sitemap válido» significa que no hay nada bloqueante ni advertencias. No significa que Google vaya a rastrear o indexar las URL. La guía de Google lo deja claro: enviar un sitemap «es solo una pista» y no garantiza que Google lo descargue ni que lo use para rastrear las URL del sitio. Lo que ocurre después del descubrimiento lo contamos en el artículo sobre los tiempos de rastreo e indexación que Google ha hecho públicos.
Comprobar si Googlebot, Bingbot y los rastreadores de IA pueden leer tu sitemap
El menú «Rastrear como» envía cada petición con el user agent del rastreador elegido y lee el robots.txt con sus reglas. La coincidencia sigue el RFC 9309, el estándar del IETF para el protocolo de exclusión de robots: un grupo que nombra al rastreador gana al grupo *, y dentro de un grupo gana la ruta coincidente más larga. La documentación de robots.txt de Google describe la misma regla: los rastreadores aplican la regla más específica según la longitud de su ruta.
Debajo del informe principal, la tabla de acceso repite la prueba con los 14 rastreadores a la vez y compara cada uno con un navegador normal. Para cada rastreador indica si el robots.txt le permite el sitemap, las URL de la muestra y los sitemaps hijos, y qué respondió el servidor a su user agent.
| Grupo | Rastreadores de la tabla | Para qué los usa su operador |
|---|---|---|
| Buscadores | Googlebot, Bingbot, Applebot | Resultados de búsqueda web (el índice de Bing alimenta también Copilot) |
| Búsqueda con IA | OAI-SearchBot, Claude-SearchBot, PerplexityBot | El índice detrás de las respuestas de ChatGPT search, Claude y Perplexity |
| Asistentes de IA, a petición del usuario | ChatGPT-User, Claude-User, Perplexity-User | Descargar una página que el usuario le pidió leer al asistente |
| Entrenamiento de IA | GPTBot, ClaudeBot, Google-Extended, Applebot-Extended, Meta-ExternalAgent | Recopilar datos para entrenar modelos |
Google-Extended y Applebot-Extended son tokens de robots.txt, no rastreadores aparte: Google y Apple respetan la regla, pero descargan con Googlebot y Applebot. La tabla los marca así en lugar de inventarse un user agent.
El validador no te dice qué rastreadores de IA debes permitir. Bloquear o no los bots de entrenamiento o de respuesta es una decisión de negocio en la que el sector está dividido, y doctor-seo.net todavía no ha tomado postura. Lo que muestra la tabla es si lo que bloqueas es lo que querías bloquear. Ahí salen la mayoría de las sorpresas: un interruptor del CDN del tipo «bloquear bots de IA» que rechaza un user agent en el servidor mientras el robots.txt dice Allow, o una regla Disallow escrita hace años que ahora atrapa un sitemap hijo.
La advertencia: imitar a un rastreador no es ser el rastreador
Todas las peticiones de prueba salen del servidor de doctor-seo.net, no de los rangos de IP publicados por Google, Microsoft, OpenAI o Anthropic. Un cortafuegos que verifica bien a los rastreadores bloqueará la imitación y dejará pasar al rastreador real. Google documenta justo esa verificación en Verificar las solicitudes de los rastreadores de Google: una búsqueda DNS inversa o comparar la IP con la lista de direcciones que Google publica.
Por eso, un rechazo que afecta solo al user agent de Googlebot en una web grande suele ser el cortafuegos haciendo su trabajo. Confírmalo con la herramienta de inspección de URLs de Search Console, que descarga como el Googlebot real. Un rechazo que afecta a todos los rastreadores de IA y a ningún buscador suele ser una regla del CDN. Un 429, como el que recibió el user agent de GPTBot en esta web, es un límite de peticiones; si frenas a los rastreadores a propósito, el artículo sobre la documentación de Retry-After de Google explica qué dice ahora Google sobre cómo hacerlo.
Los límites de Google para sitemaps, de un vistazo
Los límites que Google pone a los sitemaps caben en una tabla, y cada fila enlaza a la página que lo establece. El validador comprueba todos.
| Límite | Valor | Fuente |
|---|---|---|
| Tamaño de un sitemap | 50 MB sin comprimir | Crear y enviar un sitemap |
| URL por sitemap | 50.000 | Crear y enviar un sitemap |
| Codificación | UTF-8 | Crear y enviar un sitemap |
| URL | Completas y absolutas | Crear y enviar un sitemap |
| Alcance | Un sitemap solo afecta a lo que cuelga de su carpeta | Crear y enviar un sitemap |
| Sitemaps por índice | 50.000 etiquetas <loc> |
Gestionar sitemaps grandes |
| Índices por sitio en Search Console | 500 | Gestionar sitemaps grandes |
| Ubicación de los sitemaps hijos | En la carpeta del índice o por debajo | Gestionar sitemaps grandes |
Longitud de una URL en <loc> |
Menos de 2.048 caracteres | Protocolo de sitemaps.org |
Imágenes por <url> |
1.000 | Sitemaps de imágenes |
| Sitemap de noticias | Artículos de los dos últimos días, hasta 1.000 etiquetas news:news |
Sitemaps de noticias |
lastmod: la única etiqueta opcional que Google lee
Google lee <lastmod> e ignora <priority> y <changefreq>. Su guía de sitemaps, actualizada por última vez el 8 de julio de 2026, lo dice en una línea: «Google ignores <priority> and <changefreq> values». La misma guía explica que Google solo usa lastmod si el valor es coherente y verificablemente correcto, por ejemplo cuando coincide con la última modificación real de la página.
Qué cuenta como cambio lo aclaró Google al anunciar el fin del endpoint de ping de sitemaps, el 26 de junio de 2023. Si el CMS cambia «an insignificant piece of text in the sidebar or footer», no hace falta tocar la fecha; pero «if you changed the primary text, added or changed structured data, or updated some links, do update the lastmod value». Es decir: texto principal, datos estructurados o enlaces, sí; pie de página, no.
Por eso el validador no se queda en «está o no está». Señala cuatro patrones que enseñan a Google a desconfiar de tus fechas:
- Todas las URL tienen el mismo lastmod. Casi seguro que el generador escribe el momento en que se creó el archivo.
- El 90% o más de las fechas cae en los 15 minutos anteriores a la comprobación. El sitemap imprime «ahora» en lugar del último cambio real de cada página.
- Fechas en el futuro. Suele ser un error de zona horaria o contenido programado.
- Un lastmod del índice más antiguo que la URL más reciente de ese sitemap hijo. El índice no se actualiza cuando cambia el hijo.
La falta de lastmod aparece como mejora, no como error. Puedes omitirlo en páginas cuya fecha real de cambio no conoces, como la portada o una categoría que solo lista otras páginas. En el resto, usa el formato W3C Datetime: 2026-10-10, o 2026-10-10T09:30:00+02:00 con zona horaria.
Sitemaps hijos: por qué el validador los abre
Un índice de sitemaps vale lo que valen los sitemaps que enumera, y un índice válido que apunta a un hijo roto pierde esas URL igualmente. Cuando revisas un índice, el validador analiza a fondo los 10 primeros sitemaps hijos y después pide el resto, hasta 200, en tandas de 25, para confirmar que cada uno responde 200 y es de verdad un sitemap. Cada fila tiene un botón «Revisar» que lanza el análisis completo de ese hijo por separado.
Los fallos que aparecen son de lo más corriente: un sitemap hijo que desapareció con una actualización del plugin y ahora redirige a la portada, un hijo atrapado por un Disallow del robots.txt pensado para otra cosa, un hijo en el host con www cuando el índice está sin www. El validador también cruza las URL de los hijos que analiza, porque la misma URL en el sitemap de entradas y en el de páginas es un fallo del generador. En una prueba de octubre de 2026 con el índice de un periódico nacional de 2.101 sitemaps hijos, el validador llegó al tope de 200 en unos 11 segundos.
Errores comunes en sitemaps y cómo corregirlos
- La línea Sitemap: del robots.txt apunta a una ubicación antigua. Corrígela. Según la documentación de robots.txt de Google, ese campo no está ligado a ningún user agent y tiene que ser una URL completa, con protocolo y host.
- Un & sin escapar en una URL. Rompe el XML en ese punto. El protocolo de sitemaps.org exige que todos los valores estén escapados como entidades, así que escribe
&. - URL que redirigen, llevan noindex o apuntan con canonical a otra URL. Incluye solo la URL final y canónica. La muestra en vivo de hasta 10 URL detecta los tres casos.
- Una línea en blanco antes de
<?xml. Search Console lo marca como «Espacio en blanco al principio». La causa habitual es una línea en blanco antes de<?phpen un archivo del tema o de un plugin. - lastmod con la hora de generación del sitemap. Escribe la fecha real de modificación de cada página o quita la etiqueta.
Lo que este validador no puede decirte
El validador de sitemap XML revisa el archivo y lo que recibe un rastreador cuando lo pide. No puede ver dentro de Google.
- Si Google ha leído tu sitemap y cuándo. Solo el informe de sitemaps de Search Console muestra la última lectura de Google y su recuento de URL descubiertas.
- Si las URL se van a indexar. Un sitemap ayuda al descubrimiento; la indexación depende de las páginas.
- Lo que ven los rastreadores reales desde sus propias IP. Lee la advertencia de más arriba.
- Todas las URL de un sitemap grande. La prueba en vivo toma una muestra de hasta 10 URL repartidas por el archivo, y los sitemaps hijos de más de 10 MB se saltan en la revisión conjunta (cada uno se puede revisar por separado).
- Los feeds en detalle. Los feeds RSS 2.0 y Atom 1.0 se reconocen como formato válido de sitemap, pero no se analizan etiqueta por etiqueta.
Resumen
- Google limita cada sitemap a 50 MB sin comprimir o 50.000 URL, y cada índice a 50.000 sitemaps.
- Google ignora priority y changefreq y solo usa lastmod cuando las fechas son coherentes y correctas.
- Actualiza lastmod cuando cambian el texto principal, los datos estructurados o los enlaces, no cuando cambia el pie de página.
- Un índice de sitemaps puede ser válido aunque uno de sus hijos esté roto; revisa también los hijos.
- Las reglas del robots.txt y las del CDN son independientes: un rastreador puede tener permiso en una y ser rechazado por la otra.
- Una prueba desde un servidor cualquiera imita el user agent de un rastreador, no su IP; confirma los problemas de Googlebot con la inspección de URLs de Search Console.
Preguntas frecuentes
¿El validador de sitemap XML es gratis?
Sí. No hace falta cuenta ni hay muro de pago. Los únicos límites son un tope de comprobaciones por conexión, para que el servidor siga disponible, y una caché de 15 minutos: si vuelves a revisar el mismo sitemap con el mismo rastreador dentro de ese plazo, ves el resultado guardado.
¿Por qué mi sitemap pasa aquí y falla en Search Console?
Normalmente porque no miran el mismo momento ni desde el mismo sitio. Search Console muestra la última lectura de Google, que puede tener días. Un «No se ha podido obtener» en Search Console con un resultado limpio aquí suele indicar que un cortafuegos o el CDN rechaza las IP reales de Google, algo que este validador no puede probar desde su propio servidor.
¿Sigo teniendo que hacer ping a Google cuando cambia el sitemap?
No. Google anunció el 26 de junio de 2023 que retiraba el endpoint de ping de sitemaps. Envía el sitemap una vez en Search Console, decláralo en el robots.txt y mantén lastmod al día.
¿Quito priority y changefreq?
No hacen daño, y la guía de Google dice que ignora ambas. Quítalas si complican el mantenimiento del archivo; déjalas si otro sistema que lee tu sitemap las usa. Lo que no tiene sentido es dedicar tiempo a ajustarlas para Google.
¿Puedo revisar un índice con cientos de sitemaps hijos?
Sí. El validador analiza a fondo los 10 primeros y comprueba el resto, hasta 200, en código y formato. Con el botón «Revisar» de cualquier fila analizas ese sitemap hijo completo.
Por dónde seguir
Esta herramienta forma parte de la sección de herramientas SEO de Doctor SEO. El método que hay detrás, cómo encajan rastreo, robots.txt e indexación, es materia del nivel de SEO técnico del curso SEO gratuito. Si algún término del informe te resulta nuevo, el glosario SEO lo define.
Fuentes
- Google Search Central, Build and submit a sitemap, actualizada el 8 de julio de 2026, consultada el 10 de octubre de 2026.
- Google Search Central, Manage your sitemaps with a sitemap index file, actualizada el 10 de diciembre de 2025, consultada el 10 de octubre de 2026.
- Google Search Central, Image sitemaps, actualizada el 10 de diciembre de 2025, consultada el 10 de octubre de 2026.
- Google Search Central, News sitemaps, actualizada el 10 de diciembre de 2025, consultada el 10 de octubre de 2026.
- Google Search Central, How Google interprets the robots.txt specification, actualizada el 31 de agosto de 2026, consultada el 10 de octubre de 2026.
- Google Crawling Infrastructure, Verify requests from Google crawlers and fetchers, actualizada el 20 de marzo de 2026, consultada el 10 de octubre de 2026.
- Blog de Google Search Central, Sitemaps ping endpoint is going away, 26 de junio de 2023; citas sobre lastmod según Search Engine Land, Barry Schwartz, 26 de junio de 2023.
- Ayuda de Search Console, Gestionar sitemaps con el informe de sitemaps (nombres de los errores), sin fecha, consultada el 10 de octubre de 2026.
- sitemaps.org, Sitemaps XML format, sin fecha, consultada el 10 de octubre de 2026.
- IETF, RFC 9309: Robots Exclusion Protocol, septiembre de 2022.
- doctor-seo.net, prueba propia sobre doctor-seo.net con la tabla de acceso por rastreador del validador, 10 de octubre de 2026 (10 URL de muestra por rastreador).