Füge die URL deiner Sitemap ein, oder nur die Domain, und dieser XML Sitemap Checker prüft die Datei gegen das, was die Google-Dokumentation verlangt: höchstens 50 MB und 50.000 URLs, UTF-8, exakt der richtige Namespace, absolute URLs, gültige Datumsangaben. Dazu kommen zwei Prüfungen, die kaum ein Validator macht. Er öffnet die untergeordneten Sitemaps eines Sitemap-Index, und er ruft deine Sitemap noch einmal als 14 verschiedene Crawler ab, von Googlebot und Bingbot bis GPTBot, ClaudeBot und PerplexityBot. So siehst du, wer tatsächlich reinkommt.
Der wichtigste Befund ist oft gar kein XML-Fehler. Als wir den Checker am 10. Oktober 2026 auf doctor-seo.net selbst laufen ließen, antworteten alle Seiten der Stichprobe einem Browser und dem User-Agent von ClaudeBot mit 200. Der User-Agent von GPTBot bekam dagegen 429 Too Many Requests auf allen 10 Seiten der Stichprobe und wenige Sekunden später wieder 200. Die Sitemap war gültig. Ein Rate-Limit vor der Website behandelte einen Crawler anders als die übrigen, und kein Syntax-Validator hätte das gezeigt.
Was der XML Sitemap Checker prüft
Der XML Sitemap Checker von doctor-seo.net führt rund 120 Prüfungen aus und benennt jeden Fehler so, wie ihn der Sitemap-Bericht der Google Search Console benennt. Ein Befund hier entspricht also einer Meldung, die du dort vielleicht schon gesehen hast: „Konnte nicht abgerufen werden“, „Pfad stimmt nicht überein“, „Verschachtelte Sitemap-Indexe“, „Ungültiges Datum“. Die Prüfungen gliedern sich in sieben Bereiche.
| Bereich | Was geprüft wird | Beispiel für einen blockierenden Fehler |
|---|---|---|
| Abruf | HTTP-Status, Weiterleitungen, Antwortzeit, Content-Type, gzip und Entpacken, leere Datei, eine HTML-Seite statt XML | Die Sitemap-URL liefert 404, 403 oder 5xx |
| Format | UTF-8 (deklariert und tatsächlich), Leerzeichen vor der XML-Deklaration, DOCTYPE, wohlgeformtes XML mit Zeile und Spalte, exakter Namespace, Präfixe ohne Deklaration, falsch geschriebene Namespaces der Erweiterungen, doppelte Tags | Ein Parsing-Fehler, ab dem Google den Rest der Datei nicht mehr lesen kann |
| URLs | Fehlendes oder leeres <loc>, relative URLs, URLs mit 2.048 Zeichen oder mehr, nicht kodierte Zeichen, #-Fragmente, Tracking-Parameter, www- und http/https-Abweichungen, URLs außerhalb des Sitemap-Ordners, Duplikate |
URLs auf einem anderen Host („URL nicht zulässig“) |
| lastmod | Abdeckung, W3C-Datetime-Format, echte Kalenderdaten, Daten in der Zukunft, dasselbe Datum bei allen URLs, Daten, die dem Abrufzeitpunkt entsprechen | Ein Datum im falschen Format („Ungültiges Datum“) |
| Sitemap-Index | Unvollständige URLs untergeordneter Sitemaps, Sitemaps auf einem anderen Host oder außerhalb des Index-Ordners, verschachtelte Indexe, Sitemaps, die nicht laden oder weiterleiten | Ein Index, der auf einen weiteren Index verweist |
| Erweiterungen | Bild-, Video-, News- und hreflang-Angaben: Pflicht-Tags, Grenzen, veraltete Tags, hreflang-Codes und Rückverweise | Ein Video ohne Thumbnail-URL |
| Crawling | robots.txt für den gewählten Crawler (Sitemap, URLs der Stichprobe, untergeordnete Sitemaps), ein Live-Test von bis zu 10 URLs aus der Sitemap (Status, Weiterleitung, noindex, Canonical) und die Zugriffstabelle aller Crawler | Eine Disallow-Regel, die auf die Sitemap-URL zutrifft |
Du kannst auch XML direkt einfügen, bis 5 MB, und so eine Sitemap prüfen, die noch nicht online ist. Gibst du zusätzlich die künftige URL an, laufen auch die Host- und Ordnerprüfungen.
So liest du das Ergebnis
Der Checker sortiert die Befunde in vier Stufen, und nur die erste ist ein Grund für die Google Search Console, eine Sitemap abzulehnen oder ihre URLs zu verwerfen. Fehler sind das, was die Search Console als Fehler meldet oder was Google an der Nutzung der URLs hindert: eine Sitemap mit 404, kaputtes XML, ein falscher Namespace, ein ungültiges Datum. Warnungen lassen die Sitemap gültig, kosten dich aber etwas, etwa URLs mit Weiterleitung, eine Sitemap, die in der robots.txt fehlt, oder URLs auf einem anderen Host. Verbesserungen sind optional und lohnen sich, allen voran die lastmod-Abdeckung. Gut zu wissen ist reine Information, etwa eine gzip-Datei oder die Zahl der Bildeinträge.
Jeder Befund im Bericht zeigt eine Anzahl, bis zu fünf Beispiele aus deiner Datei und einen Link auf die Google-Dokumentation, auf der er beruht. „Bericht kopieren“ kopiert das ganze Ergebnis als Text für ein Ticket, und der Teilen-Link wiederholt dieselbe Prüfung mit demselben Crawler.
Ein grünes „Gültige Sitemap“ heißt: nichts Blockierendes, keine Warnungen. Es heißt nicht, dass Google die URLs crawlt oder indexiert. Googles Anleitung sagt ausdrücklich, dass das Einreichen einer Sitemap nur ein Hinweis ist und nicht garantiert, dass Google sie herunterlädt oder für das Crawling der URLs nutzt. Was nach der Entdeckung passiert, steht in unserem Beitrag über die Crawling- und Indexierungszeiten, die Google selbst genannt hat.
Testen, ob Googlebot, Bingbot und KI-Crawler deine Sitemap abrufen können
Das Menü „Crawlen als“ schickt jede Anfrage mit dem User-Agent des gewählten Crawlers und liest die robots.txt mit dessen Regeln. Die Auswertung folgt RFC 9309, dem IETF-Standard für das Robots Exclusion Protocol: Eine Gruppe, die den Crawler namentlich nennt, schlägt die *-Gruppe, und innerhalb einer Gruppe gewinnt der längste passende Pfad. Die robots.txt-Dokumentation von Google beschreibt dieselbe Regel: Crawler wenden die spezifischste Regel an, gemessen an der Länge des Pfads.
Unter dem Hauptbericht wiederholt die Zugriffstabelle den Test für alle 14 Crawler auf einmal und vergleicht jeden mit einem normalen Browser. Für jeden Crawler zeigt sie, ob die robots.txt die Sitemap, die URLs der Stichprobe und die untergeordneten Sitemaps erlaubt und was der Server seinem User-Agent geantwortet hat.
| Gruppe | Crawler in der Tabelle | Wofür der Betreiber sie einsetzt |
|---|---|---|
| Suchmaschinen | Googlebot, Bingbot, Applebot | Websuche (der Bing-Index speist auch Copilot) |
| KI-Suche | OAI-SearchBot, Claude-SearchBot, PerplexityBot | Der Index hinter den Antworten von ChatGPT search, Claude und Perplexity |
| KI-Assistenten auf Nutzeranfrage | ChatGPT-User, Claude-User, Perplexity-User | Eine Seite abrufen, die ein Nutzer den Assistenten lesen lässt |
| KI-Training | GPTBot, ClaudeBot, Google-Extended, Applebot-Extended, Meta-ExternalAgent | Daten für das Training von Modellen sammeln |
Google-Extended und Applebot-Extended sind robots.txt-Tokens, keine eigenen Crawler: Google und Apple beachten die Regel, rufen aber mit Googlebot und Applebot ab. Die Tabelle kennzeichnet sie so, statt einen User-Agent zu erfinden.
Der Checker sagt dir nicht, welche KI-Crawler du zulassen solltest. Ob man Trainings- oder Antwort-Bots sperrt, ist eine geschäftliche Entscheidung, bei der die Branche gespalten ist, und doctor-seo.net hat dazu noch keine Position bezogen. Die Tabelle zeigt, ob das, was du sperrst, auch das ist, was du sperren wolltest. Genau dort liegen die meisten Überraschungen: ein CDN-Schalter wie „KI-Bots blockieren“, der einen User-Agent am Server abweist, während die robots.txt Allow sagt, oder eine jahrealte Disallow-Regel, die heute eine untergeordnete Sitemap trifft.
Der Vorbehalt: Imitation ist nicht der echte Crawler
Alle Testanfragen kommen vom Server von doctor-seo.net, nicht aus den veröffentlichten IP-Bereichen von Google, Microsoft, OpenAI oder Anthropic. Eine Firewall, die Crawler sauber prüft, sperrt die Imitation und lässt den echten Crawler trotzdem durch. Google beschreibt genau diese Prüfung in Anfragen von Google-Crawlern überprüfen: per Reverse-DNS-Abfrage oder durch Abgleich der IP-Adresse mit der von Google veröffentlichten Liste.
Eine Sperre, die auf einer großen Website nur den User-Agent des Googlebot trifft, ist deshalb oft eine Firewall, die ihren Job macht. Bestätige das mit der URL-Prüfung der Search Console, die als echter Googlebot abruft. Eine Sperre, die alle KI-Crawler trifft und keine Suchmaschine, ist häufiger eine CDN-Regel. Ein 429 wie das, das der User-Agent von GPTBot auf dieser Website bekam, ist ein Rate-Limit. Wenn du Crawler absichtlich bremst, erklärt unser Beitrag über Googles Dokumentation zu Retry-After, was Google dazu inzwischen sagt.
Googles Grenzen für Sitemaps auf einen Blick
Die Grenzen, die Google für Sitemaps setzt, passen in eine Tabelle, und jede Zeile verlinkt die Seite, auf der sie steht. Der Checker prüft jede davon.
| Grenze | Wert | Quelle |
|---|---|---|
| Größe einer Sitemap | 50 MB unkomprimiert | Sitemap erstellen und einreichen |
| URLs pro Sitemap | 50.000 | Sitemap erstellen und einreichen |
| Kodierung | UTF-8 | Sitemap erstellen und einreichen |
| URLs | Vollständig und absolut | Sitemap erstellen und einreichen |
| Geltungsbereich | Eine Sitemap wirkt nur auf das, was unter ihrem Ordner liegt | Sitemap erstellen und einreichen |
| Sitemaps pro Index | 50.000 <loc>-Tags |
Große Sitemaps verwalten |
| Indexdateien pro Website in der Search Console | 500 | Große Sitemaps verwalten |
| Ort der untergeordneten Sitemaps | Im Ordner des Index oder tiefer | Große Sitemaps verwalten |
Länge einer URL in <loc> |
Weniger als 2.048 Zeichen | Protokoll auf sitemaps.org |
Bilder pro <url> |
1.000 | Bild-Sitemaps |
| News-Sitemap | Artikel der letzten zwei Tage, bis zu 1.000 news:news-Tags |
News-Sitemaps |
lastmod: das einzige optionale Tag, das Google liest
Google liest <lastmod> und ignoriert <priority> und <changefreq>. Die Sitemap-Anleitung von Google, zuletzt aktualisiert am 8. Juli 2026, sagt es in einer Zeile: „Google ignores <priority> and <changefreq> values.“ Dieselbe Anleitung erklärt, dass Google lastmod nur nutzt, wenn der Wert durchgehend und nachprüfbar stimmt, etwa wenn er zur tatsächlichen letzten Änderung der Seite passt.
Was als Änderung zählt, hat Google präzisiert, als es am 26. Juni 2023 das Ende des Sitemap-Ping-Endpunkts ankündigte. Ändert das CMS nur „an insignificant piece of text in the sidebar or footer“, braucht es kein neues Datum. Aber: „if you changed the primary text, added or changed structured data, or updated some links, do update the lastmod value.“ Hauptinhalt, strukturierte Daten oder Links also ja, Footer nein.
Deshalb prüft der Checker mehr als „vorhanden oder nicht“. Er meldet vier Muster, die Google beibringen, deinen Daten zu misstrauen:
- Alle URLs haben dasselbe lastmod. Der Generator schreibt so gut wie sicher den Zeitpunkt, an dem die Datei erzeugt wurde.
- 90 % oder mehr der Daten liegen in den 15 Minuten vor der Prüfung. Die Sitemap gibt „jetzt“ aus statt der letzten echten Änderung jeder Seite.
- Daten in der Zukunft. Meist ein Zeitzonenfehler oder geplante Inhalte.
- Ein lastmod im Index, das älter ist als die jüngste URL der untergeordneten Sitemap. Der Index wird nicht aktualisiert, wenn sich die Sitemap ändert.
Fehlendes lastmod erscheint als Verbesserung, nicht als Fehler. Lass es bei Seiten weg, deren echtes Änderungsdatum du nicht kennen kannst, etwa die Startseite oder eine Kategorieseite, die nur andere Seiten auflistet. Überall sonst gilt W3C Datetime: 2026-10-10 oder, mit Zeitzone, 2026-10-10T09:30:00+02:00.
Untergeordnete Sitemaps: warum der Checker sie öffnet
Ein Sitemap-Index ist nur so gut wie die Sitemaps, die er auflistet, und ein gültiger Index, der auf eine kaputte Sitemap zeigt, verliert deren URLs trotzdem. Prüfst du einen Index, analysiert der Checker die ersten 10 untergeordneten Sitemaps vollständig, ruft dann den Rest ab, bis zu 200, in Paketen zu 25, und bestätigt, dass jede mit 200 antwortet und wirklich eine Sitemap ist. Jede Zeile hat einen Button „Prüfen“, der die vollständige Analyse für diese eine Sitemap startet.
Die Fehler, die dabei auftauchen, sind alltäglich: eine Sitemap, die ein Plugin-Update entfernt hat und die jetzt auf die Startseite weiterleitet, eine Sitemap, die eine für etwas anderes gedachte Disallow-Regel trifft, eine Sitemap auf dem www-Host, während der Index ohne www läuft. Der Checker gleicht außerdem die URLs der analysierten Sitemaps ab, denn dieselbe URL in der Beitrags- und in der Seiten-Sitemap ist ein Fehler des Generators. In einem Test im Oktober 2026 mit dem Index einer überregionalen Zeitung mit 2.101 untergeordneten Sitemaps erreichte der Checker die Grenze von 200 nach etwa 11 Sekunden.
Häufige Sitemap-Fehler und wie du sie behebst
- Die Sitemap:-Zeile in der robots.txt zeigt auf einen alten Speicherort. Korrigiere sie. Laut der robots.txt-Dokumentation von Google ist das Feld an keinen User-Agent gebunden und muss eine vollständige URL mit Protokoll und Host sein.
- Ein nicht maskiertes & in einer URL. Es bricht das XML an dieser Stelle. Das Protokoll auf sitemaps.org verlangt, dass alle Werte als Entitäten maskiert sind, also schreib
&. - URLs mit Weiterleitung, noindex oder Canonical auf eine andere URL. Trag nur die endgültige, kanonische URL ein. Die Live-Stichprobe mit bis zu 10 URLs findet alle drei Fälle.
- Eine Leerzeile vor
<?xml. Die Search Console meldet das als „Leerzeichen am Anfang“. Die übliche Ursache ist eine Leerzeile vor<?phpin einer Theme- oder Plugin-Datei. - lastmod mit dem Zeitpunkt, an dem die Sitemap erzeugt wurde. Gib das echte Änderungsdatum jeder Seite aus oder lass das Tag weg.
Was dieser Checker nicht wissen kann
Der XML Sitemap Checker prüft die Datei und das, was ein Crawler bekommt, wenn er sie anfragt. In Google hineinsehen kann er nicht.
- Ob und wann Google deine Sitemap gelesen hat. Nur der Sitemap-Bericht der Search Console zeigt Googles letzten Abruf und die Zahl der gefundenen URLs.
- Ob die URLs indexiert werden. Eine Sitemap hilft bei der Entdeckung, die Indexierung hängt von den Seiten ab.
- Was die echten Crawler von ihren eigenen IP-Adressen aus sehen. Siehe den Vorbehalt oben.
- Jede URL einer großen Sitemap. Der Live-Test nimmt bis zu 10 über die Datei verteilte URLs, und untergeordnete Sitemaps über 10 MB werden in der Gesamtprüfung übersprungen (jede lässt sich einzeln prüfen).
- Feeds im Detail. RSS-2.0- und Atom-1.0-Feeds werden als gültiges Sitemap-Format erkannt, aber nicht Tag für Tag analysiert.
Das Wichtigste in Kürze
- Google begrenzt eine Sitemap auf 50 MB unkomprimiert oder 50.000 URLs und einen Index auf 50.000 Sitemaps.
- Google ignoriert priority und changefreq und nutzt lastmod nur, wenn die Daten durchgehend stimmen.
- Aktualisiere lastmod, wenn sich Hauptinhalt, strukturierte Daten oder Links ändern, nicht wenn sich der Footer ändert.
- Ein Sitemap-Index kann gültig sein, während eine seiner untergeordneten Sitemaps kaputt ist; prüf die Unterseiten mit.
- robots.txt-Regeln und CDN-Regeln sind getrennt: Ein Crawler kann in der einen erlaubt und von der anderen abgewiesen sein.
- Ein Test von einem gewöhnlichen Server imitiert den User-Agent eines Crawlers, nicht seine IP-Adresse; bestätige Googlebot-Probleme mit der URL-Prüfung der Search Console.
Häufige Fragen
Ist der XML Sitemap Checker kostenlos?
Ja. Es gibt kein Konto und keine Bezahlschranke. Die einzigen Grenzen sind eine Höchstzahl an Prüfungen pro Verbindung, damit der Server erreichbar bleibt, und ein Cache von 15 Minuten: Prüfst du dieselbe Sitemap mit demselben Crawler in diesem Zeitraum erneut, siehst du das gespeicherte Ergebnis.
Warum besteht meine Sitemap hier, scheitert aber in der Search Console?
Meist, weil beide nicht denselben Zeitpunkt und nicht denselben Standort sehen. Die Search Console zeigt Googles letzten Abruf, und der kann Tage alt sein. Ein „Konnte nicht abgerufen werden“ in der Search Console bei sauberem Ergebnis hier bedeutet oft, dass eine Firewall oder das CDN Googles echte IP-Adressen abweist, und das kann dieser Checker von seinem eigenen Server aus nicht testen.
Muss ich Google noch anpingen, wenn sich meine Sitemap ändert?
Nein. Google hat am 26. Juni 2023 angekündigt, den Sitemap-Ping-Endpunkt abzuschalten. Reich die Sitemap einmal in der Search Console ein, trag sie in die robots.txt ein und halte lastmod aktuell.
Soll ich priority und changefreq entfernen?
Sie schaden nicht, und laut Googles Anleitung werden beide ignoriert. Entferne sie, wenn sie die Pflege der Datei erschweren; lass sie drin, wenn ein anderes System deine Sitemap liest und sie nutzt. Zeit ins Feintuning für Google zu stecken, lohnt sich nicht.
Kann ich einen Index mit Hunderten untergeordneter Sitemaps prüfen?
Ja. Der Checker analysiert die ersten 10 vollständig und prüft den Rest, bis zu 200, auf Status und Format. Mit dem Button „Prüfen“ in jeder Zeile analysierst du eine untergeordnete Sitemap komplett.
Wie es weitergeht
Dieses Tool gehört zum Tool-Bereich von Doctor SEO. Die Methode dahinter, wie Crawling, robots.txt und Indexierung zusammenspielen, behandelt das Level zu technischem SEO im kostenlosen SEO-Kurs.
Quellen
- Google Search Central, Build and submit a sitemap, zuletzt aktualisiert am 8. Juli 2026, geprüft am 10. Oktober 2026.
- Google Search Central, Manage your sitemaps with a sitemap index file, zuletzt aktualisiert am 10. Dezember 2025, geprüft am 10. Oktober 2026.
- Google Search Central, Image sitemaps, zuletzt aktualisiert am 10. Dezember 2025, geprüft am 10. Oktober 2026.
- Google Search Central, News sitemaps, zuletzt aktualisiert am 10. Dezember 2025, geprüft am 10. Oktober 2026.
- Google Search Central, How Google interprets the robots.txt specification, zuletzt aktualisiert am 31. August 2026, geprüft am 10. Oktober 2026.
- Google Crawling Infrastructure, Verify requests from Google crawlers and fetchers, zuletzt aktualisiert am 20. März 2026, geprüft am 10. Oktober 2026.
- Google Search Central Blog, Sitemaps ping endpoint is going away, 26. Juni 2023; Zitate zu lastmod nach Search Engine Land, Barry Schwartz, 26. Juni 2023.
- Search-Console-Hilfe, Sitemaps mit dem Sitemap-Bericht verwalten (Fehlerbezeichnungen), undatiert, geprüft am 10. Oktober 2026.
- sitemaps.org, Sitemaps XML format, undatiert, geprüft am 10. Oktober 2026.
- IETF, RFC 9309: Robots Exclusion Protocol, September 2022.
- doctor-seo.net, eigener Test von doctor-seo.net mit der Zugriffstabelle des Checkers, 10. Oktober 2026 (10 URLs pro Crawler in der Stichprobe).