SEO-Tools
Sitemap-Validator: XML-Sitemap finden und prüfen
Sucht die Sitemap so, wie ein Crawler es tut — zuerst die Deklaration in der robots.txt, dann die üblichen Orte — und prüft anschließend, ob das Dokument als XML parst, und zählt die enthaltenen URLs.
Was dieser Validator prüft
Die Reihenfolge der Auffindung zählt. Die Deklaration in der robots.txt ist der einzige Ort, den ein Crawler ohne Raten erfährt — eine Sitemap, die existiert, aber nirgends deklariert ist, leistet weniger, als sie könnte.
- Ob überhaupt eine Sitemap auffindbar ist, ausgehend von der Sitemap:-Zeile in der robots.txt.
- Ob die Antwort 200 lautet und als XML statt als HTML-Seite ausgeliefert wird.
- Ob das Dokument parst und ob es ein urlset oder ein Sitemap-Index ist.
- Wie viele URLs deklariert werden, bei einem Index einschließlich der Kinddateien.
Was eine gültige Sitemap nicht garantiert
Syntaktische Gültigkeit und Nutzen sind verschiedene Eigenschaften. Eine einwandfrei geformte Datei schadet trotzdem, wenn ein Drittel ihrer URLs weiterleitet, 404 liefert oder ein noindex trägt: Sie liest sich dann als Liste von Seiten, die Sie nicht korrekt beschreiben konnten.
Nachdem diese Prüfung bestanden ist, nehmen Sie Stichproben: zwanzig URLs zufällig auswählen und bestätigen, dass jede 200 liefert, auf sich selbst kanonisch ist und indexierbar bleibt.
Häufige Fehlerbilder
Zum Format selbst, den Pflichtelementen und zum Aufteilen einer großen Datei siehe den Leitfaden zur XML-Sitemap.
| Symptom | Ursache | Korrektur |
|---|---|---|
| Nicht gefunden | Keine Deklaration und ein unüblicher Pfad | In der robots.txt deklarieren |
| Liefert HTML | Ein Soft-404 oder eine Catch-all-Route der SPA | Echtes XML mit XML-Content-Type ausliefern |
| Hinter einer Weiterleitung | Eine Host- oder Slash-Regel fängt die Datei ab | Direkt unter der deklarierten URL ausliefern |
| Parst, aber leer | Ein Index, dessen Kinddateien nie erzeugt werden | Die Kinddateien generieren |
- Sorgt eine Sitemap dafür, dass Google meine Seiten indexiert?
- Nein. Eine Sitemap ist ein Hinweis zur Auffindung. Sie hilft Google, URLs zu finden, und beeinflusst nicht, ob Google sie für indexierungswürdig hält.
- Muss die Sitemap unter /sitemap.xml liegen?
- Das ist die starke Konvention, und der Ort im Root zählt auch technisch: Eine Sitemap darf nur URLs auf Höhe ihres eigenen Verzeichnisses oder darunter auflisten.
Weitere Tools
Ruft die robots.txt des eingegebenen Hosts ab, meldet, ob sie existiert und ob sie alle Crawler blockiert, und liest parallel die Robots-Direktiven auf Seitenebene.
Liest die von der Seite deklarierte kanonische URL und ruft diese Adresse anschließend ab, um zu bestätigen, dass sie erreichbar ist, nicht weiterleitet und kein noindex trägt — die drei Wege, auf denen ein Canonical still wirkungslos wird.
Analysiert die strukturierten Daten der eingegebenen Seite, listet die gefundenen schema.org-Typen auf und markiert Blöcke, die nicht parsen oder denen die von ihrem Typ verlangten Eigenschaften fehlen.
Folgt der eingegebenen URL über jeden Schritt und meldet den Statuscode jeder Station sowie das endgültige Ziel — genau das Detail, das der Browser verbirgt, sobald die Adresszeile zur Ruhe kommt.
Prüft jedes Signal, das darüber entscheidet, ob eine Seite in den Index darf: Statuscode, Zugriff laut robots.txt, Meta-Robots, den X-Robots-Tag-Header und das Canonical.