SEO-Tools
Robots.txt-Checker: Was Crawler abrufen dürfen
Ruft die robots.txt des eingegebenen Hosts ab, meldet, ob sie existiert und ob sie alle Crawler blockiert, und liest parallel die Robots-Direktiven auf Seitenebene.
Was dieses Tool prüft
Alle drei werden bewusst gemeinsam geprüft. Crawl-Steuerung und Index-Steuerung sind getrennte Mechanismen, die regelmäßig verwechselt werden, und eine Direktive an einer Stelle widerspricht häufig einer Direktive an anderer Stelle.
- Ob /robots.txt auf dem Host existiert und 200 zurückgibt statt einer HTML-Fehlerseite.
- Ob die Wildcard-User-Agent-Gruppe die gesamte Site mit Disallow: / blockiert.
- Die Meta-Robots-Direktive der Seite, die die Indexierung steuert und nicht das Crawling.
- Den Antwort-Header X-Robots-Tag, der dieselbe Aufgabe für jeden Ressourcentyp übernimmt.
Das Ergebnis lesen
Eine Datei, die 500 zurückgibt, ist schlimmer als gar keine: Google kann das Crawling des gesamten Hosts pausieren, bis sie sich erholt, während ein sauberer 404 als „nichts ist blockiert“ gilt.
| Befund | Bedeutung | Übliche Korrektur |
|---|---|---|
| robots.txt fehlt | Keine Datei, oder sie liefert kein 200 | Eine anlegen, schon um die Sitemap zu deklarieren |
| Blockiert alle Crawler | Disallow: / in der Wildcard-Gruppe | Entfernen — Staging-Regeln gehen oft versehentlich live |
| meta robots noindex | Die Seite bittet darum, nicht indexiert zu werden | Prüfen, ob das beabsichtigt ist |
| X-Robots-Tag noindex | Dasselbe Signal auf Serverebene | Server- oder CDN-Konfiguration prüfen, nicht das HTML |
Was eine robots.txt nicht leisten kann
robots.txt steuert den Crawl-Zugriff und sonst nichts. Sie entfernt keine Seite aus der Suche, schützt nichts vertraulich und konsolidiert keine Duplikate. Eine blockierte URL verhindert im Gegenteil, dass Google ein noindex auf ihr überhaupt sieht — deshalb bleiben Seiten mit beidem im Index hängen. Zur Wahl des richtigen Instruments siehe noindex vs. robots.txt.
- Prüft der Checker einen bestimmten User-Agent?
- Er liest die Wildcard-Gruppe, die für jeden Crawler ohne eigene Regeln gilt. Ein Bot mit eigener Gruppe befolgt ausschließlich diese — bot-spezifische Regeln prüfen Sie direkt in der Datei.
- Warum meldet er die Datei als fehlend, obwohl ich sie öffnen kann?
- Meist liefert die URL eine HTML-Seite mit Status 200 statt reinem Text, oder die Datei liegt auf www, während die Prüfung dem Host ohne www gefolgt ist. Beides bedeutet: keine nutzbare robots.txt.
Weitere Tools
Sucht die Sitemap so, wie ein Crawler es tut — zuerst die Deklaration in der robots.txt, dann die üblichen Orte — und prüft anschließend, ob das Dokument als XML parst, und zählt die enthaltenen URLs.
Liest die von der Seite deklarierte kanonische URL und ruft diese Adresse anschließend ab, um zu bestätigen, dass sie erreichbar ist, nicht weiterleitet und kein noindex trägt — die drei Wege, auf denen ein Canonical still wirkungslos wird.
Analysiert die strukturierten Daten der eingegebenen Seite, listet die gefundenen schema.org-Typen auf und markiert Blöcke, die nicht parsen oder denen die von ihrem Typ verlangten Eigenschaften fehlen.
Folgt der eingegebenen URL über jeden Schritt und meldet den Statuscode jeder Station sowie das endgültige Ziel — genau das Detail, das der Browser verbirgt, sobald die Adresszeile zur Ruhe kommt.
Prüft jedes Signal, das darüber entscheidet, ob eine Seite in den Index darf: Statuscode, Zugriff laut robots.txt, Meta-Robots, den X-Robots-Tag-Header und das Canonical.