DomainLens

SEO-Tools

Robots.txt-Checker: Was Crawler abrufen dürfen

Ruft die robots.txt des eingegebenen Hosts ab, meldet, ob sie existiert und ob sie alle Crawler blockiert, und liest parallel die Robots-Direktiven auf Seitenebene.

Fügen Sie eine vollständige URL ein, um eine bestimmte Seite zu prüfen, oder eine reine Domain für die Startseite.

Was dieses Tool prüft

Alle drei werden bewusst gemeinsam geprüft. Crawl-Steuerung und Index-Steuerung sind getrennte Mechanismen, die regelmäßig verwechselt werden, und eine Direktive an einer Stelle widerspricht häufig einer Direktive an anderer Stelle.

  • Ob /robots.txt auf dem Host existiert und 200 zurückgibt statt einer HTML-Fehlerseite.
  • Ob die Wildcard-User-Agent-Gruppe die gesamte Site mit Disallow: / blockiert.
  • Die Meta-Robots-Direktive der Seite, die die Indexierung steuert und nicht das Crawling.
  • Den Antwort-Header X-Robots-Tag, der dieselbe Aufgabe für jeden Ressourcentyp übernimmt.

Das Ergebnis lesen

Eine Datei, die 500 zurückgibt, ist schlimmer als gar keine: Google kann das Crawling des gesamten Hosts pausieren, bis sie sich erholt, während ein sauberer 404 als „nichts ist blockiert“ gilt.

BefundBedeutungÜbliche Korrektur
robots.txt fehltKeine Datei, oder sie liefert kein 200Eine anlegen, schon um die Sitemap zu deklarieren
Blockiert alle CrawlerDisallow: / in der Wildcard-GruppeEntfernen — Staging-Regeln gehen oft versehentlich live
meta robots noindexDie Seite bittet darum, nicht indexiert zu werdenPrüfen, ob das beabsichtigt ist
X-Robots-Tag noindexDasselbe Signal auf ServerebeneServer- oder CDN-Konfiguration prüfen, nicht das HTML

Was eine robots.txt nicht leisten kann

robots.txt steuert den Crawl-Zugriff und sonst nichts. Sie entfernt keine Seite aus der Suche, schützt nichts vertraulich und konsolidiert keine Duplikate. Eine blockierte URL verhindert im Gegenteil, dass Google ein noindex auf ihr überhaupt sieht — deshalb bleiben Seiten mit beidem im Index hängen. Zur Wahl des richtigen Instruments siehe noindex vs. robots.txt.

Prüft der Checker einen bestimmten User-Agent?
Er liest die Wildcard-Gruppe, die für jeden Crawler ohne eigene Regeln gilt. Ein Bot mit eigener Gruppe befolgt ausschließlich diese — bot-spezifische Regeln prüfen Sie direkt in der Datei.
Warum meldet er die Datei als fehlend, obwohl ich sie öffnen kann?
Meist liefert die URL eine HTML-Seite mit Status 200 statt reinem Text, oder die Datei liegt auf www, während die Prüfung dem Host ohne www gefolgt ist. Beides bedeutet: keine nutzbare robots.txt.

Weitere Tools