Robots.txt ist eine Textdatei im Stammverzeichnis einer Website, die Suchmaschinen-Crawlern Regeln zum Abrufen von URLs mitteilt. Sie steuert das Crawling. Für das gezielte Ausschließen einer öffentlichen HTML-Seite aus Google-Suchergebnissen ist dagegen eine Indexierungsregel wie noindex vorgesehen.
Crawling ist nicht dasselbe wie Indexierung
Beim Crawling ruft ein Suchmaschinen-Bot Inhalte ab. Bei der Indexierung verarbeitet die Suchmaschine Informationen für ihre Suche. Eine URL kann Google auch über Links auf anderen Seiten bekannt werden. Deshalb ist ein Abrufverbot kein verlässlicher Weg, eine URL aus den Suchergebnissen zu entfernen.
Vereinfachtes Beispiel
Das folgende Beispiel beschreibt eine Regel für einen fiktiven Pfad. Es ist keine Empfehlung, sie unverändert auf einer bestehenden Website einzusetzen:
User-agent: *
Disallow: /interne-suche/Die Regel weist regelbefolgende Crawler an, diesen Pfad nicht abzurufen. Sie schützt den Bereich nicht vor Menschen. Für vertrauliche Inhalte benötigen Sie einen wirksamen Zugriffsschutz.
Prüfliste vor einer Änderung
- Festlegen, ob ein Abruf verhindert oder eine Suchanzeige ausgeschlossen werden soll.
- Betroffene Pfade dokumentieren und auf unbeabsichtigte Sperren öffentlicher Seiten prüfen.
- Ressourcen erhalten, die für das Verständnis der Seite notwendig sind.
- Eine Seite mit
noindexfür Google abrufbar lassen, damit die Regel erkannt werden kann.
Typischer Fehler bei Landingpages
Eine Testseite wird gesperrt, später aber als öffentliche Kampagnenseite genutzt. Eine unverändert übernommene Sperre kann dann das Crawling wichtiger Inhalte verhindern. Notieren Sie bei jedem Launch, welche Testregeln noch bestehen.
Ist Robots.txt ein Passwortschutz?
Nein. Die Datei ersetzt keine Anmeldung oder Zugriffskontrolle. Vertrauliche Unterlagen gehören in einen geschützten Bereich.