robots.txt
Die robots.txt ist eine einfache Textdatei im Hauptverzeichnis einer Webseite, die Suchmaschinen-Crawlern mitteilt, welche Bereiche sie besuchen dürfen und welche nicht. Sie ist eine der ersten Dateien, die der Googlebot beim Besuch einer Webseite aufruft. Eine fehlerhafte robots.txt kann dazu führen, dass Google wichtige Seiten nicht indexiert – oder gar die gesamte Webseite aus den Suchergebnissen verschwinden lässt.
- Robots-Datei
Was ist die robots.txt?
Die robots.txt ist eine einfache Textdatei, die im Hauptverzeichnis einer Webseite liegt – immer erreichbar unter der Adresse www.domain.ch/robots.txt. Sie richtet sich ausschliesslich an automatisierte Programme (Robots, Bots, Crawler) und teilt ihnen mit, welche Seiten oder Verzeichnisse sie aufrufen dürfen.
Das Protokoll dahinter heisst «Robots Exclusion Protocol» und ist eine Konvention – keine technische Sperre. Seriöse Crawler wie der Googlebot halten sich daran; bösartige Bots nicht. Die robots.txt ist daher kein Sicherheitsmechanismus, sondern eine Kommunikation mit gutartigen Crawlern.
Funfact
Die robots.txt existiert seit 1994 – sie gehört damit zu den ältesten Standards des Web. Erfunden wurde das Protokoll von Martijn Koster, nachdem ein früher Web-Crawler seine Webseite so häufig besucht hatte, dass der Server abstürzte. Die Lösung war simpel: eine Textdatei, in der steht, was der Crawler tun soll. Dieses simple Konzept ist bis heute unverändert in Gebrauch.
Aufbau einer robots.txt
# Alle Crawler erlauben (Standard)
User-agent: *
Allow: /
# Bestimmte Bereiche ausschliessen
User-agent: *
Disallow: /wp-admin/
Disallow: /intern/
Disallow: /danke/
# Sitemap verlinken
Sitemap: https://www.domain.ch/sitemap.xmlDie wichtigsten Direktiven
- User-agent: Welcher Crawler angesprochen wird –*steht für alle,Googlebotnur für Google
- Disallow: Verzeichnis oder Seite, die der Crawler nicht besuchen soll
- Allow: Ausnahme innerhalb eines gesperrten Bereichs – einzelne Seite erlauben
- Sitemap: Verweis auf die XML-Sitemap – hilft Google, alle Seiten zu finden
- Crawl-delay: Pause zwischen Crawler-Anfragen in Sekunden (von Google nicht unterstützt)
Typische sinnvolle Einschränkungen
- Danke-Seiten ausschliessen: Seiten wie «/danke/» oder «/bestellung-abgeschlossen/» sind für Suchende nicht relevant und sollten nicht in den Suchergebnissen erscheinen.
- Interne Bereiche sperren: Passwortgeschützte oder interne Seiten sollen zwar nicht indexiert, aber oft trotzdem gecrawlt werden können – hier ist ein noindex-Tag oft besser als ein Disallow.
Ein Disallow: / sperrt die gesamte Webseite für alle Crawler. Niemand findet die Seite mehr in Google.
robots.txt vs. noindex – was ist der Unterschied?
Die robots.txt verhindert, dass ein Crawler eine Seite besucht. Das noindex-Meta-Tag erlaubt den Besuch, aber verhindert die Aufnahme in den Suchindex. Ein wichtiger Unterschied: Eine Seite, die per robots.txt gesperrt ist, kann Google trotzdem im Index behalten – falls andere Seiten darauf verlinken. Wer eine Seite wirklich aus dem Index entfernen will, braucht ein noindex-Tag, nicht nur ein Disallow.