DomainEine Domain ist die Adresse einer Webseite im Internet, zum Beispiel chrisign.ch. Sie macht aus einer technischen Serveradresse etwas Lesbares und Merkbares. Domains werden bei einem Registrar registriert und jährlich erneuert.
Weitere Informationen
CrawlerEin Crawler ist ein automatisches Programm, das Webseiten systematisch besucht und deren Inhalte für Suchmaschinen indexiert.
Weitere Informationen
SitemapEine Sitemap ist eine Datei, die alle wichtigen Seiten einer Website auflistet und Suchmaschinen dabei hilft, diese vollständig zu indexieren.
Weitere Informationen

robots.txt

Die robots.txt ist eine einfache Textdatei im Hauptverzeichnis einer Webseite, die Suchmaschinen-Crawlern mitteilt, welche Bereiche sie besuchen dürfen und welche nicht. Sie ist eine der ersten Dateien, die der Googlebot beim Besuch einer Webseite aufruft. Eine fehlerhafte robots.txt kann dazu führen, dass Google wichtige Seiten nicht indexiert – oder gar die gesamte Webseite aus den Suchergebnissen verschwinden lässt.

  • Robots-Datei

Was ist die robots.txt?

Die robots.txt ist eine einfache Textdatei, die im Hauptverzeichnis einer Webseite liegt – immer erreichbar unter der Adresse www..ch/robots.txt. Sie richtet sich ausschliesslich an automatisierte Programme (Robots, Bots, ) und teilt ihnen mit, welche Seiten oder Verzeichnisse sie aufrufen dürfen.

Das Protokoll dahinter heisst «Robots Exclusion Protocol» und ist eine Konvention – keine technische Sperre. Seriöse wie der halten sich daran; bösartige Bots nicht. Die robots.txt ist daher kein Sicherheitsmechanismus, sondern eine Kommunikation mit gutartigen Crawlern.

Funfact

Die robots.txt existiert seit 1994 – sie gehört damit zu den ältesten Standards des Web. Erfunden wurde das Protokoll von Martijn Koster, nachdem ein früher seine Webseite so häufig besucht hatte, dass der Server abstürzte. Die Lösung war simpel: eine Textdatei, in der steht, was der tun soll. Dieses simple Konzept ist bis heute unverändert in Gebrauch.

Aufbau einer robots.txt

# Alle Crawler erlauben (Standard)
User-agent: *
Allow: /

# Bestimmte Bereiche ausschliessen
User-agent: *
Disallow: /wp-admin/
Disallow: /intern/
Disallow: /danke/

# Sitemap verlinken
Sitemap: https://www.domain.ch/sitemap.xml

Die wichtigsten Direktiven

  • User-agent: Welcher angesprochen wird –*steht für alle,Googlebotnur für Google
  • Disallow: Verzeichnis oder Seite, die der nicht besuchen soll
  • Allow: Ausnahme innerhalb eines gesperrten Bereichs – einzelne Seite erlauben
  • : Verweis auf die – hilft Google, alle Seiten zu finden
  • Crawl-delay: Pause zwischen Crawler-Anfragen in Sekunden (von Google nicht unterstützt)

Typische sinnvolle Einschränkungen

  • Danke-Seiten ausschliessen: Seiten wie «/danke/» oder «/bestellung-abgeschlossen/» sind für Suchende nicht relevant und sollten nicht in den Suchergebnissen erscheinen.
  • Interne Bereiche sperren: Passwortgeschützte oder interne Seiten sollen zwar nicht indexiert, aber oft trotzdem gecrawlt werden können – hier ist ein noindex-Tag oft besser als ein Disallow.

Ein Disallow: / sperrt die gesamte Webseite für alle . Niemand findet die Seite mehr in Google. 

robots.txt vs. noindex – was ist der Unterschied?

Die robots.txt verhindert, dass ein eine Seite besucht. Das noindex-Meta-Tag erlaubt den Besuch, aber verhindert die Aufnahme in den Suchindex. Ein wichtiger Unterschied: Eine Seite, die per robots.txt gesperrt ist, kann Google trotzdem im Index behalten – falls andere Seiten darauf verlinken. Wer eine Seite wirklich aus dem Index entfernen will, braucht ein noindex-Tag, nicht nur ein Disallow.