Crawler
Ein Crawler ist ein automatisiertes Programm, das Webseiten systematisch besucht, ihren Inhalt liest und Links verfolgt, um weitere Seiten zu entdecken. Suchmaschinen wie Google nutzen Crawler, um das Web zu durchsuchen und Inhalte für ihren Index aufzubereiten. Ohne Crawler-Besuch kann eine Webseite nicht in den Suchergebnissen erscheinen.
- Googlebot
Was ist ein Crawler?
Ein Crawler – auch Spider oder Bot genannt – ist ein Computerprogramm, das automatisch Webseiten besucht. Es lädt den Inhalt einer Seite, liest ihn aus und folgt dabei allen gefundenen Links zu weiteren Seiten. So arbeitet sich der Crawler von Seite zu Seite vor und entdeckt kontinuierlich neue Inhalte im Web.
Googles Crawler heisst «Googlebot». Er besucht Webseiten regelmässig, liest deren Inhalte und übermittelt sie an Googles Indexierungssystem. Erst wenn eine Seite gecrawlt und indexiert wurde, kann sie in den Suchergebnissen erscheinen.
Funfact
Der Googlebot ist nicht der einzige Crawler im Netz. Schätzungsweise stammt über die Hälfte des gesamten Internetverkehrs von Bots – darunter Crawler von Bing, SEO-Tools wie Ahrefs oder Semrush, Archivierungsdienste wie die Wayback Machine und leider auch bösartige Bots. Webseitenbetreiber können im Server-Log sehen, wer ihre Seite wann besucht hat.
Was beeinflusst, wie gut eine Seite gecrawlt wird?
Nicht jede Seite wird gleich häufig oder vollständig gecrawlt. Googles Crawler hat ein begrenztes «Crawl-Budget» für jede Domain – wie viele Seiten er pro Besuch lädt. Häufig aktualisierte, verlinkte und schnell ladende Seiten werden bevorzugt gecrawlt.
Probleme wie kaputte Links, sehr langsame Ladezeiten, schlecht strukturierter Code oder Seiten, die nur über JavaScript gerendert werden, können den Crawler verlangsamen oder gänzlich daran hindern, Inhalte zu lesen.
Crawler steuern mit robots.txt und Meta-Tags
Webseitenbetreiber können dem Googlebot Anweisungen geben, welche Seiten er crawlen darf und welche nicht. Dafür gibt es zwei Hauptwerkzeuge:
robots.txt
Eine Textdatei im Wurzelverzeichnis der Webseite, die festlegt, welche Bereiche Crawler betreten dürfen – zum Beispiel interne Suchseiten oder Administrationsbereich ausschliessen.
noindex
Ein Meta-Tag im HTML-Quellcode einer einzelnen Seite, der Google anweist, diese Seite zwar zu crawlen, aber nicht in den Suchergebnissen anzuzeigen.
nofollow
Eine Anweisung an Links, die dem Crawler signalisiert, den verlinkten Seiten nicht zu folgen und keine «Linkkraft» weiterzugeben.