Was ist Crawling?

Was ist Was ist Crawling??

Kurzantwort

Crawling bezeichnet das automatische Durchsuchen von Websites durch Programme wie den Googlebot. Ein Crawler folgt Links, ruft Seiten ab und sammelt deren Inhalte. Erst danach kann eine Suchmaschine entscheiden, ob sie die Seite indexiert und für passende Suchanfragen in den Suchergebnissen einordnet.

Crawling ist der erste technische Schritt auf dem Weg zu organischer SEO-Sichtbarkeit. Für kleine Websites funktioniert dieser Prozess meist ohne besondere Steuerung. Bei umfangreichen Onlineshops, Portalen und Domains mit mehreren tausend URLs bestimmen dagegen interne Links, Serverleistung und Seitenstruktur, welche Inhalte Suchmaschinen zuverlässig erreichen.

1. Was Crawling bedeutet

Der englische Begriff Crawl bedeutet wörtlich „kriechen“. Im SEO beschreibt er einen einzelnen Durchlauf, bei dem ein automatisches Programm eine Website besucht. Crawling bezeichnet den gesamten Vorgang. Suchanfragen wie „Was Crawl?“ oder „Was versteht man unter Crawl?“ zielen deshalb auf denselben Prozess: Ein Bot ruft URLs auf, liest Inhalte und folgt den darin gefundenen Links.

Ein Alltagsbild macht den Ablauf verständlicher: Stell dir eine Bibliothek vor. Der Crawler geht von Regal zu Regal, folgt Verweisen in Büchern und sammelt Informationen über neue oder veränderte Werke. Er entscheidet dabei noch nicht, welches Buch empfehlenswert ist. Er sorgt zunächst nur dafür, dass die Bibliothek weiß, welche Inhalte vorhanden sind.

Bei Google übernimmt diese Aufgabe vor allem der Googlebot. Daneben betreiben weitere Suchmaschinen und KI-Dienste eigene Crawler. Die Programme laden unter anderem HTML-Inhalte, Links, Bilder und technische Anweisungen. In unserem SEO-Lexikon für wichtige Fachbegriffe findest du ergänzende Erklärungen zu robots.txt, Canonical-Tags, Statuscodes und Indexierung.

2. Crawler einfach erklärt

Ein Crawler ist ein Programm, das mit einer bekannten URL beginnt und den dort eingebauten Links folgt. Findet es auf der Startseite beispielsweise Links zu Kategorien, Leistungen und Ratgebern, ruft es diese Ziele ebenfalls ab. Von dort entdeckt es weitere Unterseiten. So entsteht schrittweise ein technisches Abbild der Website.

Ein SEO-Crawl kann dabei unterschiedliche Informationen erfassen:

  • Welche URLs erreichbar sind und welchen HTTP-Statuscode sie ausgeben.
  • Welche Seiten intern miteinander verlinkt sind.
  • Ob Inhalte durch robots.txt oder andere Anweisungen blockiert werden.
  • Welche Seiten indexierbar sind oder ein noindex-Signal enthalten.
  • Ob Weiterleitungen, fehlerhafte Links oder sehr langsame Antworten auftreten.

Crawler-Merksatz

Crawling ist das Einsammeln von Informationen. Der Crawler bewertet noch nicht abschließend, ob eine Seite in den Suchindex gehört oder für ein Keyword weit oben erscheinen soll.

Ein Crawler kann nur verarbeiten, was technisch abrufbar oder über zusätzliche Datenquellen bekannt ist. Eine verwaiste Seite ohne interne Links wird von einem klassischen Website-Crawler kaum gefunden. In der technischen SEO wird eine solche URL als Orphan Page bezeichnet.

3. SEO-Crawl 2026: der Ablauf

Ein SEO-Crawl startet üblicherweise mit der Startseite, einer XML-Sitemap oder einer vorbereiteten URL-Liste. Der Bot sendet eine Anfrage an den Server, erhält eine Antwort und verarbeitet anschließend den Seiteninhalt. Interne Links liefern die nächsten Ziele. Der Ablauf wiederholt sich, bis keine neuen erreichbaren URLs mehr gefunden werden oder eine festgelegte Grenze erreicht ist.

Technik Crawler Performance Suite

Technische Anweisungen beeinflussen jeden Durchlauf. Die robots.txt kann den Abruf bestimmter Verzeichnisse verhindern. Ein noindex-Meta-Tag erlaubt zwar häufig das Crawling, fordert die Suchmaschine aber dazu auf, die Seite nicht in den Index aufzunehmen. Canonical-Tags weisen auf eine bevorzugte URL-Version hin. Der HTTP-Statuscode zeigt, ob die angeforderte Ressource verfügbar, weitergeleitet oder nicht auffindbar ist.

StufeAufgabeAlltagsbildErgebnis
CrawlingURLs aufrufen und Inhalte einsammelnDer Bibliothekar findet ein BuchDie Suchmaschine kennt die Seite
IndexierungInhalt prüfen und in den Suchindex aufnehmenDas Buch kommt in den KatalogDie Seite kann in Suchergebnissen erscheinen
RankingPassende Seiten für eine Suchanfrage sortierenDas geeignetste Buch wird empfohlenDie Seite erhält eine Position in der SERP

4. Crawling, Indexierung und Ranking

Crawling ist das Einsammeln, Indexierung das Aufnehmen und Ranking das Sortieren. Diese drei Stufen werden im Arbeitsalltag häufig vermischt. Eine erfolgreich gecrawlte URL ist jedoch nicht automatisch indexiert. Eine indexierte URL erhält wiederum nicht automatisch eine gut sichtbare Position.

Eine Seite kann technisch erreichbar sein und trotzdem aus dem Index bleiben, etwa wegen eines noindex-Tags, eines Canonical-Tags auf eine andere URL, sehr ähnlicher Inhalte oder fehlender Relevanz. Umgekehrt kann eine indexierte Seite für ein Keyword auf einer hinteren Ergebnisseite stehen und dadurch praktisch keinen organischen Traffic erhalten.

Der häufigste Denkfehler: Ein erfolgreicher Crawl beweist nur, dass der Bot die URL abrufen konnte. Prüfe getrennt, ob die Seite indexierbar ist, tatsächlich im Index steht und für die gewünschten Suchbegriffe rankt.

Widersprüchliche technische Signale erschweren diese Prüfung. Eine noindex-Seite gehört beispielsweise nicht in eine XML-Sitemap. Auch Weiterleitungen und 404-Seiten sollten dort nicht als reguläre Ziele aufgeführt sein. Für eine saubere Sitemap werden URLs empfohlen, die den Statuscode 200 ausgeben und indexierbar sind.

5. Wie oft Crawler Seiten besuchen

Für die Crawl-Frequenz gibt es keinen festen Zeitplan, der für jede URL gilt. Suchmaschinen besuchen manche Seiten mehrmals am Tag und andere nur in größeren Abständen. Wie oft eine URL gecrawlt wird, hängt vor allem davon ab, wie relevant, erreichbar und veränderlich sie für den Crawler wirkt.

  • Aktualisierungsfrequenz: Häufig veränderte Nachrichten-, Produkt- oder Kategorieseiten werden meist öfter geprüft als dauerhaft unveränderte Unterseiten.
  • Interne Verlinkung: Prominent und mehrfach verlinkte Seiten sind leichter erreichbar als URLs, die tief in der Struktur liegen.
  • Autorität: Etablierte Domains und häufig verlinkte Inhalte erhalten in der Regel mehr Aufmerksamkeit von Suchmaschinen.
  • Serverantwort: Schnelle und stabile Antworten ermöglichen dem Bot, mehr URLs in derselben Zeit abzurufen.
  • Website-Umfang: Je mehr URLs vorhanden sind, desto stärker muss die Suchmaschine ihre Crawling-Ressourcen verteilen.

Die Serverleistung wird häufig erst berücksichtigt, wenn der Crawl abbricht. Das ist zu spät. Ein aggressiv eingestellter Crawler kann schwache Systeme unnötig belasten. Bei technischen Crawls lässt sich deshalb ein Crawl-Delay festlegen. Ein Abstand von 300 Millisekunden entspricht rechnerisch rund 3,33 Anfragen pro Sekunde. Für viele Websites sind laut Handbuch 100 bis 300 Millisekunden ein sinnvoller Ausgangspunkt, abhängig von Server und Besucherauslastung.

Wenn du deine Website selbst untersuchen möchtest, kannst du einen Free Account mit technischer Auswertung anlegen.

Free Account anlegen

6. Verwaiste URLs bleiben unsichtbar

Bei Projektübernahmen finden wir regelmäßig dasselbe strukturelle Fehlerbild: Eine fachlich gute Leistungsseite existiert, taucht aber weder in der Navigation noch in einem Themencluster auf. Sie ist nur über ihre direkte URL erreichbar. Ein normaler Crawl, der auf der Startseite beginnt, findet sie nicht. Google erhält dadurch kaum Signale, dass diese Seite zum aktiven Angebot gehört.

Eine XML-Sitemap kann die URL bekannt machen, ersetzt aber keine interne Verlinkung. Interne Links zeigen Suchmaschinen, wie Themen zusammengehören und welche Seiten innerhalb der Domain Gewicht erhalten sollen. Eine wichtige Landingpage sollte deshalb von einer passenden Kategorie, einer Leistungsübersicht oder einem relevanten Ratgeber aus erreichbar sein.

Der erste Check ist entsprechend einfach: Erstelle eine Liste aller Seiten, mit denen du Kunden gewinnen möchtest, und prüfe für jede URL einen klickbaren Pfad von der Startseite aus. Fehlt dieser Pfad, setzt du zuerst einen sinnvollen internen Link. Erst danach lohnt es sich, über komplizierte Crawl-Budget-Modelle nachzudenken.

Gecrawlte, indexierbare URLs, die nicht in der Sitemap stehen, können auf strukturelle Lücken oder verwaiste Inhalte hinweisen. Der empfohlene Prüfweg besteht darin, die Liste der gefundenen URLs mit der Sitemap zu vergleichen und anschließend Navigation sowie interne Links zu kontrollieren.

100% datengesteuertes SEO: Unsere Datenmenge in der Performance Suite macht den Unterschied

7. Wann Crawl-Steuerung nötig wird

Für eine kleine Unternehmenswebsite mit 20 oder 50 sauber verlinkten Seiten ist Crawling selten das Kernproblem. Dort fehlen meist passende Inhalte, klare Suchintentionen oder ausreichend starke interne Verbindungen. Eine mehrwöchige Crawl-Budget-Analyse lenkt in diesem Fall von den größeren Hebeln ab.

Ab mehreren tausend URLs verändert sich die Priorität. Onlineshops erzeugen durch Filter, Sortierungen, Produktvarianten und Parameter schnell zahlreiche URL-Kombinationen. Redaktionssysteme produzieren zusätzlich Archive, Tags oder Druckversionen. Der Crawler verbringt dann Zeit mit ähnlichen oder irrelevanten Seiten, während wichtige Kategorien seltener besucht werden.

Steuerungsbedarf erkennst du an konkreten Signalen:

  • Neue wichtige Seiten werden über längere Zeit nicht gecrawlt oder indexiert.
  • Filter und Parameter erzeugen viele nahezu identische URLs.
  • Interne Links führen durch mehrere Weiterleitungen.
  • Die Sitemap enthält noindex-Seiten, Fehlerseiten oder umgeleitete URLs.
  • Wichtige Landingpages liegen tief in der Seitenstruktur oder sind verwaist.

Eine gute technische Priorisierung beginnt mit den Seiten, die Umsatz, Anfragen oder relevanten organischen Traffic erzeugen sollen. Hundert irrelevante Filter-URLs sind nicht automatisch dringlicher als eine zentrale Kategorie, die aufgrund eines falschen Canonical-Tags nicht indexierbar ist. Die geschäftliche Wirkung bestimmt die Reihenfolge.

Prüfe den technischen Zustand deiner Domain bei Bedarf direkt mit dem kostenlosen SEO-Check für Technik und Metadaten.

Mit Nutzung dieses SEO-Checks erklären Sie, dass Sie die Datenschutzerklärung zur Kenntnis genommen haben und damit einverstanden sind, dass die von Ihnen angegebenen Daten elektronisch erhoben und gespeichert werden. Ihre Daten werden dabei nur streng zweckgebunden zur Bearbeitung des SEO-Checks benutzt. Mit der Nutzung dieses SEO-Checks erklären Sie sich mit der Verarbeitung einverstanden.

8. So gehen wir vor

Die OSG verbindet Website-Crawls mit Daten aus Rankings, Google Search Console, Backlink-Zielen und beworbenen Landingpages. Dadurch werden auch wichtige URLs sichtbar, die innerhalb der Website nicht mehr verlinkt sind. Der Technik-Crawler der Performance Suite kann täglich bis zu 100.000 URLs prüfen und mehr als 100 technische Checks ausführen.

Im Projekt priorisieren wir anschließend nach Wirkung: Zuerst kommen wichtige, indexierbare Seiten mit Erreichbarkeits-, Statuscode- oder Verlinkungsproblemen. Danach folgen strukturelle Bereinigungen und weniger relevante URL-Bestände. Einen vertiefenden Einblick bietet unser Beitrag zum automatisierten SEO-Technik-Crawler. Wenn die gesamte technische Basis geprüft werden soll, ist ein individuelles SEO-Audit der passende Ausgangspunkt.

9. Häufige Fragen zum Crawling

Was bedeutet Crawling bei Google?

Crawling bedeutet, dass der Googlebot eine URL aufruft, den Inhalt liest und den enthaltenen Links folgt. Der Vorgang macht eine Seite für Google auffindbar, garantiert aber noch keine Indexierung oder sichtbare Position.

Was ist ein Crawler einfach erklärt?

Ein Crawler ist ein automatisches Programm, das Websites besucht und Links zu weiteren Seiten verfolgt. Dabei sammelt es Inhalte und technische Informationen für eine Suchmaschine oder ein Analysewerkzeug.

Was ist ein SEO-Crawl?

Ein SEO-Crawl ist eine technische Untersuchung einer Website. Dabei werden unter anderem Statuscodes, interne Links, Weiterleitungen, Indexierungsanweisungen, Canonical-Tags und Ladezeiten geprüft.

Ist eine gecrawlte Seite automatisch bei Google indexiert?

Nein. Crawling bestätigt nur, dass Google die Seite abrufen konnte. Ob sie indexiert wird, hängt zusätzlich von technischen Anweisungen, Inhalt, Qualität, Duplikaten und der Einschätzung der Suchmaschine ab.

Wie lange dauert es, bis Google eine Seite crawlt?

Das kann wenige Stunden, mehrere Tage oder länger dauern. Häufig aktualisierte, gut intern verlinkte und bereits etablierte Websites werden meist schneller besucht als neue oder schwer erreichbare Seiten.

Was ist Crawl-Budget?

Crawl-Budget bezeichnet vereinfacht die Menge an URLs, die Google innerhalb eines Zeitraums auf einer Domain abrufen kann und möchte. Relevant wird die gezielte Steuerung vor allem bei Websites mit mehreren tausend URLs.

Wie finde ich verwaiste Seiten?

Vergleiche die URLs aus Sitemap, Google Search Console, Rankings, Backlinks und Werbekampagnen mit einem normalen Website-Crawl. URLs aus diesen Quellen, die der Crawler nicht über interne Links erreicht, sind mögliche verwaiste Seiten.

Crawling solltest du nicht isoliert optimieren. Prüfe zuerst, ob alle geschäftlich wichtigen Seiten erreichbar verlinkt, technisch abrufbar und indexierbar sind. Diese einfache Kontrolle behebt bei vielen Websites mehr als eine aufwendige Crawl-Budget-Analyse.

Du möchtest wissen, welche Seiten Google erreichen kann und wo deine Website technische Lücken hat? Im kostenlosen, unverbindlichen Erstgespräch prüfen wir gemeinsam, welche Maßnahmen für deine Domain sinnvoll sind.

Kostenlosen Potenzialcheck anfragen

SEO Agentur kostenlose SEO Potentialanalyse



Weitere Inhalte


Keine Kommentare vorhanden


Du hast eine Frage oder eine Meinung zum Artikel? Teile sie mit uns!

Deine E-Mail-Adresse wird nicht veröffentlicht. Erforderliche Felder sind markiert *

*
*