Wie funktioniert Crawling?

Kurzantwort
Crawling bezeichnet den automatischen Abruf von Webseiten durch einen Crawler. Er startet mit bekannten URLs, lädt deren Quelltext, prüft Statuscodes, Inhalte und Robots-Anweisungen, sammelt interne Links und legt neue Adressen in einer Warteschlange ab. Langsame Server, blockierte Ressourcen und erst nach Nutzerinteraktion erzeugte Inhalte begrenzen die Erfassung.
Crawling ist die Voraussetzung dafür, dass Suchmaschinen Inhalte entdecken, verarbeiten und später indexieren können. Für Unternehmen zählt deshalb nicht nur, ob guter Content vorhanden ist. Er muss für den Googlebot technisch erreichbar, intern verlinkt und schnell abrufbar sein. Genau an dieser Stelle entstehen besonders bei Onlineshops, JavaScript-Frontends und gewachsenen Websites vermeidbare Lücken.
1. So funktioniert Crawling Schritt für Schritt
Ein Webcrawler arbeitet ähnlich wie ein Besucher, der jeden erreichbaren Link einer Website öffnet. Der Unterschied: Das Programm folgt einem festgelegten Prozess, speichert technische Signale und arbeitet gefundene Adressen systematisch ab. Google verwendet dafür den Googlebot, andere Suchmaschinen und SEO-Werkzeuge setzen eigene Crawler ein.
| Schritt | Was der Crawler macht | Warum das für SEO zählt |
|---|---|---|
| 1. Start-URLs laden | Der Crawler beginnt mit bereits bekannten URLs, Links von anderen Websites oder Adressen aus einer XML-Sitemap. | Seiten ohne interne oder externe Verlinkung werden deutlich schwerer entdeckt. |
| 2. Server anfragen | Der Crawler sendet eine HTTP-Anfrage und erhält einen Statuscode sowie die angeforderte Ressource. | Ein Statuscode 200 liefert Inhalt, 3xx führt weiter, 4xx meldet einen Abruffehler und 5xx weist auf ein Serverproblem hin. |
| 3. Quelltext lesen | HTML, Überschriften, Text, Meta-Angaben, Canonical-Tags und weitere technische Elemente werden erfasst. | Der Crawler erkennt, welchen Inhalt eine URL bereitstellt und welche Anweisungen gelten. |
| 4. Links sammeln | Gefundene interne und externe Verweise werden extrahiert. | Interne Links zeigen dem Crawler weitere Seiten und vermitteln Hinweise auf Struktur und Relevanz. |
| 5. Warteschlange bilden | Noch nicht besuchte URLs landen in einer sogenannten Crawl Queue. | Priorität, Serverkapazität und bisherige Signale beeinflussen, wann eine URL abgerufen wird. |
| 6. Ergebnisse verarbeiten | Die abgerufenen Informationen werden an nachgelagerte Systeme übergeben. | Erst danach kann eine Suchmaschine entscheiden, ob und in welcher Form die Seite indexiert wird. |
Eine XML-Sitemap unterstützt diesen Prozess, ersetzt aber keine saubere interne Verlinkung. Sie sollte nur relevante und erreichbare URLs enthalten. Einzelne Sitemap-Dateien können bei Google höchstens 50.000 URLs aufnehmen. Größere Websites benötigen mehrere Dateien und eine Sitemap-Index-Datei.
1.1 Wie funktioniert das Crawlen von Links?
Beim Crawlen liest das Programm Linkziele aus dem HTML und ergänzt noch unbekannte URLs in seiner Warteschlange. Ein Link aus der Hauptnavigation wird in der Regel schneller gefunden als eine URL, die nur über fünf Filterseiten erreichbar ist. Eine flache Website-Struktur verkürzt die Wege und verhindert, dass wichtige Leistungs-, Produkt- oder Kategorieseiten tief im Linkgraphen verschwinden.
2. Diese Signale wertet ein Crawler aus
Ein Crawler sammelt mehr als sichtbaren Text. Bereits die Serverantwort entscheidet darüber, ob die weitere Verarbeitung sinnvoll ist. Danach folgen Anweisungen im Quelltext, Inhalte, Links und Hinweise auf alternative URL-Versionen.
Crawling und Indexierung sind zwei Schritte
Eine gecrawlte Seite ist nicht automatisch indexiert. Crawling bedeutet, dass ein Bot die URL abgerufen hat. Indexierung bedeutet, dass eine Suchmaschine die verarbeiteten Informationen in ihren Suchindex aufnimmt. Weitere technische Begriffe kannst du im SEO-Lexikon nachschlagen.
Besonders widersprüchliche Signale kosten Ressourcen. Eine URL sollte nicht gleichzeitig in der Sitemap stehen und per noindex von der Indexierung ausgeschlossen werden. Solche Konstellationen schicken den Crawler zu einer Adresse, die laut Websitebetreiber gar nicht in den Index gehört.
2.1 Was bedeuten Weiterleitungen beim Crawling?
Eine Weiterleitung teilt dem Crawler mit, dass die angeforderte Ressource unter einer anderen Adresse liegt. Dauerhafte URL-Änderungen sollten mit 301 gekennzeichnet werden, zeitlich begrenzte Umleitungen mit 302. Interne Links sollten möglichst direkt auf die endgültige Zieladresse zeigen, weil jede zusätzliche Weiterleitung einen weiteren HTTP-Abruf verursacht.
3. So arbeitet der Google Crawler
Google Crawling beginnt nicht bei jeder Website von vorn. Der Googlebot kennt bereits URLs aus früheren Besuchen, Sitemaps und Links anderer Seiten. Beim nächsten Durchlauf entscheidet Google, welche Adressen erneut besucht werden und welche neu entdeckten Links in die Warteschlange kommen.

Google steuert die Besuchsfrequenz dynamisch. Häufig aktualisierte, gut verlinkte und für die Website zentrale Seiten werden meist öfter abgerufen als unveränderte Archivseiten. Das lastmod-Element einer Sitemap kann das Datum einer tatsächlichen Änderung übermitteln. Ein künstlich täglich aktualisiertes Datum hilft dagegen nicht, wenn sich der Inhalt nicht verändert hat.
3.1 Wie häufig crawlt Google eine Website?
Für die Crawl-Frequenz gibt es keinen festen Stunden- oder Tagesplan. Nachrichtenseiten können mehrmals täglich besucht werden, während unveränderte Unterseiten deutlich längere Intervalle aufweisen. Google berücksichtigt unter anderem Aktualisierungen, interne und externe Verlinkung, bisherige Änderungen sowie die Reaktionsfähigkeit des Servers.
Ein häufiger Irrtum besteht darin, jede Seite über Sitemap-Angaben als besonders wichtig markieren zu wollen. Das priority-Element beeinflusst Google-Rankings nicht direkt und wird von Google möglicherweise nicht für die Crawl-Steuerung berücksichtigt. Eine klare interne Verlinkung liefert in der Praxis das belastbarere Signal.
4. Was kann ein Webcrawler erfassen?
Ein Webcrawler kann öffentlich erreichbare URLs abrufen, technische Antworten auswerten, HTML-Inhalte lesen und Verlinkungen verfolgen. SEO-Crawler ergänzen diese Basis um Prüfungen auf fehlerhafte Statuscodes, Weiterleitungsketten, Seitentitel, Canonical-Tags, Überschriften, defekte Links, Parameter-URLs und weitere technische Auffälligkeiten.
Parameter können die Anzahl crawlbarer URLs stark erhöhen. Ein Shopfilter erzeugt beispielsweise aus einer Kategorieseite Varianten für Farbe, Größe, Sortierung und Preis. Wenn dieselben Produkte unter vielen Kombinationen erreichbar sind, verbringt der Crawler Zeit mit ähnlichen Adressen. Canonical-Tags, gezielte Robots-Regeln und begrenzte Filterkombinationen schaffen eine kontrollierbare Struktur.
4.1 Wo liegen die Grenzen eines Webcrawlers?
Ein Crawler kann nur auswerten, was er technisch abrufen und rendern kann. Inhalte hinter einem Login, nach einer Sucheingabe oder erst nach einem Klick auf einen interaktiven Filter bleiben oft unerreichbar. Das gilt auch für Informationen, die ausschließlich über komplexe Skripte, verzögert geladene Schnittstellen oder fehlerhafte JavaScript-Prozesse entstehen.
Moderne Frontends können im Browser vollständig wirken und für einen Crawler trotzdem fast leer sein. Prüfe deshalb nicht nur die sichtbare Darstellung. Kontrolliere den ausgelieferten HTML-Code und die gerenderte Version. Wichtige Texte, Links und Produktinformationen sollten ohne zwingende Nutzerinteraktion erreichbar sein.
Dieses Fehlerbild fällt bei Relaunches oft erst spät auf: Die Navigation reagiert im Browser, aber die Links besitzen keine normal crawlbaren Zieladressen. Der Crawler erreicht dann die Startseite und wenige Einstiegsseiten, während tiefer liegende Kategorien aus dem internen Linkgraphen verschwinden. Vor dem Livegang sollte deshalb jede wichtige URL über einen echten HTML-Link erreichbar sein.
Wenn du selbst prüfen möchtest, was ein technischer Crawler auf deiner Domain findet, kannst du einen Free Account anlegen:
5. Langsame Server begrenzen das Crawling
Google passt seine Abrufrate an die Belastbarkeit einer Website an. Antwortet der Server schnell und stabil, kann der Googlebot in derselben Zeit mehr URLs verarbeiten. Steigen Antwortzeiten oder 5xx-Fehler, reduziert Google die Anfragen, um den Server nicht zusätzlich zu belasten.

Der Zusammenhang wird bei technischen Analysen häufig übersehen: Ein langsamer Server bremst nicht nur Besucher. Er reduziert auch die Zahl der Seiten, die ein Crawler während eines Besuchs erfassen kann. Bei einer kleinen Unternehmenswebsite fällt das kaum auf. Bei einem Onlineshop mit vielen Kategorien, Produkten und Filter-URLs kann dadurch neuer oder aktualisierter Content später entdeckt werden.
5.1 Welche Serverprobleme bremsen den Googlebot?
Lange Antwortzeiten, wiederkehrende Timeouts und Statuscodes der 5xx-Klasse signalisieren eine eingeschränkte Erreichbarkeit. Auch Weiterleitungsketten erhöhen den Aufwand, weil jede Station eine neue Serveranfrage benötigt. Die sinnvolle Reihenfolge lautet deshalb: Serverfehler beheben, Antwortzeiten stabilisieren, interne Weiterleitungen reduzieren und erst danach Details einzelner Meta-Angaben optimieren.
Prüfe die Ladezeit nicht nur für die Startseite, sondern auch für Kategorien, Produkte und umfangreiche Ratgeber:
6. Erst Crawling prüfen, dann Content planen
Vor einer größeren Content-Produktion sollte geklärt sein, ob Google die bestehenden Seiten vollständig erreicht. Neue Texte lösen kein technisches Erfassungsproblem. Wenn interne Links fehlen, wichtige Bereiche blockiert sind oder der Server regelmäßig Fehler liefert, wächst lediglich die Zahl der URLs, die nicht zuverlässig verarbeitet werden.
Eine sinnvolle Vorprüfung beantwortet vier Fragen: Liefern relevante URLs Statuscode 200? Sind sie über interne HTML-Links erreichbar? Stimmen Sitemap, Canonical-Tags und Indexierungsanweisungen überein? Erscheinen wichtige Inhalte bereits im ausgelieferten oder gerenderten Quelltext?
Die Priorisierung richtet sich nach wirtschaftlicher Wirkung. Eine blockierte Hauptkategorie mit Nachfrage verdient mehr Aufmerksamkeit als zahlreiche alte Parameter-URLs ohne interne Links. Der kostenlose SEO-Check als Einstieg untersucht Technik, Ladezeiten, Metadaten und weitere SEO-Signale. Für Relaunches hilft zusätzlich eine SEO-Checkliste für den Website-Relaunch.
7. So gehen wir vor
Die OSG beginnt technische Optimierungen mit einem vollständigen Crawl und gleicht die Ergebnisse mit relevanten Zielseiten und organischen Daten ab. Der Technical Crawler der Performance Suite arbeitet nach demselben Grundprinzip wie ein Suchmaschinen-Crawler und prüft pro Durchlauf über 100 technische Punkte. Statuscodes, Weiterleitungen, interne Links und Entwicklungen über mehrere Crawls werden dadurch gemeinsam sichtbar.
Entscheidend ist anschließend die Reihenfolge der Umsetzung. Zuerst kommen Fehler, die wichtige Seiten unzugänglich machen oder den Server belasten. Danach folgen Struktur-, Sitemap- und Seitensignale. Du kannst dir direkt ein Crawl-Ergebnis ansehen oder im Rahmen eines individuellen SEO-Audits klären, welche technischen Maßnahmen den größten Hebel besitzen.
8. Häufige Fragen zu Webcrawlern
Wie funktioniert crawlen bei Google?
Google startet mit bekannten URLs, lädt deren Inhalte und folgt auffindbaren Links. Neue Adressen werden in einer Warteschlange gespeichert und abhängig von Relevanz, Aktualität und Serverkapazität später abgerufen.
Was kann ein Webcrawler?
Ein Webcrawler kann öffentliche Seiten abrufen, Statuscodes prüfen, HTML-Inhalte lesen, Links verfolgen und technische Anweisungen erfassen. Inhalte hinter Logins oder erst nach komplexer Nutzerinteraktion bleiben häufig unerreichbar.
Was ist der Unterschied zwischen Crawling und Indexierung?
Beim Crawling wird eine URL abgerufen und verarbeitet. Bei der Indexierung entscheidet die Suchmaschine, ob die Seite in ihren durchsuchbaren Bestand aufgenommen wird. Eine gecrawlte Seite muss deshalb nicht automatisch indexiert sein.
Wie oft crawlt Google eine Website?
Google verwendet keinen festen Zeitplan für alle Websites. Häufig aktualisierte, gut verlinkte Seiten werden meist öfter besucht. Langsame Server, wenige Änderungen und eine geringe interne Bedeutung können die Besuchsfrequenz reduzieren.
Kann die robots.txt Crawling verhindern?
Die robots.txt kann regelkonforme Crawler vom Abruf bestimmter Verzeichnisse oder URLs abhalten. Sie ist jedoch kein Schutz für vertrauliche Inhalte. Geschützte Daten gehören hinter eine technische Zugriffskontrolle.
Kann ein Crawler JavaScript lesen?
Moderne Suchmaschinen können viele JavaScript-Inhalte rendern, aber der Prozess benötigt zusätzliche Ressourcen und ist nicht bei jeder Anwendung zuverlässig. Wichtige Inhalte und Links sollten deshalb möglichst direkt im HTML oder nach einem stabilen Rendering verfügbar sein.
Wie erkenne ich, ob meine Website crawlbar ist?
Prüfe Statuscodes, robots.txt, interne Links, XML-Sitemap, Canonical-Tags und die gerenderten Inhalte. Ein technischer Crawl zeigt zusätzlich, welche Seiten erreichbar sind, wie tief sie liegen und an welchen Stellen der Crawler abbricht.
9. Crawlbarkeit als erste Priorität
Der sinnvollste nächste Schritt ist nicht automatisch ein weiterer Text. Prüfe zuerst, ob deine vorhandenen Leistungs-, Kategorie- und Produktseiten mit Statuscode 200 erreichbar, intern verlinkt und schnell abrufbar sind. Erst wenn diese Basis stimmt, kann neuer Content zuverlässig entdeckt, indexiert und organisch sichtbar werden.
Wenn du den technischen Zustand deiner Domain gemeinsam priorisieren möchtest, kannst du einen kostenlosen Potenzialcheck anfragen. Das Erstgespräch ist unverbindlich und dient der klaren Einordnung, welche technischen Themen zuerst bearbeitet werden sollten.








Keine Kommentare vorhanden