Wie funktioniert Crawling?

Was ist Wie funktioniert Crawling??

Kurzantwort

Crawling bezeichnet den automatischen Abruf von Webseiten durch einen Crawler. Er startet mit bekannten URLs, lädt deren Quelltext, prüft Statuscodes, Inhalte und Robots-Anweisungen, sammelt interne Links und legt neue Adressen in einer Warteschlange ab. Langsame Server, blockierte Ressourcen und erst nach Nutzerinteraktion erzeugte Inhalte begrenzen die Erfassung.

Crawling ist die Voraussetzung dafür, dass Suchmaschinen Inhalte entdecken, verarbeiten und später indexieren können. Für Unternehmen zählt deshalb nicht nur, ob guter Content vorhanden ist. Er muss für den Googlebot technisch erreichbar, intern verlinkt und schnell abrufbar sein. Genau an dieser Stelle entstehen besonders bei Onlineshops, JavaScript-Frontends und gewachsenen Websites vermeidbare Lücken.

1. So funktioniert Crawling Schritt für Schritt

Ein Webcrawler arbeitet ähnlich wie ein Besucher, der jeden erreichbaren Link einer Website öffnet. Der Unterschied: Das Programm folgt einem festgelegten Prozess, speichert technische Signale und arbeitet gefundene Adressen systematisch ab. Google verwendet dafür den Googlebot, andere Suchmaschinen und SEO-Werkzeuge setzen eigene Crawler ein.

SchrittWas der Crawler machtWarum das für SEO zählt
1. Start-URLs ladenDer Crawler beginnt mit bereits bekannten URLs, Links von anderen Websites oder Adressen aus einer XML-Sitemap.Seiten ohne interne oder externe Verlinkung werden deutlich schwerer entdeckt.
2. Server anfragenDer Crawler sendet eine HTTP-Anfrage und erhält einen Statuscode sowie die angeforderte Ressource.Ein Statuscode 200 liefert Inhalt, 3xx führt weiter, 4xx meldet einen Abruffehler und 5xx weist auf ein Serverproblem hin.
3. Quelltext lesenHTML, Überschriften, Text, Meta-Angaben, Canonical-Tags und weitere technische Elemente werden erfasst.Der Crawler erkennt, welchen Inhalt eine URL bereitstellt und welche Anweisungen gelten.
4. Links sammelnGefundene interne und externe Verweise werden extrahiert.Interne Links zeigen dem Crawler weitere Seiten und vermitteln Hinweise auf Struktur und Relevanz.
5. Warteschlange bildenNoch nicht besuchte URLs landen in einer sogenannten Crawl Queue.Priorität, Serverkapazität und bisherige Signale beeinflussen, wann eine URL abgerufen wird.
6. Ergebnisse verarbeitenDie abgerufenen Informationen werden an nachgelagerte Systeme übergeben.Erst danach kann eine Suchmaschine entscheiden, ob und in welcher Form die Seite indexiert wird.

Eine XML-Sitemap unterstützt diesen Prozess, ersetzt aber keine saubere interne Verlinkung. Sie sollte nur relevante und erreichbare URLs enthalten. Einzelne Sitemap-Dateien können bei Google höchstens 50.000 URLs aufnehmen. Größere Websites benötigen mehrere Dateien und eine Sitemap-Index-Datei.

1.1 Wie funktioniert das Crawlen von Links?

Beim Crawlen liest das Programm Linkziele aus dem HTML und ergänzt noch unbekannte URLs in seiner Warteschlange. Ein Link aus der Hauptnavigation wird in der Regel schneller gefunden als eine URL, die nur über fünf Filterseiten erreichbar ist. Eine flache Website-Struktur verkürzt die Wege und verhindert, dass wichtige Leistungs-, Produkt- oder Kategorieseiten tief im Linkgraphen verschwinden.

2. Diese Signale wertet ein Crawler aus

Ein Crawler sammelt mehr als sichtbaren Text. Bereits die Serverantwort entscheidet darüber, ob die weitere Verarbeitung sinnvoll ist. Danach folgen Anweisungen im Quelltext, Inhalte, Links und Hinweise auf alternative URL-Versionen.

  • Statuscodes: 200 steht für einen erfolgreichen Abruf, 301 für eine dauerhafte Weiterleitung, 302 für eine vorübergehende Weiterleitung, 404 für eine nicht gefundene Ressource und 5xx für Serverfehler.
  • Weiterleitungen: Der Crawler prüft das Ziel und muss bei jeder Weiterleitung eine weitere Anfrage senden.
  • Robots-Anweisungen: Die robots.txt steuert den Abruf bestimmter Bereiche. Meta-Robots-Angaben können unter anderem die Indexierung oder das Folgen von Links beeinflussen.
  • Inhalte: Überschriften, Fließtext, Bilder, strukturierte Daten und Meta-Angaben helfen bei der inhaltlichen Einordnung.
  • Interne Links: Linkziel, Ankertext und Position liefern Hinweise auf Beziehungen zwischen Seiten.
  • Canonical-Tags: Sie benennen die bevorzugte URL, wenn gleiche oder ähnliche Inhalte unter mehreren Adressen erreichbar sind.

Crawling und Indexierung sind zwei Schritte

Eine gecrawlte Seite ist nicht automatisch indexiert. Crawling bedeutet, dass ein Bot die URL abgerufen hat. Indexierung bedeutet, dass eine Suchmaschine die verarbeiteten Informationen in ihren Suchindex aufnimmt. Weitere technische Begriffe kannst du im SEO-Lexikon nachschlagen.

Besonders widersprüchliche Signale kosten Ressourcen. Eine URL sollte nicht gleichzeitig in der Sitemap stehen und per noindex von der Indexierung ausgeschlossen werden. Solche Konstellationen schicken den Crawler zu einer Adresse, die laut Websitebetreiber gar nicht in den Index gehört.

2.1 Was bedeuten Weiterleitungen beim Crawling?

Eine Weiterleitung teilt dem Crawler mit, dass die angeforderte Ressource unter einer anderen Adresse liegt. Dauerhafte URL-Änderungen sollten mit 301 gekennzeichnet werden, zeitlich begrenzte Umleitungen mit 302. Interne Links sollten möglichst direkt auf die endgültige Zieladresse zeigen, weil jede zusätzliche Weiterleitung einen weiteren HTTP-Abruf verursacht.

3. So arbeitet der Google Crawler

Google Crawling beginnt nicht bei jeder Website von vorn. Der Googlebot kennt bereits URLs aus früheren Besuchen, Sitemaps und Links anderer Seiten. Beim nächsten Durchlauf entscheidet Google, welche Adressen erneut besucht werden und welche neu entdeckten Links in die Warteschlange kommen.

Technik Crawler Performance Suite

Google steuert die Besuchsfrequenz dynamisch. Häufig aktualisierte, gut verlinkte und für die Website zentrale Seiten werden meist öfter abgerufen als unveränderte Archivseiten. Das lastmod-Element einer Sitemap kann das Datum einer tatsächlichen Änderung übermitteln. Ein künstlich täglich aktualisiertes Datum hilft dagegen nicht, wenn sich der Inhalt nicht verändert hat.

3.1 Wie häufig crawlt Google eine Website?

Für die Crawl-Frequenz gibt es keinen festen Stunden- oder Tagesplan. Nachrichtenseiten können mehrmals täglich besucht werden, während unveränderte Unterseiten deutlich längere Intervalle aufweisen. Google berücksichtigt unter anderem Aktualisierungen, interne und externe Verlinkung, bisherige Änderungen sowie die Reaktionsfähigkeit des Servers.

Ein häufiger Irrtum besteht darin, jede Seite über Sitemap-Angaben als besonders wichtig markieren zu wollen. Das priority-Element beeinflusst Google-Rankings nicht direkt und wird von Google möglicherweise nicht für die Crawl-Steuerung berücksichtigt. Eine klare interne Verlinkung liefert in der Praxis das belastbarere Signal.

4. Was kann ein Webcrawler erfassen?

Ein Webcrawler kann öffentlich erreichbare URLs abrufen, technische Antworten auswerten, HTML-Inhalte lesen und Verlinkungen verfolgen. SEO-Crawler ergänzen diese Basis um Prüfungen auf fehlerhafte Statuscodes, Weiterleitungsketten, Seitentitel, Canonical-Tags, Überschriften, defekte Links, Parameter-URLs und weitere technische Auffälligkeiten.

  • Erreichbare HTML-Seiten und ihre Inhalte untersuchen
  • Statuscodes und Weiterleitungsziele speichern
  • Interne Links und die Klicktiefe einer URL abbilden
  • Doppelte oder sehr ähnliche Seitenelemente erkennen
  • Robots-, Canonical- und Indexierungsanweisungen prüfen
  • XML-Sitemaps mit den tatsächlich erreichbaren URLs vergleichen

Parameter können die Anzahl crawlbarer URLs stark erhöhen. Ein Shopfilter erzeugt beispielsweise aus einer Kategorieseite Varianten für Farbe, Größe, Sortierung und Preis. Wenn dieselben Produkte unter vielen Kombinationen erreichbar sind, verbringt der Crawler Zeit mit ähnlichen Adressen. Canonical-Tags, gezielte Robots-Regeln und begrenzte Filterkombinationen schaffen eine kontrollierbare Struktur.

4.1 Wo liegen die Grenzen eines Webcrawlers?

Ein Crawler kann nur auswerten, was er technisch abrufen und rendern kann. Inhalte hinter einem Login, nach einer Sucheingabe oder erst nach einem Klick auf einen interaktiven Filter bleiben oft unerreichbar. Das gilt auch für Informationen, die ausschließlich über komplexe Skripte, verzögert geladene Schnittstellen oder fehlerhafte JavaScript-Prozesse entstehen.

Moderne Frontends können im Browser vollständig wirken und für einen Crawler trotzdem fast leer sein. Prüfe deshalb nicht nur die sichtbare Darstellung. Kontrolliere den ausgelieferten HTML-Code und die gerenderte Version. Wichtige Texte, Links und Produktinformationen sollten ohne zwingende Nutzerinteraktion erreichbar sein.

Dieses Fehlerbild fällt bei Relaunches oft erst spät auf: Die Navigation reagiert im Browser, aber die Links besitzen keine normal crawlbaren Zieladressen. Der Crawler erreicht dann die Startseite und wenige Einstiegsseiten, während tiefer liegende Kategorien aus dem internen Linkgraphen verschwinden. Vor dem Livegang sollte deshalb jede wichtige URL über einen echten HTML-Link erreichbar sein.

Wenn du selbst prüfen möchtest, was ein technischer Crawler auf deiner Domain findet, kannst du einen Free Account anlegen:

Free Account anlegen

5. Langsame Server begrenzen das Crawling

Google passt seine Abrufrate an die Belastbarkeit einer Website an. Antwortet der Server schnell und stabil, kann der Googlebot in derselben Zeit mehr URLs verarbeiten. Steigen Antwortzeiten oder 5xx-Fehler, reduziert Google die Anfragen, um den Server nicht zusätzlich zu belasten.

Ladezeiten und Uptime Monitor

Der Zusammenhang wird bei technischen Analysen häufig übersehen: Ein langsamer Server bremst nicht nur Besucher. Er reduziert auch die Zahl der Seiten, die ein Crawler während eines Besuchs erfassen kann. Bei einer kleinen Unternehmenswebsite fällt das kaum auf. Bei einem Onlineshop mit vielen Kategorien, Produkten und Filter-URLs kann dadurch neuer oder aktualisierter Content später entdeckt werden.

5.1 Welche Serverprobleme bremsen den Googlebot?

Lange Antwortzeiten, wiederkehrende Timeouts und Statuscodes der 5xx-Klasse signalisieren eine eingeschränkte Erreichbarkeit. Auch Weiterleitungsketten erhöhen den Aufwand, weil jede Station eine neue Serveranfrage benötigt. Die sinnvolle Reihenfolge lautet deshalb: Serverfehler beheben, Antwortzeiten stabilisieren, interne Weiterleitungen reduzieren und erst danach Details einzelner Meta-Angaben optimieren.

Prüfe die Ladezeit nicht nur für die Startseite, sondern auch für Kategorien, Produkte und umfangreiche Ratgeber:

Mit Nutzung dieses PageSpeed-Checks erklären Sie, dass Sie die Datenschutzerklärung zur Kenntnis genommen haben und damit einverstanden sind, dass die von Ihnen angegebenen Daten elektronisch erhoben und gespeichert werden. Ihre Daten werden dabei nur streng zweckgebunden zur Bearbeitung des PageSpeed-Checks benutzt. Mit der Nutzung dieses PageSpeed-Checks erklären Sie sich mit der Verarbeitung einverstanden.

6. Erst Crawling prüfen, dann Content planen

Vor einer größeren Content-Produktion sollte geklärt sein, ob Google die bestehenden Seiten vollständig erreicht. Neue Texte lösen kein technisches Erfassungsproblem. Wenn interne Links fehlen, wichtige Bereiche blockiert sind oder der Server regelmäßig Fehler liefert, wächst lediglich die Zahl der URLs, die nicht zuverlässig verarbeitet werden.

Eine sinnvolle Vorprüfung beantwortet vier Fragen: Liefern relevante URLs Statuscode 200? Sind sie über interne HTML-Links erreichbar? Stimmen Sitemap, Canonical-Tags und Indexierungsanweisungen überein? Erscheinen wichtige Inhalte bereits im ausgelieferten oder gerenderten Quelltext?

Die Priorisierung richtet sich nach wirtschaftlicher Wirkung. Eine blockierte Hauptkategorie mit Nachfrage verdient mehr Aufmerksamkeit als zahlreiche alte Parameter-URLs ohne interne Links. Der kostenlose SEO-Check als Einstieg untersucht Technik, Ladezeiten, Metadaten und weitere SEO-Signale. Für Relaunches hilft zusätzlich eine SEO-Checkliste für den Website-Relaunch.

7. So gehen wir vor

Die OSG beginnt technische Optimierungen mit einem vollständigen Crawl und gleicht die Ergebnisse mit relevanten Zielseiten und organischen Daten ab. Der Technical Crawler der Performance Suite arbeitet nach demselben Grundprinzip wie ein Suchmaschinen-Crawler und prüft pro Durchlauf über 100 technische Punkte. Statuscodes, Weiterleitungen, interne Links und Entwicklungen über mehrere Crawls werden dadurch gemeinsam sichtbar.

Entscheidend ist anschließend die Reihenfolge der Umsetzung. Zuerst kommen Fehler, die wichtige Seiten unzugänglich machen oder den Server belasten. Danach folgen Struktur-, Sitemap- und Seitensignale. Du kannst dir direkt ein Crawl-Ergebnis ansehen oder im Rahmen eines individuellen SEO-Audits klären, welche technischen Maßnahmen den größten Hebel besitzen.

8. Häufige Fragen zu Webcrawlern

Wie funktioniert crawlen bei Google?

Google startet mit bekannten URLs, lädt deren Inhalte und folgt auffindbaren Links. Neue Adressen werden in einer Warteschlange gespeichert und abhängig von Relevanz, Aktualität und Serverkapazität später abgerufen.

Was kann ein Webcrawler?

Ein Webcrawler kann öffentliche Seiten abrufen, Statuscodes prüfen, HTML-Inhalte lesen, Links verfolgen und technische Anweisungen erfassen. Inhalte hinter Logins oder erst nach komplexer Nutzerinteraktion bleiben häufig unerreichbar.

Was ist der Unterschied zwischen Crawling und Indexierung?

Beim Crawling wird eine URL abgerufen und verarbeitet. Bei der Indexierung entscheidet die Suchmaschine, ob die Seite in ihren durchsuchbaren Bestand aufgenommen wird. Eine gecrawlte Seite muss deshalb nicht automatisch indexiert sein.

Wie oft crawlt Google eine Website?

Google verwendet keinen festen Zeitplan für alle Websites. Häufig aktualisierte, gut verlinkte Seiten werden meist öfter besucht. Langsame Server, wenige Änderungen und eine geringe interne Bedeutung können die Besuchsfrequenz reduzieren.

Kann die robots.txt Crawling verhindern?

Die robots.txt kann regelkonforme Crawler vom Abruf bestimmter Verzeichnisse oder URLs abhalten. Sie ist jedoch kein Schutz für vertrauliche Inhalte. Geschützte Daten gehören hinter eine technische Zugriffskontrolle.

Kann ein Crawler JavaScript lesen?

Moderne Suchmaschinen können viele JavaScript-Inhalte rendern, aber der Prozess benötigt zusätzliche Ressourcen und ist nicht bei jeder Anwendung zuverlässig. Wichtige Inhalte und Links sollten deshalb möglichst direkt im HTML oder nach einem stabilen Rendering verfügbar sein.

Wie erkenne ich, ob meine Website crawlbar ist?

Prüfe Statuscodes, robots.txt, interne Links, XML-Sitemap, Canonical-Tags und die gerenderten Inhalte. Ein technischer Crawl zeigt zusätzlich, welche Seiten erreichbar sind, wie tief sie liegen und an welchen Stellen der Crawler abbricht.

9. Crawlbarkeit als erste Priorität

Der sinnvollste nächste Schritt ist nicht automatisch ein weiterer Text. Prüfe zuerst, ob deine vorhandenen Leistungs-, Kategorie- und Produktseiten mit Statuscode 200 erreichbar, intern verlinkt und schnell abrufbar sind. Erst wenn diese Basis stimmt, kann neuer Content zuverlässig entdeckt, indexiert und organisch sichtbar werden.

Wenn du den technischen Zustand deiner Domain gemeinsam priorisieren möchtest, kannst du einen kostenlosen Potenzialcheck anfragen. Das Erstgespräch ist unverbindlich und dient der klaren Einordnung, welche technischen Themen zuerst bearbeitet werden sollten.

Kostenlosen Potenzialcheck anfragen

SEO Agentur kostenlose SEO Potentialanalyse



Weitere Inhalte


Keine Kommentare vorhanden


Du hast eine Frage oder eine Meinung zum Artikel? Teile sie mit uns!

Deine E-Mail-Adresse wird nicht veröffentlicht. Erforderliche Felder sind markiert *

*
*