Crawling

Was ist Crawling?

Crawling bezeichnet das automatisierte Abrufen und Durchsuchen von Webseiten durch Suchmaschinenprogramme wie den Googlebot. Dabei erfassen Crawler Inhalte, Quellcode, Links und technische Signale einer URL. Das Crawling ist die Voraussetzung für eine mögliche Indexierung, führt aber nicht automatisch zur Aufnahme einer Seite in die Suchergebnisse.

Was bedeutet Crawling im SEO?

Crawling ist der technische Erfassungsprozess, mit dem Suchmaschinen das Web durchsuchen. Die deutsche Entsprechung lautet sinngemäß Durchsuchen oder Durchkriechen. Ein Crawler, auch Bot oder Spider genannt, ruft eine URL ab, liest deren Inhalte und folgt auffindbaren Links zu weiteren Adressen.

Der Googlebot ist der Crawler von Google. Er entdeckt neue und veränderte URLs unter anderem über interne Links, externe Verlinkungen und XML-Sitemaps. Eine Seite ohne eingehende Links kann trotz hochwertiger Inhalte schwer auffindbar bleiben. Verlinke wichtige Seiten deshalb innerhalb der Navigation oder aus thematisch passenden Inhalten.

Wie funktioniert Crawling?

Das Crawling folgt keinem starren Rundgang durch eine Website. Suchmaschinen entscheiden fortlaufend, welche URLs sie abrufen, wie häufig sie zurückkehren und welche Ressourcen sie verarbeiten. Aktualität, interne Verlinkung, Serverreaktion und bereits bekannte Inhalte beeinflussen diese Auswahl.

  • URL entdecken: Der Crawler findet eine Adresse über Links, Sitemaps oder bereits gespeicherte Informationen.
  • Zugriff prüfen: Die robots.txt legt fest, ob der Bot den betreffenden Pfad abrufen darf.
  • Serverantwort auswerten: Der HTTP-Statuscode zeigt, ob eine URL erreichbar, weitergeleitet oder fehlerhaft ist.
  • Inhalte verarbeiten: Der Crawler liest HTML, Texte, Metadaten, strukturierte Daten und verknüpfte Ressourcen.
  • Links verfolgen: Gefundene Verweise liefern weitere URLs für spätere Abrufe.
Der HTTP-Statuscode bestimmt, was der Crawler mit einer URL anfangen kann. Der Code 200 bestätigt einen erfolgreichen Abruf. Eine 301-Antwort verweist dauerhaft auf eine andere Adresse. Der Code 404 meldet eine nicht vorhandene Ressource, während 503 eine vorübergehende Nichterreichbarkeit signalisiert.

Crawling und Indexierung unterscheiden

Der Unterschied zwischen Crawling und Indexierung liegt im Verarbeitungsschritt: Beim Crawling ruft die Suchmaschine eine URL ab. Bei der Indexierung analysiert und speichert sie den Inhalt für mögliche Suchergebnisse. Eine erfolgreich gecrawlte Seite kann von der Indexierung ausgeschlossen werden, etwa durch eine Noindex-Anweisung, einen abweichenden Canonical-Tag oder unzureichende eigenständige Inhalte.

Ein verbreiteter Denkfehler besteht darin, robots.txt und Noindex gleichzusetzen. Die robots.txt steuert primär den Abruf, während Noindex die Aufnahme in den Suchindex steuert. Ist eine URL für den Googlebot gesperrt, kann der Bot eine auf der Seite hinterlegte Noindex-Anweisung möglicherweise nicht auslesen. Prüfe deshalb getrennt, ob eine URL crawlbar und ob sie indexierbar sein soll.

Welche Signale steuern das Crawling?

Suchmaschinen verwenden mehrere technische Signale gleichzeitig. Widersprechen sich diese Signale, kann das Crawling ineffizient werden. Eine URL sollte beispielsweise nicht als wichtig in der XML-Sitemap stehen und zugleich über die robots.txt gesperrt sein.

Signal Wirkung auf Crawler Prüfung
Interne Links Machen URLs auffindbar und übertragen Kontext Wichtige Seiten dürfen nicht verwaist sein
XML-Sitemap Listet relevante URLs für Suchmaschinen auf Nur indexierbare URLs mit Statuscode 200 aufnehmen
robots.txt Erlaubt oder blockiert den Abruf bestimmter Pfade Geschäftlich relevante Verzeichnisse freigeben
Canonical-Tag Signalisiert die bevorzugte URL-Version Canonical, Sitemap und interne Links abstimmen
HTTP-Statuscode Informiert über Erreichbarkeit und Weiterleitungen 4xx- und 5xx-Antworten regelmäßig kontrollieren

Das Crawl-Budget beschreibt die Menge an URLs, die eine Suchmaschine innerhalb eines Zeitraums auf einer Domain abrufen kann und möchte. Es gibt dafür keinen universellen Richtwert. Für kleine Unternehmenswebsites ist das Crawl-Budget selten der Engpass. Relevant wird es vor allem bei großen Onlineshops, umfangreichen Portalen, Facettennavigation oder sehr vielen automatisch erzeugten URL-Varianten.

Eine globale Sperre mit User-agent: * und Disallow: / blockiert den Abruf der gesamten Website für die angesprochenen Crawler. Solche Einstellungen sind in Entwicklungsumgebungen sinnvoll, müssen vor einem Livegang aber zuverlässig entfernt werden.

Crawling messen und technisch prüfen

Messbar ist Crawling über Serverlogs, die URL-Prüfung und Crawling-Berichte der Google Search Console sowie spezialisierte Website-Crawler. Serverlogs zeigen tatsächliche Bot-Abrufe inklusive Zeitpunkt, URL, User-Agent und Statuscode. Ein SEO-Crawler simuliert dagegen einen Abruf und deckt technische Strukturen, Weiterleitungsketten, defekte Links oder widersprüchliche Indexierungssignale auf.

Der Technik-Crawler der Performance Suite analysiert Websites täglich, prüft mehr als 100 SEO-Faktoren und kann bis zu 100.000 URLs einbeziehen. Dabei werden unter anderem Statuscodes, Canonicals, robots.txt, Sitemaps und tiefe Verzeichnisstrukturen kontrolliert.

Ein vollständiger SEO-Audit verbindet diese Crawl-Daten mit Indexierung, interner Verlinkung, Ladezeiten und Seitenqualität. Der Beitrag zum SEO-Technik-Crawler zeigt ergänzend, wie technische Prüfungen automatisiert priorisiert werden können.

Prüfe deine Website direkt auf technische Fehler, Metadaten, Ladezeiten und problematische Unterseiten:

Mit Nutzung dieses SEO-Checks erklären Sie, dass Sie die Datenschutzerklärung zur Kenntnis genommen haben und damit einverstanden sind, dass die von Ihnen angegebenen Daten elektronisch erhoben und gespeichert werden. Ihre Daten werden dabei nur streng zweckgebunden zur Bearbeitung des SEO-Checks benutzt. Mit der Nutzung dieses SEO-Checks erklären Sie sich mit der Verarbeitung einverstanden.

Crawling für SEO, SEA und GEO

Für SEO bildet Crawling den Zugang zu organischen Rankings. Inhalte, die eine Suchmaschine nicht zuverlässig erreicht oder verarbeitet, können ihre Relevanz in der Suche kaum entfalten. Technische Zugänglichkeit ersetzt keine guten Inhalte, schafft aber die Voraussetzung dafür, dass Suchmaschinen deren Qualität bewerten können.

Für SEA betrifft Crawling vor allem die technische Kontrolle beworbener Landingpages. Eine Anzeige kann weiterhin Klicks erzeugen, obwohl die Zielseite einen Fehlercode liefert, langsam reagiert oder auf eine unpassende URL weiterleitet. Die regelmäßige Prüfung der Anzeigenziele verbindet technische Qualität mit effizientem Budgeteinsatz.

Für GEO, also Generative Engine Optimization, bleibt eine klare technische Struktur ebenfalls relevant. KI-Systeme und deren Suchkomponenten verwenden eigene Bots und Datenquellen, deren Regeln nicht mit dem Googlebot gleichgesetzt werden dürfen. Crawlbare, eindeutig verlinkte und inhaltlich verständliche Seiten erleichtern jedoch die maschinelle Erfassung durch verschiedene Systeme.

Typische Crawling-Fehler beheben

Viele Crawling-Probleme entstehen durch widersprüchliche technische Vorgaben. In Projekten fällt besonders häufig auf, dass neue Inhalte zwar veröffentlicht wurden, aber nur über eine Sitemap erreichbar sind. Eine interne Verlinkung aus einer passenden Kategorie oder Themenseite verbessert die Auffindbarkeit und macht die Bedeutung der URL verständlicher.

  • Entferne wichtige URLs nicht versehentlich über robots.txt aus dem zugänglichen Bereich.
  • Leite gelöschte Seiten nur dann per 301 weiter, wenn ein fachlich passendes Ziel existiert.
  • Nimm keine Noindex-Seiten, Weiterleitungen oder Fehlerseiten in die XML-Sitemap auf.
  • Reduziere endlose Filter-, Sortier- und Kalender-URLs, wenn sie keinen eigenen Suchwert besitzen.
  • Verlinke wichtige Seiten so, dass sie mit wenigen nachvollziehbaren Klicks erreichbar sind.
  • Prüfe nach einem Relaunch alte URLs, Weiterleitungen, Canonicals und interne Links gemeinsam.

Wenn du technische Crawling-Probleme systematisch erfassen möchtest, kannst du einen Free Account inklusive SEO-Audit anlegen.

Free Account anlegen

Häufige Fragen zum Crawling

Wie oft crawlt Google eine Website?

Google verwendet keinen festen Zeitplan für alle Websites. Häufig aktualisierte, gut verlinkte und zuverlässig erreichbare Seiten können öfter abgerufen werden als selten veränderte oder tief versteckte URLs.

Kann man das Crawling einer neuen Seite beschleunigen?

Eine neue Seite sollte intern verlinkt, in die XML-Sitemap aufgenommen und technisch erreichbar sein. Über die URL-Prüfung der Google Search Console kannst du zusätzlich eine Indexierung beantragen, ohne dass daraus ein fester Zeitpunkt garantiert wird.

Warum crawlt Google eine Seite nicht?

Mögliche Ursachen sind eine robots.txt-Sperre, fehlende interne Links, Serverfehler, eine schwer erreichbare URL-Struktur oder eine geringe wahrgenommene Relevanz. Prüfe zuerst Erreichbarkeit, Statuscode, interne Links und Crawling-Freigaben.

Was ist ein SEO-Crawl?

Ein SEO-Crawl ist die automatisierte technische Analyse einer Website mit einem Crawler. Er erfasst unter anderem Statuscodes, interne Links, Weiterleitungen, Canonicals, Metadaten und Indexierungsanweisungen.

Kann eine Seite ohne Crawling indexiert werden?

Eine vollständige Verarbeitung des Seiteninhalts setzt normalerweise einen Abruf voraus. Eine gesperrte URL kann unter Umständen trotzdem als Adresse im Index erscheinen, wenn Google sie über externe oder interne Signale kennt, der Inhalt wurde dann jedoch nicht regulär gecrawlt.

Muss jede Website ihr Crawl-Budget optimieren?

Kleine und klar strukturierte Websites benötigen meist keine eigene Crawl-Budget-Strategie. Eine gezielte Optimierung lohnt sich vor allem bei sehr großen Domains, vielen URL-Parametern, umfangreichen Filtern oder häufigen Serverproblemen.


Sie haben noch Fragen?

Kontaktieren Sie uns

SEO Agentur kostenlose SEO Potentialanalyse


Weitere Inhalte