Kann man Crawling selbst steuern?

Kurzantwort
Ja, du kannst das Crawling deiner Website selbst steuern, aber nicht erzwingen. Mit interner Verlinkung, einer XML-Sitemap, robots.txt, Robots-Anweisungen, korrekten Statuscodes und schnellen Serverantworten gibst du Google klare Signale. Ob und wann Google eine URL tatsächlich besucht oder indexiert, entscheidet die Suchmaschine selbst.
Das Crawling zu steuern bedeutet, Google den effizientesten Weg durch deine Website zu zeigen. Besonders relevant ist das bei großen Onlineshops, modernen JavaScript-Frontends, Relaunches und Websites mit vielen Filter-URLs. Die wichtigste Regel lautet: Prüfe zuerst, welche Inhalte ein Crawler tatsächlich findet, und ändere danach gezielt die Steuerung.
1. Diese Signale steuerst du selbst
Google verteilt seine Crawling-Ressourcen nicht gleichmäßig über alle URLs. Häufig verlinkte, technisch erreichbare und schnell antwortende Seiten werden eher besucht als isolierte oder widersprüchlich ausgezeichnete URLs. Die folgenden Mittel liegen direkt in deiner Hand:
| Steuerungsmittel | Wirkung auf das Crawling | Typischer Fehler |
|---|---|---|
| Interne Verlinkung | Zeigt dem Crawler neue URLs und ihre Bedeutung innerhalb der Website. | Wichtige Seiten sind nur über die Suche oder Filter erreichbar. |
| XML-Sitemap | Meldet bekannte und gewünschte URLs an Google. | Die Sitemap enthält Weiterleitungen, Fehlerseiten oder Noindex-URLs. |
| robots.txt | Blockiert das Crawling bestimmter Verzeichnisse oder URL-Muster. | CSS, JavaScript oder wichtige Inhaltsbereiche werden versehentlich gesperrt. |
| Robots-Anweisungen | Steuern unter anderem, ob eine erreichbare Seite indexiert werden darf. | Eine Noindex-Seite steht gleichzeitig in der Sitemap. |
| Statuscodes | Teilen dem Crawler mit, ob Inhalte erreichbar, verschoben oder nicht vorhanden sind. | Gelöschte Inhalte liefern weiterhin Status 200 oder wichtige Seiten antworten mit 5xx. |
| Serverleistung | Schnelle und stabile Antworten erleichtern umfangreichere Crawls. | Überlastungen führen zu Timeouts oder wiederkehrenden Serverfehlern. |
Die XML-Sitemap sollte ausschließlich URLs enthalten, die erreichbar sind, indexiert werden sollen und im Regelfall den Statuscode 200 liefern. Noindex-Seiten oder weitergeleitete URLs in der Sitemap senden widersprüchliche Signale und beanspruchen Crawling-Ressourcen für Adressen, die Google nicht dauerhaft aufnehmen soll.
robots.txt und Noindex richtig einsetzen
Die robots.txt regelt in erster Linie den Zugriff des Crawlers. Eine Robots-Anweisung wie noindex regelt die Indexierung. Blockierst du eine URL in der robots.txt, kann Google die Noindex-Anweisung auf dieser Seite unter Umständen nicht mehr auslesen. Seiten, die sicher aus dem Index entfernt werden sollen, müssen deshalb zunächst crawlbar bleiben.
2. Kann Google meine Seite crawlen?
Ob Google eine bestimmte Seite crawlen kann, prüfst du in der Google Search Console mit der URL-Prüfung. Die Live-Prüfung zeigt für eine einzelne Adresse unter anderem, ob Googlebot sie abrufen darf, ob eine robots.txt-Sperre besteht und ob beim Laden technische Probleme auftreten. Die Indexabdeckung allein reicht dafür nicht, weil sie den letzten bekannten Zustand und keinen aktuellen Live-Abruf zeigt.
Außerhalb der Search Console hilft ein eigener Crawl. Der Technical Crawler der Performance Suite analysiert täglich mehr als 100 technische Faktoren. Er bezieht relevante URLs unter anderem aus der Google Search Console, Google Ads, Bing und vorhandenen Backlinks ein. Dadurch werden auch Adressen sichtbar, die in der aktuellen Navigation fehlen.
Der typische blinde Fleck entsteht nach Änderungen am Menü oder am Shopsystem. Im Browser funktioniert die Website, doch ältere Landingpages sind intern nicht mehr erreichbar. Wenn diese URLs noch Impressionen, Backlinks oder bezahlten Traffic erhalten, ist ihre technische Prüfung dringlicher als die reine Anzahl neuer Warnmeldungen.
3. Kann Google AJAX-Inhalte crawlen?
Google kann Inhalte verarbeiten, die per JavaScript oder AJAX erzeugt werden. Verlässlich ist das jedoch nur, wenn die Inhalte beim Aufruf der URL ohne weitere Nutzeraktion geladen werden, Google die benötigten Skripte abrufen darf und das Rendering keine Fehler verursacht. Serverseitig ausgelieferter HTML-Inhalt bleibt für zentrale Überschriften, Texte, Links und Produktinformationen die robustere Lösung.

Besonders kritisch sind Inhalte, die erst nach einem Klick, Scrollen, Login oder einer Auswahl erscheinen. Wenn ein Produkttext erst nach dem Öffnen eines Tabs nachgeladen wird oder interne Links ausschließlich durch eine Nutzerinteraktion entstehen, kann Google diese Elemente übersehen. Das betrifft regelmäßig moderne Frontends, obwohl die Seite für Besucher vollständig wirkt.
Sichtbar im Browser bedeutet nicht automatisch crawlbar. Prüfe JavaScript-Seiten sowohl mit der Live-URL-Prüfung als auch mit deaktiviertem JavaScript oder im gerenderten HTML. Wenn Überschriften, Haupttext oder interne Links dabei verschwinden, hängt die Auffindbarkeit zu stark vom Rendering ab.
4. Kann Google Web-Apps crawlen?
Öffentlich erreichbare Web-Apps kann Google grundsätzlich crawlen. Voraussetzung sind eindeutige URLs, abrufbare Inhalte und normale Links mit einem href-Ziel. Inhalte hinter einem Login, innerhalb einer nativen Smartphone-App oder ausschließlich in einem geschlossenen Benutzerbereich bleiben dem normalen Googlebot dagegen weitgehend verborgen.
Single-Page-Applications benötigen besondere Aufmerksamkeit. Wenn mehrere Ansichten unter derselben URL erscheinen, kann Google sie nicht wie eigenständige Seiten behandeln. Jede relevante Ansicht braucht deshalb eine dauerhafte URL, einen passenden Statuscode, einen eigenen Seitentitel und eine technisch erreichbare interne Verlinkung.
Du möchtest prüfen, welche URLs und technischen Signale ein Crawler auf deiner Domain tatsächlich findet?
5. Kann Google verwaiste Seiten finden?
Verwaiste Seiten besitzen keine eingehenden internen Links. Google findet sie nur, wenn die URL aus einer anderen Quelle bekannt ist, etwa aus einer XML-Sitemap, einem externen Backlink, früheren Crawls oder Daten aus Google-Diensten. Eine Sitemap kann die Entdeckung ermöglichen, ersetzt aber keine interne Verlinkung.
Der stille Sichtbarkeitsverlust entsteht selten durch eine komplette Crawling-Sperre. Häufig liegt eine wichtige Landingpage korrekt in der Sitemap, antwortet mit Status 200 und bleibt trotzdem schwach. Ohne interne Links erhält Google kaum Hinweise auf ihre Einordnung und Priorität. Die URL ist technisch vorhanden, wird strukturell aber wie ein Randthema behandelt.
Prüfe bei jeder verwaisten Seite zuerst ihre Aufgabe:
Eine saubere Onpage-Optimierung der internen Verlinkung ordnet Seiten nach Themen und Geschäftswert ein. Der Abstand zur Startseite allein ist dabei kein ausreichendes Kriterium. Wichtiger ist, ob relevante Einstiegsseiten und inhaltlich verwandte Dokumente nachvollziehbar auf die URL verweisen.
6. Kann ich jede Website crawlen?
Technisch lassen sich viele öffentlich erreichbare Websites mit einem Crawler untersuchen. Das bedeutet nicht, dass du fremde Websites unbegrenzt oder ohne Rücksicht auf Regeln abrufen solltest. Beachte die robots.txt, Nutzungsbedingungen, Serverbelastung, Schutzmechanismen und den Zweck der Datenerhebung.
Für eine Wettbewerbsanalyse genügt meist ein begrenzter Crawl öffentlich zugänglicher Seiten mit niedriger Abrufrate. Logins, Zugangssperren, Captchas oder technische Schutzmaßnahmen solltest du nicht umgehen. Für umfangreiche Datenerhebungen und eine kommerzielle Weiterverwendung der Daten ist eine rechtliche Prüfung sinnvoll.
7. Google erneut crawlen lassen
7.1 Eine einzelne Seite erneut einreichen
Du kannst Google bitten, eine einzelne Seite erneut zu crawlen. Öffne dafür die URL-Prüfung in der Google Search Console, starte bei Bedarf einen Live-Test und wähle anschließend die Indexierung aus. Die Anforderung kann den erneuten Besuch beschleunigen, garantiert aber weder einen bestimmten Zeitpunkt noch die Aufnahme in den Index.
Nutze die Funktion gezielt nach einer wesentlichen Änderung, etwa nach dem Entfernen einer Noindex-Anweisung, der Behebung eines Serverfehlers oder einer grundlegenden Überarbeitung des Inhalts. Das wiederholte Einreichen einer unveränderten URL erzeugt keinen zusätzlichen Qualitätsvorteil.
7.2 Die gesamte Website erneut crawlen lassen
Für eine komplette Website gibt es keinen Knopf, der einen sofortigen Vollcrawl auslöst. Aktualisiere stattdessen die XML-Sitemap, reiche sie in der Google Search Console ein und stelle sicher, dass neue oder überarbeitete Seiten intern erreichbar sind. Google bestimmt den weiteren Zeitplan anhand eigener Signale.
Nach einem Relaunch reicht die Sitemap allein nicht aus. Prüfe Weiterleitungen, Canonicals, robots.txt, Statuscodes und interne Links gemeinsam. Ein einziger versehentlich gesperrter Verzeichnispfad kann Hunderte URLs betreffen, während die Startseite weiterhin fehlerfrei erreichbar bleibt.
8. Crawling sinnvoll priorisieren
Die Reihenfolge spart mehr Zeit als ein weiterer Einzelcheck: Ermittle zuerst die tatsächlich gefundenen URLs, gleiche sie mit Sitemap, Suchmaschinen-Daten und wichtigen Landingpages ab und korrigiere danach die Steuerung. So erkennst du drei Gruppen: gewünschte Seiten, unnötig gecrawlte URLs und wichtige Adressen, die der Crawler nicht erreicht.
Prüfe zunächst den technischen Ist-Stand deiner Domain. Der kostenlose SEO-Check untersucht unter anderem Technik, Ladezeiten und Metadaten für bis zu 20 Unterseiten.
9. So gehen wir vor
Bei der OSG beginnt die Crawling-Optimierung mit einer vollständigen URL-Sicht, nicht mit einzelnen robots.txt-Regeln. Wir gleichen Crawl-Daten mit Suchmaschinen-Daten ab, priorisieren geschäftlich relevante Seiten und übergeben technische Fehler als konkrete Aufgaben an Redaktion oder Entwicklung. Der Technik-Crawler überwacht dabei auch Änderungen an der robots.txt, 4xx- und 5xx-Fehler sowie tiefe Verzeichnisstrukturen. Ladezeiten werden sechsmal täglich gemessen.

Für umfangreichere Websites verbinden wir die technische Analyse mit der strategischen Prüfung in einem SEO-Audit. Dadurch wird aus einer langen Fehlerliste eine Reihenfolge, die sich an SEO-Traffic, Rankings und Geschäftswert orientiert. Die Umsetzung bleibt für den Kunden live nachvollziehbar, statt nur in einem monatlichen Bericht zusammengefasst zu werden.
10. Häufige Fragen zur Crawl-Steuerung
Wie bringe ich Google dazu, meine Website zu crawlen?
Verlinke wichtige Seiten intern, führe sie in einer sauberen XML-Sitemap auf und reiche die Sitemap in der Google Search Console ein. Achte außerdem auf Status 200, schnelle Serverantworten und fehlende Crawling-Sperren.
Wie prüfe ich, ob Google eine URL crawlen kann?
Nutze die URL-Prüfung der Google Search Console und starte einen Live-Test. Damit erkennst du unter anderem robots.txt-Sperren, Abrufprobleme und Fehler beim Laden der Seite.
Ist Crawling dasselbe wie Indexierung?
Nein. Beim Crawling ruft Google eine URL ab und untersucht ihren Inhalt. Bei der Indexierung entscheidet Google, ob die Seite in den Suchindex aufgenommen und für Suchanfragen berücksichtigt wird.
Wie schnell crawlt Google eine geänderte Seite erneut?
Das kann wenige Stunden, mehrere Tage oder länger dauern. Die Geschwindigkeit hängt unter anderem von der Bedeutung der URL, internen Links, Serverstabilität und der allgemeinen Crawling-Aktivität auf der Domain ab.
Muss jede URL in der XML-Sitemap stehen?
Nein. In die Sitemap gehören vor allem kanonische, indexierbare URLs mit Status 200. Weiterleitungen, Fehlerseiten, Noindex-Seiten und unwichtige Filter-URLs sollten dort nicht aufgeführt werden.
Kann Google Inhalte hinter einem Login crawlen?
Normalerweise nicht. Googlebot meldet sich nicht wie ein regulärer Benutzer in einem geschlossenen Kundenkonto an. Suchrelevante Inhalte sollten deshalb auf öffentlich erreichbaren URLs verfügbar sein.
Kann eine robots.txt-Seite trotzdem bei Google erscheinen?
Ja. Kennt Google die URL aus Links oder früheren Crawls, kann sie trotz Crawling-Sperre als URL-Ergebnis erscheinen. Für eine sichere Entfernung aus dem Index sollte Google die Seite crawlen und eine Noindex-Anweisung auslesen können.
11. Erst messen, dann eingreifen
Gute Crawl-Steuerung beginnt nicht mit möglichst vielen Sperren. Sie beginnt mit der Frage, welche geschäftlich relevanten Seiten Google erreicht und welche unnötigen URLs Ressourcen beanspruchen. Ordne zuerst den URL-Bestand, behebe widersprüchliche Signale und stärke danach die interne Verlinkung. So wird aus technischer Kontrolle eine belastbare Grundlage für organische SEO-Sichtbarkeit.
Wenn du deine Crawl-Struktur, Statuscodes und verwaisten Seiten gemeinsam priorisieren möchtest, kannst du einen kostenlosen und unverbindlichen Potenzialcheck anfragen. Das Erstgespräch dient der Einordnung deiner Domain und ist kein Verkaufsgespräch.








Keine Kommentare vorhanden