robots.txt


Was ist eine robots.txt?

Die robots.txt ist eine Textdatei im Stammverzeichnis einer Website, mit der Website-Betreiber den Zugriff automatisierter Crawler auf bestimmte Verzeichnisse oder URLs steuern. Sie enthält Regeln für einzelne Bots oder Bot-Gruppen. Die Datei beeinflusst das Crawling, verhindert jedoch weder zuverlässig den Zugriff auf vertrauliche Inhalte noch grundsätzlich deren Indexierung.

Was bedeutet robots.txt?

Die robots.txt basiert auf dem Robots Exclusion Protocol und übermittelt Suchmaschinen-Crawlern Anweisungen, bevor diese eine Website durchsuchen. Ein Crawler ruft die Datei üblicherweise zu Beginn eines Besuchs ab und prüft, welche Bereiche er laut den hinterlegten Regeln anfordern darf.

Die Datei muss unter dem exakten Dateinamen robots.txt im Stammverzeichnis des jeweiligen Hosts erreichbar sein, beispielsweise unter https://www.beispiel.de/robots.txt. Eine Datei in einem Unterverzeichnis gilt nicht für die gesamte Website. Subdomains benötigen eigene Dateien, da die Regeln immer an den jeweiligen Host, das Protokoll und gegebenenfalls den Port gebunden sind.

Eine robots-Datei steuert in erster Linie das Crawling, also den automatisierten Abruf von URLs. Sie ist kein verbindlicher Zugriffsschutz. Seriöse Suchmaschinen halten sich normalerweise an die Anweisungen, während andere Bots sie ignorieren können.

Wie ist eine robots-Datei aufgebaut?

Die Datei besteht aus Regelgruppen. Jede Gruppe beginnt mit mindestens einer User-agent-Zeile, die den angesprochenen Crawler bezeichnet. Darauf folgen Anweisungen wie Disallow oder Allow. Leerzeilen können Gruppen voneinander trennen, während Kommentare mit einem Rautezeichen beginnen.

AnweisungFunktionBeispiel
User-agentBestimmt den Crawler, für den die folgenden Regeln gelten.User-agent: *
DisallowSchließt einen URL-Pfad vom Crawling aus.Disallow: /intern/
AllowErlaubt einen Teilbereich innerhalb eines gesperrten Pfades, sofern der Crawler diese Anweisung unterstützt.Allow: /intern/freigabe/
SitemapVerweist auf den vollständigen Speicherort einer XML-Sitemap.Sitemap: https://www.beispiel.de/sitemap.xml
#Kennzeichnet einen Kommentar, der nicht als Anweisung verarbeitet wird.# Bereich für interne Suche

Beispiel für einfache Crawler-Regeln

Die folgende Konfiguration erlaubt grundsätzlich allen angesprochenen Bots den Zugriff, sperrt jedoch das Verzeichnis /intern/. Eine darin liegende Freigabe wird ausgenommen. Zusätzlich nennt die Datei den Speicherort der XML-Sitemap.

User-agent: *

Disallow: /intern/

Allow: /intern/freigabe/

Sitemap: https://www.beispiel.de/sitemap.xml

Das Sternchen in der User-agent-Zeile steht für alle Crawler, auf die keine spezifischere Gruppe zutrifft. Innerhalb von Pfaden kann es bei unterstützenden Suchmaschinen als Platzhalter für eine beliebige Zeichenfolge dienen. Ein Dollarzeichen am Ende eines Pfades kann das exakte Ende einer URL kennzeichnen.

Wie beeinflusst die robots.txt SEO?

Eine korrekt konfigurierte robots.txt kann verhindern, dass Suchmaschinen unnötige oder technisch erzeugte URL-Bereiche abrufen. Dazu gehören beispielsweise interne Suchergebnisse, bestimmte Filterkombinationen, Sitzungs-URLs oder endlos generierte Parameterseiten. Dadurch konzentrieren sich Crawler bei umfangreichen Websites stärker auf relevante Kategorien, Produkte und redaktionelle Inhalte.

Die robots-Datei verteilt kein fest definiertes Crawl-Budget auf einzelne Seiten. Sie kann jedoch unnötige Abrufe reduzieren. Das ist vor allem bei großen E-Commerce-Websites, internationalen Portalen und Plattformen mit vielen Filter- oder Parameterkombinationen sinnvoll.

Wichtige CSS- und JavaScript-Dateien sollten für Suchmaschinen erreichbar bleiben. Werden notwendige Ressourcen gesperrt, kann ein Crawler das Layout, mobile Darstellungen oder dynamisch erzeugte Inhalte möglicherweise nicht vollständig verarbeiten. Eine technische Prüfung sollte deshalb nicht nur gesperrte HTML-Seiten, sondern auch betroffene Ressourcen berücksichtigen.

Eine URL kann trotz einer Crawling-Sperre in Suchergebnissen erscheinen, wenn Suchmaschinen sie über interne oder externe Links entdecken. Da der Inhalt nicht abgerufen werden darf, stehen dabei unter Umständen nur die URL und externe Signale zur Verfügung. Vertrauliche Inhalte müssen durch eine Anmeldung, Serverberechtigungen oder andere echte Zugriffskontrollen geschützt werden.

robots.txt, Noindex, Canonical und Sitemap im Vergleich

Die robots.txt wird häufig mit anderen technischen SEO-Signalen verwechselt. Der Unterschied liegt im jeweiligen Zweck: Crawler-Regeln steuern Abrufe, während Meta-Robots-Anweisungen die Indexierung einer bereits abrufbaren Seite beeinflussen. Canonical-Verweise geben eine bevorzugte URL-Version an, und XML-Sitemaps melden relevante URLs zur Verarbeitung.

InstrumentHauptzweckMuss die Seite abrufbar sein?Verhindert eine Indexierung sicher?
robots.txtCrawling steuernNeinNein
noindexURL aus dem Suchindex ausschließenJa, damit der Crawler die Anweisung lesen kannBei unterstützenden Suchmaschinen in der Regel ja
Canonical-TagBevorzugte URL-Version angebenJaNein, das Tag ist ein Konsolidierungssignal
XML-SitemapRelevante URLs meldenJaNein

Eine Seite gleichzeitig per robots-Regel zu sperren und mit noindex zu versehen, ist meist widersprüchlich. Kann der Crawler die Seite nicht abrufen, kann er auch die darin enthaltene Noindex-Anweisung nicht erkennen. Für eine gezielte Entfernung aus dem Index muss die URL zunächst crawlbar bleiben.

Typische Fehler bei robots-Regeln

Schon eine einzelne zu weit gefasste Anweisung kann große Teile einer Website vom Crawling ausschließen. Besonders nach einem Relaunch oder der Übertragung von Einstellungen aus einer Entwicklungsumgebung sollte die Datei unmittelbar geprüft werden. Ein Disallow: / sperrt für die angesprochene Bot-Gruppe den gesamten Host.

  • Die Datei liegt nicht im Stammverzeichnis oder ist unter einem abweichenden Dateinamen gespeichert.
  • Ein übergeordneter Pfad sperrt unbeabsichtigt wichtige Produkte, Kategorien oder Ratgeberseiten.
  • CSS-, JavaScript- oder Bildressourcen sind blockiert, obwohl sie zum Rendern der Inhalte benötigt werden.
  • Eine Crawling-Sperre wird irrtümlich als Schutz vertraulicher Informationen verwendet.
  • Alte Regeln bleiben nach einem Relaunch bestehen und beziehen sich auf die neue URL-Struktur.
  • Wichtige URLs stehen gleichzeitig in der XML-Sitemap und in einem gesperrten Verzeichnis.

Bei einer technischen Analyse sollten die Regeln mit der tatsächlichen URL-Struktur, den internen Links und der XML-Sitemap abgeglichen werden. Ein SEO-Audit für technische und inhaltliche Fehler kann widersprüchliche Signale sowie unbeabsichtigt ausgeschlossene Bereiche sichtbar machen. Ergänzend überwacht ein SEO-Technik-Crawler wichtige URLs und technische Veränderungen fortlaufend.

Bedeutung für SEA und GEO

Für SEA kann die robots.txt relevant werden, wenn spezielle Werbe-Crawler eine Landingpage oder benötigte Ressourcen nicht abrufen dürfen. Eine blockierte Zielseite erschwert die technische und inhaltliche Prüfung durch das Werbesystem. Deshalb sollten bezahlte Landingpages bei der Kontrolle der Crawler-Regeln berücksichtigt werden.

Bei GEO, der Generative Engine Optimization, beeinflussen Crawler-Regeln, ob automatisierte Systeme Inhalte abrufen dürfen. Anbieter generativer Such- und Antwortsysteme können eigene Bot-Kennungen verwenden und Regeln unterschiedlich auswerten. Wer Sichtbarkeit in KI-Antworten anstrebt, sollte deshalb dokumentieren, welche Crawler zugelassen oder gesperrt werden und welche Inhalte öffentlich abrufbar bleiben.

Eine robots-Datei garantiert weder die Aufnahme in eine Suchmaschine noch die Verwendung in einer KI-Antwort. Sie definiert lediglich Zugriffsvorgaben für Bots, die das Robots Exclusion Protocol beachten. Zitierfähige Inhalte benötigen zusätzlich klare Informationsstrukturen, technische Erreichbarkeit und belastbare fachliche Aussagen.

Wie prüfst du die robots.txt?

Rufe die Datei zunächst direkt im Browser auf und kontrolliere den HTTP-Statuscode. Anschließend solltest du die Regeln mit repräsentativen URLs aus Kategorien, Produkten, Ratgebern, Kampagnen und technischen Ressourcen testen. Nach einem Relaunch empfiehlt sich eine erneute Prüfung, auch wenn die Datei scheinbar unverändert übernommen wurde.

  • Kontrolliere den exakten Speicherort und die Erreichbarkeit ohne Weiterleitungsketten.
  • Ordne jede Regel der richtigen Bot-Gruppe zu und prüfe spezifische Gruppen getrennt.
  • Vergleiche gesperrte Pfade mit indexierbaren URLs und der XML-Sitemap.
  • Teste wichtige Seiten sowie CSS-, JavaScript-, Bild- und Dokumentdateien.
  • Überwache spätere Änderungen, damit versehentliche Sperren früh auffallen.

Ein kostenloser SEO-Check für Technik, Metadaten und Ladezeiten liefert einen ersten Überblick über technische Probleme. Bei komplexen Plattformen sollte die robots-Konfiguration zusätzlich mit Logfiles, Crawling-Daten und den tatsächlich indexierten URLs abgeglichen werden.

Technische Crawling-Steuerung prüfen lassen

Fragen zu deiner SEO-, SEA- oder GEO-Strategie? Die Online Solutions Group GmbH unterstützt bei der Analyse von Crawling, Indexierung und technischen Website-Signalen. Die Betreuung erfolgt durch Experten mit mindestens 14 Jahren Erfahrung.

Kostenlose Erstberatung

Häufige Fragen zur robots.txt

Braucht jede Website eine robots.txt?

Nein. Fehlt die Datei, dürfen regelkonforme Crawler grundsätzlich alle öffentlich erreichbaren URLs abrufen. Eine Datei ist sinnvoll, sobald bestimmte Bereiche gezielt vom Crawling ausgeschlossen oder XML-Sitemaps angegeben werden sollen.

Darf eine robots-Datei mehrere XML-Sitemaps enthalten?

Ja. Für jede XML-Sitemap kann eine eigene Sitemap-Anweisung mit der vollständigen URL ergänzt werden. Das eignet sich beispielsweise für getrennte Produkt-, Kategorie-, Bild- oder Sprach-Sitemaps.

Sind Groß- und Kleinschreibung bei robots-Regeln relevant?

Ja. URL-Pfade können zwischen Groß- und Kleinschreibung unterscheiden. Die Angaben in den Regeln sollten deshalb exakt der Schreibweise der tatsächlichen URLs entsprechen. Auch der Dateiname robots.txt wird üblicherweise vollständig kleingeschrieben.

Kann man Kommentare in die Datei einfügen?

Ja. Text nach einem Rautezeichen gilt bis zum Ende der Zeile als Kommentar. Kommentare können den Zweck einer Regel dokumentieren, sollten jedoch keine vertraulichen Informationen oder internen Zugangsdaten enthalten.

Wie schnell werden Änderungen an der robots.txt wirksam?

Änderungen werden wirksam, nachdem ein Crawler die Datei erneut abgerufen hat. Der genaue Zeitraum hängt vom jeweiligen Anbieter und dessen Zwischenspeicherung ab. Bei kritischen Änderungen sollte die Verarbeitung über verfügbare Webmaster-Werkzeuge kontrolliert werden.

Kann eine Entwicklungsumgebung allein per robots.txt geschützt werden?

Nein. Die Datei verhindert keinen direkten Zugriff und macht gesperrte Pfade öffentlich sichtbar. Entwicklungs- und Testsysteme sollten durch eine Authentifizierung, IP-Beschränkung oder serverseitige Zugriffskontrolle abgesichert werden.


Sie haben noch Fragen?

Kontaktieren Sie uns

SEO Agentur kostenlose SEO Potentialanalyse


Weitere Inhalte