Was ist die robots.txt?

Kurzantwort
Die robots.txt ist eine öffentlich lesbare Textdatei im Wurzelverzeichnis einer Website. Sie legt fest, welche Bereiche Suchmaschinen-Crawler abrufen dürfen. Eine Sperre verhindert jedoch nur das Crawling, nicht zwingend die Indexierung. Blockierte URLs können deshalb weiterhin ohne Beschreibung in den Suchergebnissen erscheinen.
Die robots.txt steuert den Zugriff automatisierter Crawler auf deine Website. Sie ist für Onlineshops, Unternehmensseiten, WordPress-Installationen und Frontend-Frameworks relevant. Besonders wichtig ist die Abgrenzung zwischen Crawling und Indexierung, denn eine falsche Regel kann wertvolle Seiten für Suchmaschinen unlesbar machen.
1. robots.txt im SEO-Kontext
Die robots.txt liegt normalerweise unter https://www.deine-domain.de/robots.txt. Suchmaschinen rufen diese Adresse auf, bevor sie weitere Inhalte der Domain crawlen. Die darin enthaltenen Regeln können für alle Crawler oder für einzelne Bots gelten.
Im SEO steuert die Datei vor allem, welche Verzeichnisse ein Suchmaschinen-Crawler abrufen soll. Typische Kandidaten für eine Sperre sind interne Suchergebnisse, technische Filterkombinationen, Warenkorbseiten oder Bereiche ohne eigenständigen Suchwert. Wichtige Landingpages, Bilder, JavaScript-Dateien und CSS-Dateien sollten erreichbar bleiben, wenn sie zur Darstellung und Bewertung einer Seite benötigt werden.
Im Zweifel weniger sperren
Eine kurze robots.txt ist meist sicherer als eine umfangreiche Sammlung historisch gewachsener Regeln. Sperre nur Verzeichnisse, deren Funktion und SEO-Auswirkung du kennst. Eine unnötige Freigabe lässt sich später korrigieren. Eine versehentliche Sperre wichtiger Inhalte kann dagegen Rankings und organischen Traffic beeinträchtigen.
2. Was eine Blockierung bedeutet
Die Meldung „Durch robots.txt-Datei blockiert“ bedeutet, dass ein Suchmaschinen-Crawler die betreffende URL nicht abrufen darf. Google kennt die Adresse möglicherweise trotzdem, etwa durch interne Links, eine XML-Sitemap oder externe Backlinks. Die URL kann deshalb im Index verbleiben oder neu aufgenommen werden, obwohl ihr Inhalt nicht gelesen wurde.
Genau an dieser Stelle kippt eine vermeintliche Aufräummaßnahme häufig in ein SEO-Problem. Eine Seite erhält zuerst noindex und wird gleichzeitig per robots.txt gesperrt. Der Crawler darf die Seite anschließend nicht mehr öffnen und kann die Anweisung noindex somit nicht lesen. Im Suchergebnis bleibt unter Umständen eine URL ohne aussagekräftigen Seitentitel oder Beschreibung stehen. Für eine saubere Entfernung muss der Crawler die Seite zunächst erreichen können.
Blockiert bedeutet nicht geschützt
Die robots.txt ist kein Zugriffsschutz. Gesperrte Inhalte bleiben über ihre URL öffentlich erreichbar, und die Datei selbst kann jeder Besucher öffnen. Wer dort Verzeichnisse wie /geheime-vertraege/ oder /interne-daten/ einträgt, veröffentlicht deren Pfade. Vertrauliche Inhalte gehören hinter eine Anmeldung oder eine serverseitige Zugriffskontrolle.
2.1 Blockierte URL aus Google entfernen
Wenn eine Seite nicht in Suchergebnissen erscheinen soll, muss die gewählte Methode zum Ziel passen. Für eine bestehende Seite eignet sich ein noindex-Meta-Tag oder ein entsprechender X-Robots-Tag im HTTP-Header. Die URL muss dafür crawlbar sein. Dauerhaft gelöschte Inhalte sollten einen passenden Statuscode wie 404 oder 410 liefern. Vertrauliche Inhalte brauchen eine Authentifizierung.
3. Was in die robots.txt gehört
Für viele Websites reichen wenige Zeilen. Ein pauschales Sperren der gesamten Domain ist im Livebetrieb fast nie sinnvoll. Die Datei sollte alle relevanten Seiten und Ressourcen zugänglich lassen, gezielte Ausnahmen definieren und auf die XML-Sitemap verweisen.
User-agent: *Disallow: /interne-suche/Disallow: /warenkorb/Allow: /Sitemap: https://www.deine-domain.de/sitemap.xml| Anweisung | Bedeutung | Beispiel |
|---|---|---|
User-agent | Bestimmt, für welchen Crawler die folgenden Regeln gelten. | User-agent: * |
Disallow | Schließt einen Pfad vom Crawling aus. | Disallow: /interne-suche/ |
Allow | Erlaubt einen Unterbereich innerhalb eines gesperrten Pfades. | Allow: /filter/marke/ |
Sitemap | Verweist auf die XML-Sitemap der Website. | Sitemap: https://domain.de/sitemap.xml |
3.1 Was ist der robots.txt-Code?
Der robots.txt-Code besteht aus einfachen Textanweisungen. Er ist weder HTML noch JavaScript und benötigt keine besondere Dateistruktur. Regeln werden zeilenweise geschrieben. Mit # lassen sich Kommentare ergänzen. Pfade sollten exakt geprüft werden, da bereits ein zusätzlicher Schrägstrich oder eine zu breit formulierte Regel einen anderen Bereich erfassen kann als geplant.
Ein besonders gefährlicher Eintrag lautet:
User-agent: *Disallow: /Diese zwei Zeilen verbieten allen angesprochenen Crawlern den Abruf der gesamten Website. Die Regel ist in einer abgeschirmten Entwicklungsumgebung denkbar, sollte aber vor dem Livegang entfernt werden. Bei Relaunches gehört die robots.txt deshalb auf jede technische Abnahmeliste. Eine ausführliche Orientierung bietet unsere SEO-Checkliste für den Website-Relaunch.

4. Welche Bereiche du freigibst
Ob ein Verzeichnis gesperrt werden sollte, hängt von seinem Suchwert und der technischen Funktion ab. Produktseiten, Kategorien, redaktionelle Inhalte und benötigte Ressourcen bleiben normalerweise crawlbar. Interne Suchergebnisse, endlose Kalenderpfade oder technisch erzeugte Filterkombinationen können dagegen unnötig viele Crawling-Aufrufe verursachen.
Bei Onlineshops sehen wir oft eine einzige Regel, die ursprünglich nur interne Filterseiten treffen sollte, später aber eine komplette Produktgruppe einschließt. Der Fehler fällt in einem Browser nicht auf, denn die Seiten funktionieren weiterhin. Erst ein Crawl aus Sicht des Suchmaschinen-Bots zeigt, dass zentrale URLs nicht erreichbar sind. Genau deshalb sollte jede Änderung an der Datei mit einer Liste der betroffenen URLs geprüft werden.
Wenn du sehen möchtest, wie ein Crawler deine Domain technisch erfasst, kannst du einen Free Account anlegen:
5. robots.txt in WordPress
WordPress kann eine virtuelle robots.txt erzeugen. Die Datei muss dann nicht zwingend als physische Textdatei auf dem Server liegen, ist aber trotzdem unter /robots.txt erreichbar. SEO-Plugins oder Hosting-Funktionen können den Inhalt ergänzen und verändern.
Öffne zuerst die öffentliche Adresse der Datei und prüfe anschließend, wo ihre Regeln erzeugt werden. Eine manuell hochgeladene Datei kann die virtuelle WordPress-Version überschreiben. Gleichzeitig können Plugin-Wechsel oder Migrationen Regeln verändern. Entscheidend ist immer die ausgelieferte Version, nicht die Ansicht in einem Verwaltungsmenü.
5.1 WordPress richtig prüfen
Ein häufiger WordPress-Kipppunkt ist die Option, Suchmaschinen vom Indexieren der Website abzuhalten. Sie ist für Entwicklungsphasen gedacht, wird nach dem Livegang aber gelegentlich übersehen. Die Startseite funktioniert dann für Besucher, während Suchmaschinen klare Sperrsignale erhalten. Der öffentliche Abruf der robots.txt und ein anschließender Crawl gehören deshalb zur Abnahme.
6. robots.txt in React
Bei React-Projekten liegt die Datei üblicherweise im öffentlichen Verzeichnis des Projekts, häufig unter public/robots.txt. Beim Build wird sie in das Wurzelverzeichnis der veröffentlichten Website kopiert. Nach dem Deployment muss sie unter https://deine-domain.de/robots.txt erreichbar sein.
Die Regeln unterscheiden sich nicht von denen einer WordPress- oder klassischen HTML-Seite. Relevant ist die Auslieferung. Single-Page-Anwendungen können Routen clientseitig erzeugen, während der Server für diese Pfade keine passende Antwort liefert. Die robots.txt behebt dieses Rendering- oder Routing-Problem nicht. Sie entscheidet nur, ob ein Crawler die Adresse abrufen darf.
React-Check nach dem Build
Prüfe die robots.txt immer auf der produktiven Domain. Eine korrekte Datei im Quellcode reicht nicht, wenn sie beim Build fehlt, unter einer falschen Adresse landet oder durch Regeln des Webservers überschrieben wird. Teste zusätzlich mindestens eine freigegebene und eine gesperrte Route.
7. Wirkung der Regeln prüfen
Eine Sichtprüfung reicht bei größeren Websites selten aus. Eine Regel wie Disallow: /shop/ ist leicht zu verstehen. Komplex wird es, wenn mehrere Benutzergruppen, Ausnahmen, Parameter und ältere Einträge zusammenkommen. Dann brauchst du eine Auswertung, die konkrete URLs gegen die ausgelieferte Datei prüft.
Der Technik-Crawler der Performance Suite kontrolliert pro Durchlauf mehr als 100 technische Punkte und zeigt unter anderem robots.txt, Sitemap, Statuscodes und den zeitlichen Verlauf technischer Werte. Dadurch wird unmittelbar sichtbar, welche Bereiche vom Crawl ausgeschlossen werden und ob sich die technische Lage nach einer Änderung verbessert oder verschlechtert.
Für eine erste Bestandsaufnahme kannst du außerdem den kostenlosen SEO-Check für deine Website nutzen. Er prüft technische Grundlagen, Metadaten, Ladezeiten und Backlinks für bis zu 20 Unterseiten.
8. So gehen wir vor
Bei der OSG prüfen wir zuerst die tatsächlich ausgelieferte robots.txt und gleichen ihre Regeln mit Sitemap, interner Verlinkung und crawlbaren URLs ab. Danach priorisieren wir nach SEO-Wirkung: Eine gesperrte Kategorie mit Rankings ist dringlicher als zahlreiche technische URLs ohne Suchwert. Änderungen werden erneut gecrawlt, damit die Wirkung direkt kontrollierbar bleibt.
Die technische Analyse ist Teil unserer SEO-Audits und der laufenden SEO-Betreuung. Der Technik-Crawl der Performance Suite zeigt Kunden und fester Ansprechperson dieselben Befunde. Dadurch bleibt nachvollziehbar, welche Regel angepasst wurde und welche URLs davon betroffen sind.
9. Häufige Fragen zur robots.txt
Wo finde ich die robots.txt-Datei?
Die Datei ist normalerweise unter deine-domain.de/robots.txt erreichbar. Sie muss im Wurzelverzeichnis des jeweiligen Hosts ausgeliefert werden, damit Suchmaschinen sie zuverlässig finden.
Kann eine blockierte Seite bei Google erscheinen?
Ja. Eine Crawling-Sperre verhindert nicht zwingend die Indexierung. Kennt Google die URL aus Links oder einer Sitemap, kann sie ohne gelesenen Inhalt und damit ohne aussagekräftige Beschreibung im Suchergebnis erscheinen.
Was muss in einer robots.txt stehen?
Für viele Websites genügen Regeln für gezielt ausgeschlossene Bereiche und ein Verweis auf die XML-Sitemap. Wichtige Landingpages und benötigte technische Ressourcen sollten normalerweise freigegeben bleiben.
Kann ich mit der robots.txt geheime Seiten schützen?
Nein. Die Datei ist öffentlich lesbar und die aufgeführten URLs bleiben direkt erreichbar. Vertrauliche Inhalte müssen durch eine Anmeldung oder eine serverseitige Zugriffskontrolle geschützt werden.
Wie entferne ich eine Seite aus dem Google-Index?
Lass die URL crawlbar und verwende ein noindex-Signal, wenn die Seite weiterhin erreichbar bleiben soll. Gelöschte Inhalte sollten einen passenden Statuscode liefern. Eine robots.txt-Sperre allein ist dafür ungeeignet.
Wo liegt die robots.txt bei WordPress?
WordPress erzeugt häufig eine virtuelle Datei, die trotzdem unter der öffentlichen Adresse deine-domain.de/robots.txt erreichbar ist. Plugins oder eine physische Datei im Wurzelverzeichnis können ihren Inhalt verändern.
Wo gehört die robots.txt in einem React-Projekt hin?
Sie liegt üblicherweise als robots.txt im öffentlichen Projektverzeichnis. Nach dem Build muss sie direkt im Wurzelverzeichnis der produktiven Domain erreichbar sein.
10. Weniger Regeln, klarere Kontrolle
Behandle jede robots.txt-Regel wie eine technische Änderung mit messbarer Reichweite. Prüfe vor der Veröffentlichung, welche konkreten URLs betroffen sind, und führe danach einen neuen Crawl durch. Wenn du bei einem Verzeichnis unsicher bist, lass es zunächst erreichbar. Crawling lässt sich gezielt steuern, ein versehentlicher Ausschluss wichtiger Seiten kostet dagegen Zeit und SEO-Sichtbarkeit.
Wenn du prüfen möchtest, ob deine robots.txt wichtige Inhalte ausschließt, analysieren wir deine Domain im kostenlosen Erstgespräch. Der Potenzialcheck ist unverbindlich und kein Verkaufsgespräch.








Keine Kommentare vorhanden