Wie kann man robots.txt konfigurieren?

Was ist Wie kann man robots.txt konfigurieren??

Kurzantwort

Eine robots.txt lässt sich konfigurieren, indem du zuerst den angesprochenen Crawler mit User-agent festlegst, danach mit Disallow Pfade sperrst und mit Allow Ausnahmen definierst. Am Ende folgt der vollständige Verweis auf die XML-Sitemap. Speichere die Datei als robots.txt im Wurzelverzeichnis und teste jede Änderung.

Die robots.txt steuert, welche Bereiche Suchmaschinen-Crawler abrufen dürfen. Schon eine einzelne zu weit gefasste Regel kann wichtige Kategorien, Produkte oder Ratgeber vom Crawling ausschließen. Deshalb zeigt diese Anleitung neben dem korrekten Aufbau auch die Bearbeitung in Content-Management-Systemen, die Prüfung im Browser und die häufigsten Fehler.

1. So muss eine robots.txt aussehen

Eine einfache robots.txt besteht aus mindestens zwei Zeilen: User-agent benennt den Crawler, Disallow bestimmt den gesperrten Pfad. Mehrere Regelgruppen sind möglich, wenn bestimmte Crawler andere Vorgaben erhalten sollen. Der Sitemap-Verweis steht üblicherweise am Ende und enthält eine vollständige URL.

Eine typische Datei für eine öffentlich zugängliche Unternehmenswebsite kann so aussehen:

User-agent: *
Disallow: /intern/
Disallow: /suche/
Allow: /intern/oeffentlich/

Sitemap: https://www.beispiel.de/sitemap.xml

Das Sternchen bei User-agent: * spricht alle Crawler an. Die beiden Disallow-Zeilen sperren die angegebenen Verzeichnisse. Allow gibt eine Unteradresse innerhalb eines gesperrten Bereichs wieder frei. Eine leere Anweisung Disallow: bedeutet dagegen, dass nichts gesperrt wird.

Merksatz für den Aufbau

Eine Regelgruppe beginnt immer mit dem angesprochenen Crawler. Danach folgen Sperren und Ausnahmen. Der Verweis auf die XML-Sitemap steht separat und verwendet eine vollständige Adresse einschließlich Protokoll und Domain.

1.1 Regeln für bestimmte Crawler

Soll nur ein bestimmter Bot angesprochen werden, trägst du dessen Kennung statt des Sternchens ein. Für den Googlebot könnte eine eigene Gruppe beispielsweise so beginnen:

User-agent: Googlebot
Disallow: /testbereich/

Separate Gruppen sind nur sinnvoll, wenn ein konkreter Grund vorliegt. Je mehr Sonderregeln eine Datei enthält, desto schwieriger wird die Kontrolle. Für viele KMU-Websites reicht eine einzige Gruppe für alle Crawler. Spezifische Gruppen kommen eher bei großen Shops, facettierten Navigationen oder technisch erzeugten URL-Beständen zum Einsatz.

2. Bedeutung der wichtigsten Anweisungen

AnweisungFunktionBeispiel
User-agentLegt fest, für welchen Crawler die nachfolgenden Regeln gelten.User-agent: *
DisallowSperrt einen Pfad oder ein Verzeichnis für das Crawling.Disallow: /warenkorb/
AllowErlaubt einen Teilbereich innerhalb eines gesperrten Pfads.Allow: /ordner/datei.pdf
SitemapTeilt Crawlern die Adresse der XML-Sitemap mit.Sitemap: https://www.beispiel.de/sitemap.xml
#Kennzeichnet einen Kommentar, den Crawler ignorieren.# Interner Suchbereich

Pfade werden ab dem Anfang der URL nach der Domain ausgewertet. Disallow: /shop/ betrifft daher Adressen wie https://www.beispiel.de/shop/produkt-a/. Die Domain selbst gehört nicht in eine Disallow-Zeile. Beim Sitemap-Eintrag ist dagegen die vollständige URL erforderlich.

Achte außerdem auf Groß- und Kleinschreibung. Die Pfade /Shop/ und /shop/ können auf einem Server unterschiedliche Ziele bezeichnen. Kopiere den gewünschten Pfad deshalb direkt aus der Browserzeile und prüfe die Regel anschließend mit mehreren Beispiel-URLs.

3. robots.txt einfügen und bearbeiten

Bei einer selbst verwalteten Website legst du eine reine Textdatei mit dem exakten Namen robots.txt im Wurzelverzeichnis der Domain ab. Sie muss danach unter https://www.beispiel.de/robots.txt erreichbar sein. Eine Datei in /assets/, /uploads/ oder einem anderen Unterordner erfüllt diesen Zweck nicht.

3.1 Bearbeitung über ein SEO-Plugin

Bei WordPress und anderen Redaktionssystemen lässt sich die robots.txt häufig über ein SEO-Plugin oder die technischen Website-Einstellungen bearbeiten. Das ist meist der sauberste Weg, weil das System die Datei an der richtigen Adresse ausliefert. Vor der Änderung solltest du den bisherigen Inhalt kopieren und als Sicherung ablegen.

Ein Detail führt regelmäßig zu unnötiger Fehlersuche: Manche Content-Management-Systeme erzeugen eine virtuelle robots.txt. Sie ist im Browser erreichbar, liegt aber nicht als physische Datei auf dem Webspace. Wenn du per FTP oder Dateimanager keine Datei findest, bedeutet das deshalb nicht automatisch, dass keine robots.txt vorhanden ist. Prüfe zuerst den Browseraufruf und danach die Plugin-Einstellungen.

3.2 Datei direkt auf dem Server anlegen

Ohne entsprechende CMS-Funktion erstellst du die Datei in einem Texteditor und lädst sie in das Stammverzeichnis der Domain. Verwende reinen Text ohne Formatierungen. Programme für Textverarbeitung können unsichtbare Zeichen oder ein zusätzliches Dateiformat einfügen. Kontrolliere außerdem, dass die Datei nicht versehentlich robots.txt.txt heißt.

  • Lege vor der Bearbeitung eine Kopie der bestehenden Datei an.
  • Verwende pro Anweisung eine eigene Zeile.
  • Prüfe die Datei auf der richtigen Domain und dem richtigen Protokoll.
  • Teste nach dem Upload mehrere erlaubte und gesperrte Beispiel-URLs.

4. robots.txt im Browser aufrufen

Die robots.txt-Datei lässt sich direkt aufrufen, indem du /robots.txt an die Domain anhängst. Für https://www.beispiel.de lautet die Adresse also https://www.beispiel.de/robots.txt. Der Browser sollte den Inhalt als einfachen Text anzeigen und mit dem HTTP-Statuscode 200 ausliefern.

Prüfe jede relevante Variante deiner Website. Subdomains besitzen eigene Dateien. Eine robots.txt unter www.beispiel.de gilt nicht automatisch für shop.beispiel.de. Auch Entwicklungsumgebungen und internationale Subdomains benötigen bei Bedarf eine eigene Konfiguration.

5. robots.txt testen und Bericht anzeigen

Eine Sichtprüfung reicht nach Änderungen nicht aus. Ein fehlender Schrägstrich kann aus einer geplanten Einzelseitensperre eine Sperre für einen ganzen URL-Bereich machen. Lege deshalb vor dem Test mindestens drei wichtige URLs, drei bewusst gesperrte URLs und eine Ausnahme innerhalb eines gesperrten Verzeichnisses fest.

Der Technik-Crawler der Performance Suite prüft täglich mehr als 100 technische SEO-Faktoren. Dazu gehören robots.txt, Sitemaps und Statuscodes. Der Crawl macht unmittelbar sichtbar, welche Bereiche durch die Datei ausgeschlossen werden. Zusätzlich bezieht das 360-Grad-Crawler-Konzept URLs aus Quellen wie der Google Search Console, Google Ads und Backlink-Zielen ein. So fallen auch wichtige Adressen auf, die intern nicht sauber verlinkt sind.

Technik Crawler Performance Suite

Der unangenehme robots.txt-Fehler ist selten eine komplizierte Regel. Häufig steht nach einem Relaunch oder während einer technischen Umstellung noch User-agent: * mit Disallow: / in der Datei. Diese zwei Zeilen schließen die komplette Website vom Crawling aus. Weil die Website für Besucher weiterhin normal funktioniert, bleibt der Fehler ohne automatischen Crawl leicht über Wochen oder Monate unbemerkt. Prüfe nach jedem Livegang zuerst die Startseite und mehrere umsatzrelevante Unterseiten aus Sicht des Crawlers.

5.1 Sitechecker Robots.txt-Tester verwenden

Im Robots.txt-Tester von Sitechecker gibst du die Domain oder den Inhalt der Datei ein und lässt die Syntax analysieren. Prüfe danach konkrete URLs gegen einen ausgewählten User-Agent. Ein grüner Syntaxcheck allein genügt nicht: Eine formal gültige Regel kann fachlich trotzdem die falsche Kategorie sperren. Entscheidend ist das Ergebnis für echte URLs deiner Website.

5.2 robots.txt-Bericht aufrufen

In der Google Search Console kannst du für bestätigte Properties den robots.txt-Bericht aufrufen. Er zeigt, welche Datei Google zuletzt abgerufen hat und ob beim Abruf Fehler aufgetreten sind. Da sich Menüpunkte ändern können, findest du den Bericht am zuverlässigsten über die Suche in der Search Console oder im Bereich der Crawling-Einstellungen.

Wenn du die technische Ausgangslage regelmäßig kontrollieren möchtest, kannst du einen Free Account anlegen und die Domain prüfen lassen.

Free Account anlegen

6. Drei Praxisregeln für 2026

6.1 Sperren so sparsam wie möglich

Eine robots.txt sollte nur Bereiche ausschließen, die Crawler wirklich nicht abrufen müssen. Typische Kandidaten sind interne Suchergebnisse, bestimmte Filterkombinationen oder technische Hilfsverzeichnisse. Produktkategorien, redaktionelle Inhalte, Bilder und JavaScript-Dateien solltest du nicht pauschal sperren, wenn sie für Darstellung, interne Verlinkung oder organische Rankings benötigt werden.

Bei großen Onlineshops kippt die Konfiguration oft an Filterregeln. Ein Eintrag gegen einen Parameter soll tausende wertlose Kombinationen reduzieren, trifft durch eine ungenaue Schreibweise aber auch indexierbare Kategorievarianten. Teste vor der Veröffentlichung deshalb nicht nur eine URL. Erstelle eine kleine Matrix aus erlaubten und gesperrten Pfaden und prüfe jede Zeile einzeln.

robots.txt ist kein Zugriffsschutz

Gesperrte URLs bleiben öffentlich aufrufbar und die robots.txt ist für jeden lesbar. Vertrauliche Dokumente, Kundenbereiche oder Testsysteme gehören daher hinter eine Anmeldung, eine Server-Authentifizierung oder eine andere technische Zugangsbeschränkung. Trage sensible Pfade nicht als vermeintlichen Schutz in eine öffentliche Liste ein.

6.2 Indexierung auf der Seite steuern

Anweisungen zur Nichtaufnahme in den Suchindex gehören nicht in die robots.txt. Verwende dafür ein noindex im Meta-Robots-Tag oder einen entsprechenden X-Robots-Tag im HTTP-Header. Der Crawler muss die URL abrufen dürfen, damit er diese Anweisung lesen kann. Wird dieselbe Seite gleichzeitig per robots.txt blockiert, kann das noindex wirkungslos bleiben.

6.3 Änderungen immer gegenprüfen

Nach jeder Bearbeitung lautet die wichtigste Frage: Kann ein Crawler weiterhin alle Seiten erreichen, die organischen Traffic, Leads oder Umsatz erzeugen sollen? Prüfe mindestens die Startseite, zentrale Kategorien, wichtige Leistungsseiten und aktuelle Ratgeber. Bei einem Shop gehören zusätzlich Produkte, Bilder und benötigte Ressourcen in die Stichprobe.

Für eine breitere technische Prüfung kannst du den kostenlosen SEO-Check nutzen. Er analysiert unter anderem technische Signale, Ladezeiten und Metadaten für bis zu 20 Unterseiten.

Mit Nutzung dieses SEO-Checks erklären Sie, dass Sie die Datenschutzerklärung zur Kenntnis genommen haben und damit einverstanden sind, dass die von Ihnen angegebenen Daten elektronisch erhoben und gespeichert werden. Ihre Daten werden dabei nur streng zweckgebunden zur Bearbeitung des SEO-Checks benutzt. Mit der Nutzung dieses SEO-Checks erklären Sie sich mit der Verarbeitung einverstanden.

7. So gehen wir vor

Bei einer technischen Prüfung lesen wir die robots.txt nicht nur Zeile für Zeile. Wir gleichen die Regeln mit den tatsächlich wichtigen URL-Gruppen ab und crawlen anschließend erneut. Besondere Aufmerksamkeit erhalten rankende Seiten, SEA-Landingpages, Backlink-Ziele und URLs mit organischem Traffic. So richtet sich die Priorität nach der geschäftlichen Wirkung und nicht allein nach der Anzahl blockierter Adressen.

Zusammenarbeit mit der SEO Agentur

Wenn du die technische Steuerung nicht selbst übernehmen möchtest, kann die OSG die robots.txt im Rahmen der professionellen Onpage-Optimierung prüfen und konfigurieren. Du behältst dabei Einblick in die Maßnahmen und siehst im Crawl, welche Bereiche erreichbar oder ausgeschlossen sind.

8. Häufige Fragen zur robots.txt

Wo muss die robots.txt-Datei liegen?

Die Datei muss im Wurzelverzeichnis der jeweiligen Domain liegen und unter domain.de/robots.txt erreichbar sein. Eine Datei in einem Unterordner wird von Crawlern nicht als zentrale robots.txt der Domain erkannt.

Wie sieht eine leere robots.txt aus?

Wenn alle Bereiche gecrawlt werden dürfen, kannst du User-agent: * und eine leere Disallow-Anweisung verwenden. Auch eine vollständig leere erreichbare Datei blockiert keine Pfade.

Braucht jede Website eine robots.txt?

Eine robots.txt ist nicht für jede Website zwingend erforderlich. Sie ist sinnvoll, sobald bestimmte Pfade gesteuert, unnötige URL-Bereiche ausgeschlossen oder die Adresse der XML-Sitemap zentral angegeben werden sollen.

Kann ich die robots.txt in WordPress bearbeiten?

Ja, häufig lässt sich die robots.txt über ein SEO-Plugin bearbeiten. WordPress kann außerdem eine virtuelle Datei erzeugen, die im Browser sichtbar ist, obwohl sie nicht als physische Datei auf dem Server liegt.

Verhindert Disallow die Indexierung einer Seite?

Disallow verhindert zunächst den Abruf durch den angesprochenen Crawler. Eine URL kann trotzdem als Adresse im Suchindex erscheinen, wenn Suchmaschinen sie über externe oder interne Links kennen. Für den Ausschluss aus dem Index ist eine lesbare noindex-Anweisung erforderlich.

Wie prüfe ich, ob eine URL blockiert ist?

Rufe zuerst die robots.txt im Browser auf und teste danach die konkrete URL mit einem Robots.txt-Tester oder Technik-Crawler. Prüfe dabei den richtigen User-Agent, weil verschiedene Crawler unterschiedliche Regelgruppen erhalten können.

Wie schnell werden Änderungen an der robots.txt erkannt?

Änderungen gelten für Crawler, sobald sie die Datei erneut abrufen. Der Zeitpunkt hängt von der Crawl-Frequenz der Suchmaschine ab. Kontrolliere deshalb den Abrufbericht und behalte wichtige URLs nach der Änderung technisch im Monitoring.

9. Fazit: Erst prüfen, dann freigeben

Eine gute robots.txt ist meist kurz. Sie benennt den Crawler, sperrt nur klar abgegrenzte Bereiche, erlaubt notwendige Ausnahmen und verweist auf die Sitemap. Behandle jede Änderung wie eine technische Veröffentlichung: mit Sicherung, URL-Stichprobe und anschließendem Crawl. Gerade die unscheinbarste Datei einer Website kann sonst einen sehr großen Teil der SEO-Sichtbarkeit beeinflussen.

Wenn du unsicher bist, welche Regeln zu deiner Website passen, kannst du die Konfiguration in einem kostenlosen und unverbindlichen Erstgespräch prüfen lassen.

Kostenlosen Potenzialcheck sichern

SEO Agentur kostenlose SEO Potentialanalyse



Weitere Inhalte


Keine Kommentare vorhanden


Du hast eine Frage oder eine Meinung zum Artikel? Teile sie mit uns!

Deine E-Mail-Adresse wird nicht veröffentlicht. Erforderliche Felder sind markiert *

*
*