robots.txt Die robots.txt ist eine Textdatei im Wurzelverzeichnis, die Bots mitteilt, welche Bereiche einer Website sie abrufen dürfen. Sie steuert das Abrufen, nicht die Indexierung: Eine per robots.txt gesperrte Seite kann trotzdem in Suchergebnissen erscheinen, wenn andere Seiten auf sie verweisen. Wer eine Seite aus dem Index halten will, braucht stattdessen ein noindex-Meta-Tag – das aber nur wirkt, wenn die Seite abgerufen werden darf.
Kurz-Fakten
Seit 2022 als RFC 9309 spezifiziert
Steuert das Abrufen, nicht die Indexierung
Muss unter /robots.txt liegen, Unterverzeichnisse gelten nicht
Wird von Bots freiwillig beachtet; es gibt keine technische Durchsetzung
Bedeutung in der Praxis
Der häufigste Fehler ist die Kombination aus Disallow und noindex auf derselben Seite. Sie hebt sich gegenseitig auf: Ist der Abruf gesperrt, wird das noindex nie gelesen.
Der zweithäufigste Fehler ist ein vergessenes „Disallow: /“ aus der Entwicklungsphase. Es hält eine fertige Website monatelang unsichtbar, ohne dass irgendwo eine Fehlermeldung erscheint.
Inhaber von SEO NW in Bertingen, entwickelt SEO CMS und betreut damit Verzeichnis-, Wissens- und Ratgeberportale im deutschsprachigen Raum. Schwerpunkt: technisches SEO, strukturierte Daten und die Frage, unter welchen Bedingungen Sprachmodelle einen Inhalt übernehmen.