Lexikon

robots.txt

Auch: Robots Exclusion Protocol, robots-Datei

Die robots.txt ist eine Textdatei im Stammverzeichnis einer Website, die Crawlern mitteilt, welche Bereiche sie abrufen dürfen und welche nicht.

von Benjamin Kaim Aktualisiert:

Die robots.txt ist eine einfache Textdatei im Stammverzeichnis einer Website, etwa unter beispiel.de/robots.txt. Sie legt fest, welche Crawler welche Bereiche abrufen dürfen. Seriöse Crawler wie Googlebot, GPTBot, OAI-SearchBot oder ClaudeBot halten sich laut ihren Anbietern daran. Die Datei ist aber eine Bitte, kein technischer Schutz: Sie verhindert keinen Zugriff durch Bots, die sie ignorieren.

User-agent: GPTBot
Disallow: /

User-agent: OAI-SearchBot
Allow: /

Sitemap: https://www.beispiel.de/sitemap_index.xml

Bedeutung für KI-Sichtbarkeit

Über die robots.txt entscheiden Sie, ob KI-Systeme Ihre Inhalte für Suche, Nutzeranfragen oder Training abrufen dürfen. Wer in ChatGPT, Perplexity oder Claude als Quelle erscheinen will, sollte die Such-Crawler nicht sperren. Details im Ratgeber KI-Crawler und robots.txt und unter KI-Crawler.

Häufige Fragen

Schützt die robots.txt vor unerwünschten Zugriffen?

Nein. Sie ist eine Anweisung, an die sich seriöse Crawler halten. Einen technischen Schutz bieten nur Zugangsbeschränkungen oder Firewalls.

Verliere ich Google-Rankings, wenn ich GPTBot sperre?

Nein. GPTBot ist ein Crawler von OpenAI und hat keinen Einfluss auf die Google-Suche.