robots.txt
Auch: Robots Exclusion Protocol, robots-Datei
Die robots.txt ist eine Textdatei im Stammverzeichnis einer Website, die Crawlern mitteilt, welche Bereiche sie abrufen dürfen und welche nicht.
Die robots.txt ist eine einfache Textdatei im Stammverzeichnis einer Website, etwa unter beispiel.de/robots.txt. Sie legt fest, welche Crawler welche Bereiche abrufen dürfen. Seriöse Crawler wie Googlebot, GPTBot, OAI-SearchBot oder ClaudeBot halten sich laut ihren Anbietern daran. Die Datei ist aber eine Bitte, kein technischer Schutz: Sie verhindert keinen Zugriff durch Bots, die sie ignorieren.
User-agent: GPTBot
Disallow: /
User-agent: OAI-SearchBot
Allow: /
Sitemap: https://www.beispiel.de/sitemap_index.xml
Bedeutung für KI-Sichtbarkeit
Über die robots.txt entscheiden Sie, ob KI-Systeme Ihre Inhalte für Suche, Nutzeranfragen oder Training abrufen dürfen. Wer in ChatGPT, Perplexity oder Claude als Quelle erscheinen will, sollte die Such-Crawler nicht sperren. Details im Ratgeber KI-Crawler und robots.txt und unter KI-Crawler.
Häufige Fragen
Schützt die robots.txt vor unerwünschten Zugriffen?
Nein. Sie ist eine Anweisung, an die sich seriöse Crawler halten. Einen technischen Schutz bieten nur Zugangsbeschränkungen oder Firewalls.
Verliere ich Google-Rankings, wenn ich GPTBot sperre?
Nein. GPTBot ist ein Crawler von OpenAI und hat keinen Einfluss auf die Google-Suche.