Robots.txt and AI crawlers GPTBot ClaudeBot PerplexityBot web scraping 2026

Robots.txt ist die 30 Jahre alte Textdatei, die Crawlern mitteilt, welche Bereiche einer Website sie abrufen dürfen. 2026 übernimmt sie eine Aufgabe, für die sie nie konzipiert wurde: die AI-Webwelt zu regulieren, in der Dutzende Crawler, darunter GPTBot, ClaudeBot, PerplexityBot, Google-Extended und weitere, Inhalte zum Trainieren von Modellen und zur Beantwortung von Fragen in Echtzeit abrufen. Dieser Leitfaden erklärt, was robots.txt im AI-Zeitalter kann und nicht kann, wie die Crawler-Landschaft aussieht, ob AI-Bots die Datei tatsächlich beachten, welche neueren Signale es gibt (llms.txt, Cloudflare-Steuerungen) und was all das bedeutet, unabhängig davon, ob du das Web scrapst oder eine Website betreibst, die gescrapt wird.

Ich bin Andrii Byzov, ein AI-Native Fractional CMO, der täglich mit Webdaten-Pipelines und Sichtbarkeit in der AI-Suche arbeitet. Im Folgenden findest du eine praxisnahe, für 2026 aktuelle Einordnung, einschließlich der ehrlichen Vorbehalte. Zur rechtlichen Seite siehe unseren Leitfaden Ist Web Scraping legal?; zur AI-Sichtbarkeit unseren Beitrag Rank-Tracking für die AI-Suche.


Wichtige Fakten

  • robots.txt ist freiwillig, kein Gesetz. Es handelt sich um eine Aufforderung (formalisiert als RFC 9309), die durch gutgläubige Einhaltung und Server/CDNs durchgesetzt wird, nicht durch Gesetze.
  • Training und Suche laufen heute über getrennte Crawler. Du kannst AI-Training (GPTBot, Google-Extended, ClaudeBot) blockieren und zugleich für Zitate in der AI-Suche berechtigt bleiben (OAI-SearchBot, Claude-SearchBot, PerplexityBot).
  • Echtzeit-Abrufe durch Agenten umgehen die robots.txt-Logik oft. Wenn ein Nutzer eine AI bittet, eine Seite zu lesen, ist dieser Abruf möglicherweise kein “Crawler”. robots.txt hält ihn daher unter Umständen nicht auf.
  • Die Einhaltung variiert je nach Bot. Große Crawler (Googlebot, GPTBot, ClaudeBot) beachten robots.txt in der Regel. Einige haben dies historisch nicht getan, und eine Direktive wirkt nur, wenn der Bot sich entscheidet, sie zu lesen.
  • Es gibt neue Signale: llms.txt (führt AI zu deinen besten Inhalten, etwa 10 % Verbreitung) sowie Cloudflares Steuerelemente zum Blockieren von AI und für Pay-per-Crawl auf CDN-Ebene.

Was robots.txt 2026 ist und was nicht

robots.txt ist eine Klartextdatei im Stammverzeichnis einer Domain (/robots.txt), die User-Agents und die Pfade auflistet, die sie nicht abrufen sollen. Sie wurde 2022 als RFC 9309 standardisiert, doch die Grundidee hat sich seit 1994 nicht verändert: Sie ist eine höfliche Bitte. Sie authentifiziert niemanden, blockiert keinen Zugriff auf Netzwerkebene und hat für sich genommen keine rechtliche Wirkung. Ein gut erzogener Crawler liest sie und hält sich daran; ein Crawler, der sie ignoriert, stößt durch die Datei selbst auf keine technische Barriere.

Diese Unterscheidung erzählt im AI-Zeitalter die ganze Geschichte. robots.txt regelt was konforme Bots nicht zu tun vereinbaren, sie ist kein Schloss. Die tatsächliche Durchsetzung, etwa durch Ratenbegrenzungen, Sperren oder Paywalls, erfolgt auf dem Server oder CDN, nicht in der Textdatei.

Die AI-Crawler-Landschaft

Das AI-Web wird von einer wachsenden Zahl von Akteuren gecrawlt. Die entscheidende Veränderung besteht darin, dass jeder große Anbieter Training und Such-/Antwort-Datenverkehr nun auf unterschiedliche User-Agents verteilt:

User-Agent Betreiber Zweck Beachtet robots.txt?
GPTBot OpenAI Modelltraining Ja (dokumentiert)
OAI-SearchBot OpenAI ChatGPT-Suche / Zitate Ja
ClaudeBot Anthropic Modelltraining Ja
Claude-SearchBot Anthropic Suche / Zitate Ja
Google-Extended Google Opt-out-Token für Gemini-Training Ja (nur Token)
PerplexityBot Perplexity Suche / Antworten Ja (dokumentiert)
CCBot Common Crawl Offener Datensatz (versorgt viele Modelle) Ja
Meta-ExternalAgent Meta Training / AI-Funktionen Ja

Weil Training und Suche über getrennte Agenten erfolgen, kann eine Website differenziert entscheiden: Sie kann der Nutzung für das Modelltraining widersprechen und zugleich für Zitate in AI-Antworten berechtigt bleiben, indem sie beispielsweise GPTBot blockiert, OAI-SearchBot jedoch zulässt.

Beachten AI-Crawler robots.txt tatsächlich?

Die großen Crawler tun das meistens, und du kannst es unkompliziert in deinen eigenen Server-Logs überprüfen. Googlebot, GPTBot, ClaudeBot und PerplexityBot dokumentieren ihre User-Agents und beachten Standarddirektiven. Drei ehrliche Einschränkungen sind jedoch wichtig:

  • Die Einhaltung erfolgt freiwillig. Eine Direktive wirkt nur, wenn der Bot sie liest und beachtet. Einige Crawler haben robots.txt historisch ignoriert, und ein gefälschter User-Agent kann vorgeben, alles Mögliche zu sein. Die Datei ist also eine Norm, keine Garantie.
  • Echtzeit-Abrufe durch Agenten sind eine Grauzone. Wenn jemand ChatGPT oder Perplexity bittet, eine bestimmte URL zusammenzufassen, ruft das Tool diese Seite im Auftrag des Nutzers ab. Anbieter behandeln dies häufig als nutzergesteuerten Zugriff statt als Crawling, weshalb robots.txt-Regeln für Training/Crawling möglicherweise nicht so greifen, wie Website-Betreiber erwarten.
  • Die CDN-Ebene kann deine Vorgaben übersteuern. Untersuchungen des Cloudflare-Netzwerks haben ergeben, dass ein nennenswerter Anteil der Websites große AI-Crawler auf CDN-Ebene versehentlich blockiert, obwohl ihre robots.txt “allow” angibt. Beide Ebenen müssen übereinstimmen.

Über robots.txt hinaus: llms.txt, ai.txt und Pay-per-Crawl

robots.txt regelt den Zugriff; eine neuere Datei, llms.txt, regelt die Navigation. Sie weist AI-Systeme auf deine wertvollsten, saubersten Inhalte hin. Die Verbreitung steckt noch in den Anfängen (rund 10 % der Domains), doch es ist ein risikoarmes Signal. Gleichzeitig sind CDNs hinzugekommen: Cloudflare bietet das Blockieren von AI-Crawlern mit einem Klick sowie ein Pay-per-Crawl-Modell, mit dem Publisher AI-Unternehmen den Zugriff in Rechnung stellen können. Damit verlagert sich die Diskussion von “allow/deny” hin zu “license”. Das Fazit für 2026: robots.txt ist eine Ebene in einem Stack, der inzwischen llms.txt, CDN-Steuerungen und entstehende kommerzielle Bedingungen umfasst.


Was das für dich bedeutet, wenn du das Web scrapst

Wenn du öffentliche Webdaten sammelst, behandle robots.txt als professionelle Norm, nicht als Hindernis, das es zu umgehen gilt. Die vertretbare, nachhaltige Vorgehensweise:

  • Lies und beachte robots.txt für die Pfade, auf die du zugreifst, und halte crawl-delay ein, sofern es gesetzt ist. Das ist die Grundlage gutgläubiger, ethischer Datensammlung.
  • Sammle öffentliche, schreibgeschützte Daten, umgehe keine Logins und scrape keine personenbezogenen Daten. Bleibe bei angemessenen Raten, damit du die Ziel-Website nicht beeinträchtigst. (Den rechtlichen Rahmen findest du unter Ist Web Scraping legal?.)
  • Nutze ethisch beschaffte Proxys. Seriöse Datensammlung läuft über saubere Residential IPs mit Einwilligung und eine sinnvolle Rotation, nicht über Netzwerke, die missbräuchlichen Datenverkehr verschleiern. Genau deshalb sind Proxys für Web Scraping und ihre Beschaffung wichtig.

Dass robots.txt “nur eine Bitte” ist, ist keine Erlaubnis, sie zu ignorieren. Zu den praktischen Risiken aggressiven Scrapings zählen IP-Sperren, CDN-Challenges sowie Reibungen für Reputation und Verträge, die sich durch gute Praxis vermeiden lassen.

Was das für dich bedeutet, wenn du eine Website betreibst

Triff eine bewusste Entscheidung und stelle dann sicher, dass robots.txt und dein CDN übereinstimmen:

  • Du möchtest Sichtbarkeit in der AI-Suche? Erlaube die Such-/Antwort-Agenten (OAI-SearchBot, Claude-SearchBot, PerplexityBot), damit du für Zitate berechtigt bleibst. Von AI vermittelte Besucher sind ein schnell wachsender Kanal mit hoher Kaufabsicht.
  • Du möchtest kein Trainingsmaterial liefern? Blockiere die Trainings-Crawler (GPTBot, Google-Extended, ClaudeBot), während du Such-Agenten weiterhin zulässt.
  • Überprüfe beide Ebenen. Stelle sicher, dass dein CDN nicht stillschweigend blockiert oder freigibt, was deine robots.txt vorsieht, und erwäge eine llms.txt, um Agenten zu deinen besten Seiten zu führen.
  • Teste, was Agenten tatsächlich sehen. Da AI-Antworten und Crawls geografisch personalisiert sind, zeigt dir die Prüfung deiner Website und ihrer AI-Sichtbarkeit über IPs aus verschiedenen Ländern, etwa mit Residential Proxys, das reale Bild und nicht nur deine lokale Ansicht.

FAQ

Ist robots.txt rechtlich bindend?

Nein. robots.txt (standardisiert als RFC 9309) ist eine freiwillige Aufforderung, die gut erzogene Crawler beachten. Sie hat für sich genommen keine rechtliche Wirkung und blockiert den Zugriff technisch nicht. Die tatsächliche Durchsetzung erfolgt auf dem Server oder CDN.

Kann ich AI erlauben, meine Website zu zitieren, aber nicht für Training zu nutzen?

Ja. Anbieter trennen Training und Such-Crawler inzwischen, sodass du Trainings-Agenten (GPTBot, Google-Extended, ClaudeBot) blockieren kannst, während du Such-Agenten (OAI-SearchBot, Claude-SearchBot, PerplexityBot) zulässt, die dich für Zitate in AI-Antworten berechtigen.

Folgen AI-Crawler robots.txt tatsächlich?

Die großen dokumentierten Crawler (Googlebot, GPTBot, ClaudeBot, PerplexityBot) tun es in der Regel, und du kannst dies in Server-Logs überprüfen. Die Einhaltung erfolgt jedoch freiwillig, nutzerinitiierte Echtzeit-Abrufe sind eine Grauzone und es gibt gefälschte User-Agents. Es ist also eine Norm, keine Garantie.

Was ist llms.txt und brauche ich es?

llms.txt ist eine neuere Datei, die AI-Systeme zu deinen wertvollsten Inhalten führt. robots.txt regelt den Zugriff, llms.txt die Navigation. Die Verbreitung steckt noch in den Anfängen (~10 % der Domains), doch es ist ein einfach umzusetzendes, risikoarmes Signal, das sich lohnt.

Ist es beim Scraping wichtig, robots.txt zu beachten?

Ja. Auch wenn sie rechtlich nicht bindend ist, ist das Beachten von robots.txt und crawl-delay die Grundlage für ethisches, nachhaltiges Scraping. Damit handelst du vertretbar und vermeidest Sperren, CDN-Challenges und Reputationsrisiken.


Öffentliche Webdaten auf die richtige Weise sammeln

Ganz gleich, ob du eine AI-Datenpipeline aufbaust oder überwachst, wie AI deine Marke darstellt: Ethische Datensammlung beginnt damit, Website-Signale zu beachten und mit sauberen IPs mit Einwilligung zu arbeiten. Erhalte ethisch beschaffte Residential Proxys ab $1/GB, nutzungsbasiert, in mehr als 190 Ländern und mit der geografischen Steuerung, die du zum verantwortungsvollen Testen und Sammeln brauchst.

Share article: