In this Article
Robots.txt est le fichier texte vieux de 30 ans qui indique aux crawlers quelles parties d’un site ils peuvent explorer. En 2026, il remplit une fonction pour laquelle il n’a jamais été conçu : encadrer le web de l’IA, où des dizaines de crawlers – GPTBot, ClaudeBot, PerplexityBot, Google-Extended et d’autres – collectent du contenu pour entraîner des modèles et répondre aux questions en temps réel. Ce guide explique ce que robots.txt peut et ne peut pas faire à l’ère de l’IA, le paysage des crawlers, si les bots d’IA le respectent réellement, les nouveaux signaux (llms.txt, les contrôles Cloudflare), et ce que tout cela signifie, que vous scrapiez le web ou que vous exploitiez un site dont le contenu est scrapé.
Je suis Andrii Byzov, AI-Native Fractional CMO, et je travaille chaque jour avec des pipelines de données web et la visibilité dans la recherche IA. Vous trouverez ci-dessous un point de vue pratique et à jour pour 2026, avec les réserves nécessaires. Pour l’aspect juridique, consultez notre guide is web scraping legal ; pour la visibilité IA, notre article AI search rank tracking.
Faits clés
- robots.txt est volontaire, pas une loi. C’est une demande, formalisée par la RFC 9309, dont le respect dépend de la bonne foi des opérateurs et des règles appliquées par les serveurs et les CDN, non de la loi.
- L’entraînement et la recherche utilisent désormais des crawlers distincts. Vous pouvez bloquer l’entraînement IA (GPTBot, Google-Extended, ClaudeBot) tout en restant éligible aux citations dans la recherche IA (OAI-SearchBot, Claude-SearchBot, PerplexityBot).
- Les récupérations en temps réel par des agents contournent souvent la logique de robots.txt. Lorsqu’un utilisateur demande à une IA de lire une page, cette récupération n’est sans doute pas un ” crawler ” – robots.txt peut donc ne pas l’empêcher.
- La conformité varie selon le bot. Les principaux crawlers (Googlebot, GPTBot, ClaudeBot) respectent généralement robots.txt ; historiquement, certains ne l’ont pas fait – et une directive ne fonctionne que si le bot choisit de la lire.
- De nouveaux signaux existent : llms.txt (oriente l’IA vers vos meilleurs contenus, adoption d’environ 10 %), ainsi que les contrôles de blocage de l’IA et de paiement par crawl de Cloudflare au niveau CDN.
Ce qu’est robots.txt – et ce qu’il n’est pas – en 2026
robots.txt est un fichier texte brut situé à la racine d’un domaine (/robots.txt) qui répertorie les user-agents et les chemins qu’il leur est demandé de ne pas récupérer. Il a été standardisé dans la RFC 9309 en 2022, mais l’idée centrale n’a pas changé depuis 1994 : c’est une demande polie. Il n’authentifie personne, ne bloque pas l’accès au niveau du réseau et n’a aucune force juridique en soi. Un crawler bien comporté le lit et s’y conforme ; un crawler qui l’ignore ne rencontre aucune barrière technique créée par le fichier lui-même.
Cette distinction résume tout à l’ère de l’IA. robots.txt régit ce que les bots respectueux acceptent de ne pas faire – ce n’est pas un verrou. L’application réelle des règles (limitation de débit, blocage, paywalls) se fait au niveau du serveur ou du CDN, pas dans le fichier texte.
Le paysage des crawlers IA
Le Web de l’IA est exploré par un nombre croissant d’acteurs, et l’évolution importante est que chaque grand fournisseur sépare désormais le trafic de training du trafic de recherche/réponse dans différents user-agents :
| User-agent | Opérateur | Objectif | Respecte robots.txt ? |
|---|---|---|---|
| GPTBot | OpenAI | Entraînement de modèles | Oui (documenté) |
| OAI-SearchBot | OpenAI | Recherche ChatGPT / citations | Oui |
| ClaudeBot | Anthropic | Entraînement de modèles | Oui |
| Claude-SearchBot | Anthropic | Recherche / citations | Oui |
| Google-Extended | Indicateur d’exclusion pour l’entraînement de Gemini | Oui (jeton uniquement) | |
| PerplexityBot | Perplexity | Recherche / réponses | Oui (documenté) |
| CCBot | Common Crawl | Jeu de données ouvert (alimente de nombreux modèles) | Oui |
| Meta-ExternalAgent | Meta | Entraînement / fonctionnalités IA | Oui |
Comme l’entraînement et la recherche utilisent des agents séparés, un site peut faire un choix nuancé : refuser que son contenu serve à entraîner des modèles tout en restant éligible aux citations dans les réponses IA – par exemple, bloquer GPTBot mais autoriser OAI-SearchBot.
Les crawlers IA respectent-ils vraiment robots.txt ?
Dans l’ensemble, les grands acteurs le font – et c’est facile à vérifier dans vos propres journaux serveur. Googlebot, GPTBot, ClaudeBot et PerplexityBot documentent leurs user-agents et respectent les directives standard. Mais trois réserves honnêtes sont importantes :
- La conformité repose sur l’adhésion volontaire. Une directive ne fonctionne que si le bot la lit et la respecte. Certains crawlers ont historiquement ignoré robots.txt, et un user-agent usurpé peut prétendre être n’importe quoi – le fichier est donc une norme, pas une garantie.
- Les récupérations en temps réel par des agents sont une zone grise. Lorsqu’une personne demande à ChatGPT ou Perplexity de résumer une URL précise, l’outil récupère cette page au nom de l’utilisateur. Les fournisseurs traitent souvent cela comme un accès dirigé par l’utilisateur plutôt que comme du crawling, si bien que les règles robots.txt d’entraînement/crawl peuvent ne pas s’appliquer comme les propriétaires de sites l’attendent.
- La couche CDN peut prendre le dessus. Des recherches sur le réseau de Cloudflare ont montré qu’une part significative de sites bloquent accidentellement de grands crawlers IA au niveau du CDN alors que leur robots.txt autorise ces accès – les deux couches doivent être cohérentes.
Au-delà de robots.txt : llms.txt, ai.txt et pay-per-crawl
robots.txt régit l’accès ; un fichier plus récent, llms.txt, régit la navigation – il oriente les systèmes IA vers vos contenus les plus précieux et les plus propres. Son adoption reste encore précoce (environ 10% des domaines), mais c’est un signal à faible risque. En parallèle, les CDN sont entrés dans le jeu : Cloudflare propose le blocage en un clic des crawlers IA ainsi qu’un modèle pay-per-crawl permettant aux éditeurs de facturer l’accès aux entreprises d’IA, ce qui fait évoluer le débat d’une simple autorisation ou interdiction vers la concession de licences. Ce qu’il faut retenir pour 2026 : robots.txt est une couche d’une pile qui inclut désormais llms.txt, les contrôles CDN et des conditions commerciales émergentes.
Ce que cela signifie si vous scrapez le web
Si vous collectez des données web publiques, considérez robots.txt comme une norme professionnelle, et non comme un obstacle à contourner. La posture défendable et durable :
- Lisez et respectez robots.txt pour les chemins que vous crawlerez, et respectez le crawl-delay lorsqu’il est défini. C’est la base d’une collecte éthique et de bonne foi.
- Collectez des données publiques en lecture seule – ne contournez pas les connexions et ne scrapez pas de données personnelles – et maintenez des cadences raisonnables afin de ne pas dégrader le site cible. (Voir is web scraping legal pour le cadre juridique.)
- Utilisez des proxies provenant de sources éthiques. Une collecte légitime passe par des IP résidentielles propres et consenties, avec une rotation raisonnable – pas par des réseaux qui dissimulent du trafic abusif. C’est précisément pourquoi les proxies for web scraping et leur mode d’approvisionnement sont importants.
Le fait que robots.txt soit seulement une requête ne donne pas le droit de l’ignorer : un scraping agressif expose à des blocages d’IP, à des protections CDN, ainsi qu’à des frictions réputationnelles et contractuelles que de bonnes pratiques permettent d’éviter.
Ce que cela signifie si vous exploitez un site
Décidez délibérément, puis faites en sorte que robots.txt et votre CDN soient cohérents :
- Vous voulez de la visibilité dans la recherche IA ? Autorisez les agents de recherche/réponse (OAI-SearchBot, Claude-SearchBot, PerplexityBot) afin de rester éligible aux citations – les visiteurs référés par l’IA sont un canal à forte intention et en croissance rapide.
- Vous ne voulez pas alimenter l’entraînement ? Bloquez les crawlers d’entraînement (GPTBot, Google-Extended, ClaudeBot) tout en gardant les agents de recherche autorisés.
- Vérifiez les deux couches. Assurez-vous que votre CDN ne bloque pas ou n’autorise pas silencieusement ce que définit votre robots.txt, et envisagez un llms.txt pour guider les agents vers vos meilleures pages.
- Testez ce que les agents voient réellement. Comme les réponses et les crawls IA varient selon la localisation, vérifiez votre site et sa visibilité IA depuis des IP situées dans différents pays, via des proxies résidentiels. Vous obtiendrez ainsi une vision réelle plutôt que votre seule perspective locale.
FAQ
Le fichier robots.txt est-il juridiquement contraignant ?
Non. robots.txt (standardisé sous le nom RFC 9309) est une demande volontaire que les crawlers respectueux des bonnes pratiques honorent. Il n’a aucune force juridique en soi et ne bloque pas techniquement l’accès – l’application réelle des règles se fait au niveau du serveur ou du CDN.
Puis-je autoriser l’IA à citer mon site sans l’utiliser pour l’entraînement ?
Oui. Les fournisseurs distinguent désormais les crawlers d’entraînement et les crawlers de recherche. Vous pouvez donc bloquer les agents d’entraînement (GPTBot, Google-Extended, ClaudeBot) tout en autorisant les agents de recherche (OAI-SearchBot, Claude-SearchBot, PerplexityBot), ce qui vous rend éligible aux citations dans les réponses IA.
Les crawlers IA respectent-ils vraiment robots.txt ?
Les principaux crawlers documentés (Googlebot, GPTBot, ClaudeBot, PerplexityBot) le font généralement, et vous pouvez le vérifier dans les journaux serveur. Mais la conformité repose sur l’adhésion volontaire, les récupérations en temps réel déclenchées par l’utilisateur relèvent d’une zone grise, et les user-agents usurpés existent – c’est donc une norme, pas une garantie.
Qu’est-ce que llms.txt et en ai-je besoin ?
llms.txt est un fichier plus récent qui guide les systèmes IA vers vos contenus les plus précieux – robots.txt régit l’accès, llms.txt régit la navigation. Son adoption en est encore à ses débuts (~10% des domaines), mais c’est un signal à faible effort et faible risque qui mérite d’être ajouté.
Le respect de robots.txt est-il important lors du scraping ?
Oui. Même s’il n’est pas juridiquement contraignant, respecter robots.txt et crawl-delay constitue la base d’un scraping éthique et durable – cela vous maintient dans une position défendable et évite les blocages, les défis CDN et les risques réputationnels.
Collectez des données web publiques de la bonne manière
Que vous construisiez un pipeline de données pour l’IA ou que vous surveilliez la manière dont l’IA représente votre marque, une collecte éthique commence par le respect des signaux des sites et l’utilisation d’IP propres et consenties. Obtenez des proxies résidentiels provenant de sources éthiques à partir de $1/GB – paiement à l’utilisation, 190+ pays, avec le contrôle géographique nécessaire pour tester et collecter de manière responsable.
