Robots.txt and AI crawlers GPTBot ClaudeBot PerplexityBot web scraping 2026

Robots.txt é o arquivo de texto de 30 anos que informa aos crawlers quais partes de um site eles podem acessar. Em 2026, ele está fazendo um trabalho para o qual nunca foi projetado: arbitrar a web de IA, onde dezenas de crawlers — GPTBot, ClaudeBot, PerplexityBot, Google-Extended e outros — extraem conteúdo para treinar modelos e responder perguntas em tempo real. Este guia aborda o que o robots.txt pode e não pode fazer na era da IA, o cenário dos crawlers, se os bots de IA realmente o respeitam, os sinais mais recentes (llms.txt, controles da Cloudflare) e o que tudo isso significa, seja você alguém que faz scraping da web ou administra um site que é alvo de scraping.

Eu sou Andrii Byzov, um CMO Fracionário AI-Native que trabalha diariamente com pipelines de dados da web e visibilidade em buscas de IA. Abaixo está uma visão prática e atualizada para 2026 — com as ressalvas honestas. Para o lado jurídico, consulte nosso guia is web scraping legal; para visibilidade em IA, nosso artigo sobre AI search rank tracking.


Fatos principais

  • robots.txt é voluntário, não é lei. É uma solicitação (formalizada como RFC 9309), aplicada por conformidade de boa-fé e por servidores/CDNs — não por estatuto.
  • Treinamento e busca agora são crawlers separados. Você pode bloquear o treinamento de IA (GPTBot, Google-Extended, ClaudeBot) enquanto continua elegível para citações em buscas de IA (OAI-SearchBot, Claude-SearchBot, PerplexityBot).
  • Buscas de agentes em tempo real frequentemente contornam a lógica do robots.txt. Quando um usuário pede a uma IA para ler uma página, essa busca possivelmente não é um “crawler” — portanto, robots.txt pode não impedi-la.
  • A conformidade varia de acordo com o bot. Grandes crawlers (Googlebot, GPTBot, ClaudeBot) geralmente respeitam o robots.txt; historicamente, alguns não fizeram isso — e uma diretiva só funciona se o bot decidir lê-la.
  • Existem novos sinais: llms.txt (orienta a IA para o seu melhor conteúdo, ~10% de adoção), além dos controles de bloqueio de IA e pay-per-crawl da Cloudflare na camada CDN.

O que robots.txt é — e não é — em 2026

robots.txt é um arquivo de texto simples na raiz de um domínio (/robots.txt) que lista user-agents e os caminhos que eles são solicitados a não buscar. Ele foi padronizado como RFC 9309 em 2022, mas a ideia central não mudou desde 1994: é uma solicitação educada. Ele não autentica ninguém, não bloqueia o acesso no nível da rede e não tem força legal por si só. Um crawler bem-comportado o lê e cumpre; um crawler que o ignora não enfrenta nenhuma barreira técnica do próprio arquivo.

Essa distinção resume tudo na era da IA. robots.txt governa o que bots compatíveis concordam em não fazer — ele não é uma fechadura. A aplicação real (limitação de taxa, bloqueio, paywalls) acontece no servidor ou na CDN, não no arquivo de texto.

O cenário dos crawlers de IA

A web de IA é rastreada por um elenco crescente, e a mudança importante é que cada grande provedor agora separa o tráfego de treinamento do tráfego de busca/resposta em user-agents diferentes:

User-agent Operador Finalidade Respeita robots.txt?
GPTBot OpenAI Treinamento de modelo Sim (documentado)
OAI-SearchBot OpenAI Busca do ChatGPT / citações Sim
ClaudeBot Anthropic Treinamento de modelo Sim
Claude-SearchBot Anthropic Busca / citações Sim
Google-Extended Google Token de opt-out para treinamento do Gemini Sim (apenas token)
PerplexityBot Perplexity Busca / respostas Sim (documentado)
CCBot Common Crawl Dataset aberto (alimenta muitos modelos) Sim
Meta-ExternalAgent Meta Treinamento / recursos de IA Sim

Como treinamento e busca são agentes separados, um site pode fazer uma escolha mais refinada: optar por não ser usado para treinar modelos enquanto continua elegível para ser citado em respostas de IA — bloquear GPTBot, mas permitir OAI-SearchBot, por exemplo.

Os crawlers de IA realmente obedecem ao robots.txt?

Em sua maioria, os grandes obedecem — e isso é fácil de verificar nos logs do seu próprio servidor. Googlebot, GPTBot, ClaudeBot e PerplexityBot documentam seus user-agents e respeitam diretivas padrão. Mas três ressalvas honestas importam:

  • A conformidade é opt-in. Uma diretiva só funciona se o bot a ler e respeitar. Alguns crawlers historicamente ignoraram robots.txt, e um user-agent falsificado pode afirmar ser qualquer coisa — portanto, o arquivo é uma norma, não uma garantia.
  • Buscas de agentes em tempo real são uma zona cinzenta. Quando uma pessoa pede ao ChatGPT ou ao Perplexity para resumir uma URL específica, a ferramenta busca essa página em nome do usuário. Os provedores muitas vezes tratam isso como acesso direcionado pelo usuário, e não como crawling, então as regras de treinamento/rastreamento do robots.txt podem não se aplicar da forma que os proprietários de sites esperam.
  • A camada de CDN pode se sobrepor a você. Pesquisas na rede da Cloudflare encontraram uma parcela significativa de sites que bloqueiam acidentalmente grandes crawlers de IA na CDN enquanto seu robots.txt diz “permitir” — as duas camadas precisam estar alinhadas.

Além do robots.txt: llms.txt, ai.txt e pay-per-crawl

robots.txt governa o acesso; um arquivo mais novo, llms.txt, governa a navegação — ele aponta sistemas de IA para seu conteúdo de maior valor e mais limpo. A adoção ainda está no início (cerca de 10% dos domínios), mas é um sinal de baixo risco. Paralelamente, as CDNs entraram em cena: Cloudflare oferece bloqueio de crawlers de IA com um clique e um modelo de pay-per-crawl que permite aos publishers cobrar empresas de IA pelo acesso — mudando a conversa de “permitir/negar” para “licenciar”. A conclusão para 2026: robots.txt é uma camada em uma pilha que agora inclui llms.txt, controles de CDN e termos comerciais emergentes.


O que isso significa se você faz scraping da web

Se você coleta dados públicos da web, trate o robots.txt como uma norma profissional, não como um obstáculo a contornar. A postura defensável e sustentável:

  • Leia e respeite o robots.txt para os caminhos que você acessa, e respeite o crawl-delay quando definido. É a base de uma coleta ética e de boa-fé.
  • Colete dados públicos e somente leitura — não contorne logins nem extraia dados pessoais — e mantenha taxas razoáveis para não prejudicar o site de destino. (Veja is web scraping legal para o enquadramento jurídico.)
  • Use proxies obtidos de forma ética. Coletas legítimas passam por IPs residenciais limpos e consentidos, com rotação sensata — não por redes que ocultam tráfego abusivo. É exatamente por isso que proxies for web scraping e a forma como eles são obtidos importam.

O fato de robots.txt ser “apenas uma solicitação” não é uma licença para ignorá-lo — os riscos práticos do scraping agressivo são bloqueios de IP, desafios de CDN e atritos reputacionais e contratuais, todos evitados por boas práticas.

O que isso significa se você administra um site

Decida de forma deliberada e, então, faça com que o robots.txt e sua CDN estejam alinhados:

  • Quer visibilidade na busca por IA? Permita os agentes de busca/resposta (OAI-SearchBot, Claude-SearchBot, PerplexityBot) para continuar elegível a citações — visitantes encaminhados por IA são um canal de alta intenção e crescimento acelerado.
  • Não quer alimentar treinamento? Bloqueie os crawlers de treinamento (GPTBot, Google-Extended, ClaudeBot), mantendo os agentes de busca permitidos.
  • Verifique as duas camadas. Confira se sua CDN não está bloqueando (ou expondo) silenciosamente aquilo que seu robots.txt pretende, e considere um llms.txt para orientar agentes às suas melhores páginas.
  • Teste o que os agentes realmente veem. Como respostas e crawls de IA são geolocalizados e personalizados, verificar seu site e sua visibilidade em IA a partir de IPs em diferentes países (via proxies residenciais) mostra o cenário real, não apenas a sua visão local.

FAQ

O robots.txt é juridicamente vinculante?

Não. robots.txt (padronizado como RFC 9309) é uma solicitação voluntária que crawlers bem-comportados respeitam. Por si só, não tem força legal e não bloqueia tecnicamente o acesso — a aplicação real acontece no servidor ou na CDN.

Posso permitir que a IA cite meu site, mas não treine com ele?

Sim. Os provedores agora separam crawlers de treinamento e de busca, então você pode bloquear agentes de treinamento (GPTBot, Google-Extended, ClaudeBot) enquanto permite agentes de busca (OAI-SearchBot, Claude-SearchBot, PerplexityBot), que tornam seu site elegível para citações em respostas de IA.

Os crawlers de IA realmente seguem o robots.txt?

Os principais crawlers documentados (Googlebot, GPTBot, ClaudeBot, PerplexityBot) geralmente seguem, e você pode verificar isso nos logs do servidor. Mas a conformidade é opcional, buscas em tempo real acionadas pelo usuário são uma área cinzenta, e existem user-agents falsificados — portanto, é uma norma, não uma garantia.

O que é llms.txt e eu preciso dele?

llms.txt é um arquivo mais recente que orienta sistemas de IA para o seu conteúdo mais valioso — robots.txt rege o acesso, llms.txt rege a navegação. A adoção ainda está no início (~10% dos domínios), mas é um sinal de baixo esforço e baixo risco que vale a pena adicionar.

Respeitar o robots.txt importa ao fazer scraping?

Sim. Embora não seja juridicamente vinculante, respeitar robots.txt e crawl-delay é a base de um scraping ético e sustentável — isso mantém você em uma posição defensável e evita bloqueios, desafios de CDN e riscos reputacionais.


Colete dados públicos da web da maneira certa

Seja para criar um pipeline de dados de IA ou monitorar como a IA representa sua marca, a coleta ética começa com o respeito aos sinais dos sites e a operação em IPs limpos e consentidos. Obtenha proxies residenciais de origem ética a partir de $1/GB — pagamento conforme o uso, 190+ países, com controle geográfico para testar e coletar de forma responsável.



Share article: