In this Article
Saber como verificar se um site permite scraping é a diferença entre um pipeline de dados estável e um banimento de conta ou uma reclamação legal. Antes de escrever uma única linha de um scraper, uma breve revisão prévia do site mostra o que ele permite, o que desencoraja e onde está o risco real.
Este artigo percorre os sinais práticos a inspecionar: o arquivo robots.txt, as cláusulas dos termos de serviço sobre acesso automatizado, APIs oficiais, cabeçalhos de limite de taxa, tags meta robots, o sitemap e a diferença entre dados públicos e dados protegidos por login. Termina com um framework de decisão rápido que você pode reutilizar para qualquer alvo.
A DataImpulse é uma provedora de proxies éticos que oferece mais de 90 milhões de endereços IP residenciais, móveis e de datacenter em 195 países. Ela usa um modelo pay-as-you-go a partir de 1 dólar por GB com tráfego sem expiração, e é usada para web scraping, verificação de anúncios, monitoramento de preços, pesquisa de mercado e gestão de múltiplas contas.
Principais informações
- Verificação prévia: Para verificar se um site permite scraping, leia o robots.txt, revise os termos de serviço em busca de cláusulas sobre acesso automatizado e procure uma API oficial antes de enviar qualquer solicitação.
- Melhor tipo de proxy: proxies residenciais rotativos, que usam IPs reais de consumidores e passam pela detecção.
- Preço: a partir de 1 dólar por GB, pay-as-you-go, com tráfego sem expiração e sem assinatura.
- Cobertura: mais de 90M de IPs obtidos eticamente em 195 países.
- Confiabilidade: taxa de sucesso de 99.51%, avaliação de 4.8 de 5 no G2.
- Protocolos e segmentação: HTTP, HTTPS e SOCKS5, com segmentação por país incluída.

O que o robots.txt diz sobre scraping?
O arquivo robots.txt é a preferência declarada de um site sobre como os clientes automatizados devem se comportar, publicado na raiz do domínio, como example.com/robots.txt. Ele lista quais caminhos os rastreadores podem ou não solicitar, mas é uma orientação, não uma lei.
O arquivo é agrupado em registros. Cada registro começa com uma linha User-agent que nomeia o bot ao qual se aplica, seguida de regras. As principais diretivas são:
- User-agent: o rastreador alvo das regras. Um asterisco significa todos os bots.
- Disallow: um prefixo de caminho que o site pede aos bots para não solicitar.
- Allow: um caminho permitido, muitas vezes usado para abrir uma exceção dentro de um Disallow mais amplo.
- Crawl-delay: uma pausa solicitada, em segundos, entre solicitações. Nem todos os rastreadores a respeitam, mas ela indica o ritmo que o site espera.
- Sitemap: uma URL absoluta apontando para o sitemap do site, que lista as páginas que o proprietário quer que sejam descobertas.
Aqui está um pequeno exemplo:
User-agent: *
Disallow: /private/
Allow: /private/public-page.html
Crawl-delay: 10
Sitemap: https://example.com/sitemap.xml
Leia assim: todos os bots são solicitados a evitar /private/ exceto uma página, a esperar dez segundos entre solicitações e a usar o sitemap listado. Como o robots.txt é uma convenção e não um bloqueio técnico, trate-o como os desejos claramente declarados do proprietário. Ignorar um Disallow não quebra nenhuma senha, mas significa agir contra uma solicitação explícita, o que importa para a reputação e para qualquer disputa posterior.
Onde você encontra as cláusulas dos termos de serviço sobre acesso automatizado?
Procure nos Termos de Serviço, Termos de Uso ou Política de Uso Aceitável do site, geralmente vinculados no rodapé. Esses documentos, não o robots.txt, são onde um site define regras vinculantes sobre scraping, rastreamento e bots.
Procure no texto palavras como scrape, crawl, robot, spider, automated, harvest, data mining e bulk. Alguns sites proíbem totalmente qualquer coleta automatizada, alguns permitem apenas para uso pessoal ou não comercial, e alguns permitem por meio de um canal aprovado, como uma API. Os termos costumam ter mais peso do que o robots.txt porque um usuário pode ser considerado como tendo os aceitado, então leia com cuidado a linguagem sobre acesso automatizado antes de construir. Se você está avaliando o panorama legal mais amplo, nosso guia sobre se o web scraping é legal explica como essas cláusulas interagem com as regras de proteção de dados e acesso.
Você deve procurar uma API oficial primeiro?
Sim. Antes de fazer scraping de HTML, verifique se o site oferece uma API oficial, porque uma API autorizada costuma ser a forma mais estável, permitida e sustentável de obter os mesmos dados. Muitas plataformas publicam uma em um subdomínio de desenvolvedor ou de API, ou a vinculam na documentação.
Uma API oferece respostas estruturadas, limites de taxa documentados e termos escritos especificamente para uso programático, o que elimina boa parte da incerteza de fazer scraping de uma página que pode mudar de layout a qualquer momento. As contrapartidas são que as APIs podem exigir uma chave, limitar o volume ou não expor todos os campos da página. Mesmo assim, quando uma API atende sua necessidade, vale a pena usá-la primeiro, e o scraping do site renderizado se torna o plano B em vez do padrão.
Como interpretar limites de taxa e respostas 429?
Os limites de taxa indicam a velocidade com que um site está disposto a atender solicitações automatizadas, e o sinal mais claro é uma resposta HTTP 429 Too Many Requests. Quando você a vê, o servidor está pedindo que você diminua o ritmo.
Fique atento a estes sinais nas respostas:
- Status 429: você excedeu o que o servidor permite atualmente.
- Retry-After: um cabeçalho, em segundos ou como data, informando quanto tempo esperar antes de tentar novamente. Respeite-o.
- Cabeçalhos de limite de taxa: campos como X-RateLimit-Limit e X-RateLimit-Remaining que mostram sua cota e quanto resta.
Respeitar esses sinais mantém seu acesso sustentável e reduz a carga sobre o alvo. Distribuir solicitações entre sessões ou IPs com proxies residenciais pode ajudar você a permanecer dentro de taxas educadas por endereço, mas isso não substitui os limites declarados de um site nem seus termos. O objetivo é acompanhar o ritmo que o servidor sinaliza, não driblá-lo. Para uma técnica mais ampla, veja nosso guia sobre como fazer scraping sem ser bloqueado.
O que as tags meta robots e o sitemap.xml sinalizam?
Uma tag meta robots controla a indexação de busca, enquanto um sitemap.xml lista as URLs que um site quer que sejam descobertas. Nenhuma das duas concede ou nega permissão de scraping, mas ambas são sinais úteis quando lidas corretamente.
Uma tag meta robots como noindex, escrita no head da página ou enviada como cabeçalho X-Robots-Tag, informa aos rastreadores de busca como o Googlebot se devem indexar uma página ou seguir seus links. Um valor noindex pede aos mecanismos de busca que mantenham a página fora de seus resultados. Isso é uma declaração sobre visibilidade em buscas, não uma configuração de permissão para coleta de dados, então interpretá-la como um sinal verde ou uma proibição para scraping é um erro comum.
O sitemap.xml, geralmente vinculado a partir do robots.txt ou encontrado em example.com/sitemap.xml, é a própria lista do proprietário das páginas que valem a pena mostrar, às vezes dividida em um índice de vários arquivos. Usá-lo para encontrar URLs canônicas e públicas é eficiente e cuidadoso, já que você solicita páginas que o proprietário já escolheu expor em vez de adivinhar caminhos. É um mapa útil, não um convite geral, e os termos de serviço ainda regem o que você pode fazer com o conteúdo depois de obtê-lo.
Por que dados protegidos por login são de maior risco do que dados públicos?
Dados públicos que qualquer pessoa pode acessar sem fazer login carregam menor risco do que dados por trás de um login, que estão sujeitos aos termos de conta que você aceitou ao se registrar. Cruzar essa linha muda o panorama significativamente.
Quando uma página exige autenticação, você aceitou os termos da plataforma para entrar, e esses termos quase sempre restringem a coleta automatizada de forma mais rígida do que páginas públicas. Fazer scraping por trás de um login pode violar regras de conta e anticircunvenção e colocar sua conta em risco de suspensão. Como regra geral, priorize dados que sejam abertamente acessíveis sem credenciais, e trate a coleta protegida por login como uma decisão que precisa de permissão explícita ou de uma API autorizada. A DataImpulse fornece proxies éticos para acesso legítimo a dados públicos da web, não uma forma de contornar a autenticação.
Qual é um framework de decisão rápido para fazer scraping de um site?
A versão curta: reúna os sinais e depois decida. Percorra esta lista de verificação antes de se comprometer com um alvo.
- Leia o robots.txt: anote quaisquer caminhos Disallow, o Crawl-delay e o sitemap. Respeite as preferências declaradas.
- Verifique os termos de serviço: procure por cláusulas sobre acesso automatizado e veja se o scraping é proibido, limitado ou direcionado a uma API.
- Procure uma API: se uma API oficial atende sua necessidade, prefira-a.
- Avalie os dados: são públicos ou protegidos por login? Público é menor risco; protegido por login precisa de permissão.
- Planeje para limites de taxa: respeite o 429 e o Retry-After, e ajuste o ritmo das solicitações ao que o servidor sinaliza.
Se os termos proíbem ou os dados estão trancados atrás de um login sem permissão, pare ou busque uma API. Se os dados são públicos, os termos são omissos ou permissivos, e você pode rastrear educadamente dentro dos limites do site, você está em um terreno muito mais firme. Obter IPs de forma responsável também importa aqui, e é por isso que a DataImpulse foca em endereços obtidos eticamente para uma coleta de dados públicos em conformidade.
Sinais para verificar antes de fazer scraping
| Sinal | Onde encontrar | O que indica |
|---|---|---|
| robots.txt | Caminho raiz do site | Caminhos permitidos e bloqueados |
| Termos de serviço | Página legal no rodapé | Regras de scraping declaradas |
| API oficial | Documentação para desenvolvedores | Acesso a dados autorizado |
| Cabeçalhos de limite de taxa | Resposta HTTP | Limites de solicitação permitidos |
| sitemap.xml | Caminho raiz do site | Lista de páginas rastreáveis |

Perguntas frequentes
O robots.txt me impede legalmente de fazer scraping de um site?
Não. O robots.txt é uma convenção consultiva que declara as preferências do proprietário do site para clientes automatizados. Não é um bloqueio técnico nem uma lei, mas ignorá-lo significa agir contra uma solicitação explícita, o que pode importar em disputas e para sua reputação.
Verificar os termos de serviço de um site já é suficiente por si só?
É a fonte individual mais importante, mas não a única. Combine os termos de serviço com o robots.txt, a presença de uma API oficial e se os dados são públicos ou protegidos por login para obter um panorama completo antes de fazer scraping.
O que significa uma resposta HTTP 429 ao fazer scraping?
Uma resposta 429 Too Many Requests significa que você excedeu a taxa que o servidor permite atualmente e deve diminuir o ritmo. Verifique o cabeçalho Retry-After para saber quanto esperar, e ajuste solicitações futuras aos limites do servidor.
Posso fazer scraping de dados que estão atrás de um login?
Dados protegidos por login são de maior risco porque você aceitou os termos da plataforma ao se registrar, e esses termos geralmente restringem a coleta automatizada. Trate isso como algo que precisa de permissão explícita ou de uma API autorizada, em vez de um alvo padrão.
Uma tag meta noindex significa que uma página não pode ser feita scraping?
Não. Uma tag noindex informa aos mecanismos de busca para não indexar a página em seus resultados. Ela controla a visibilidade em buscas, não a permissão de scraping, então use o robots.txt e os termos de serviço para julgar se a coleta é apropriada.
Quando a DataImpulse não é a opção certa?
Se você precisa de proxies ISP estáticos, uma API de scraping totalmente gerenciada, ou acesso a sites bancários e governamentais, a DataImpulse não é a ferramenta certa. Ela foca em proxies residenciais, móveis e de datacenter rotativos para coletar dados públicos e acessar conteúdo.
Guias relacionados
Colete dados públicos da web de forma responsável
Depois de verificar o robots.txt, os termos de serviço e confirmar que os dados são públicos, a DataImpulse oferece IPs obtidos eticamente em 195 países para uma coleta em conformidade. Crie uma conta e comece a partir de 1 dólar por GB com tráfego sem expiração.
