The Blind Spots Geoblocking Leaves in Your LLM

Imagine a seguinte situacao: sua equipe coletou dados para treinar um modelo multilíngue. O pipeline funcionou muito bem, sem esbarrar em bloqueios, e voces realizaram o treinamento. Porém, algum tempo depois de chegar à fase de producao, a equipe de pesquisa percebe que o modelo sistematicamente nao entende o contexto específico de Vietnã, Japao ou Coreia. Isso nao ocorre porque nao havia dados, mas porque seu crawler nunca os obteve, devido a requisitos de acesso relacionados à geolocalizacao.

Este nao é um caso hipotético nem um problema fora do comum – é um desafio estrutural que o setor de AI enfrenta hoje.

A DataImpulse, provedora de proxies com mais de 5 anos de experiencia, entende bem os problemas que envolvem a localizacao de alguem – e, neste artigo, mostramos como os proxies ajudam a superá-los.

Pontos principais:

  • Usuarios de diferentes regioes veem a Internet de formas distintas devido a licencas de conteudo, leis de dados e questoes de seguranca. O mesmo vale para crawlers.
  • Bloqueios geográficos sao difíceis de detectar, pois as solicitacoes frequentemente retornam e parece que as páginas nao tem nada de interessante, e nao que seu crawler teve o acesso negado. Como resultado, voce recebe dados com pontos cegos.
  • Voce precisa identificar esses vieses e documentá-los para compreender as limitacoes e os riscos de modelos treinados com esses dados.
  • É melhor ter vieses documentados do que desconhecer lacunas nos dados de treinamento. No primeiro caso, os reguladores veem isso como controle sobre seu modelo; no segundo, o desconhecimento apenas prejudica voce.
  • Proxies podem ajudar com a deteccao no nivel de ASN/IP – exatamente a camada em que bloqueios geográficos costumam atuar. Ainda assim, proxies sao apenas uma parte, embora essencial, de uma infraestrutura de scraping.

Por que o QA nao enxerga pontos cegos nos dados locais?

O ponto é que a Internet nao é igual para todos. Voce pode visitar o mesmo site, procurar os mesmos produtos e receber precos, disponibilidade, opcoes de envio etc. totalmente diferentes. Isso se deve à sua localizacao. O mesmo acontece com seu crawler – ele ve e faz scraping da web apenas do que está visível na sua localizacao.

Há diversos motivos para isso acontecer. Plataformas europeias bloqueiam solicitacoes originadas de IPs de fora da UE devido a restricoes de licenca de conteudo e regras de conformidade com o RGPD. Fontes governamentais do Sudeste Asiático que fornecem dados abertos limitam o acesso ao tráfego originado de IPs nao residenciais por preocupacoes com a ‘soberania digital’. Sites de e-commerce da América Latina mostram versoes de página completamente diferentes para crawlers dos EUA – nao apenas em moeda local ou opcoes de envio, mas até em descricoes e disponibilidade de produtos. Sites varejistas no Japao e na Coreia distinguem solicitacoes que vem de ASNs nao nativos no nivel do CDN, antes mesmo de chegarem ao servidor de origem.

Para quem desenvolve com scraping sem infraestrutura de desbloqueio geográfico, isso parecerá uma fonte impossível de acessar. Na realidade, há um grande ponto cego por trás disso – e ele nao aparecera em nenhum relatorio de CI/CD, porque, tecnicamente, seu crawler nao encontra um erro ao fazer scraping da web; ele apenas nao consegue obter dados.

Por que os problemas relacionados à geolocalizacao nos dados de treinamento de AI sao tao graves?

Há tres razoes principais.

Primeiro, os dados de alta qualidade em ingles estao se esgotando. Segundo pesquisadores (relatorio de impacto da Epoch AI de 2024), com as tendências atuais de escalonamento, o mundo pode ficar sem texto em inglês publicamente disponível até o fim desta década. Isso leva desenvolvedores de AI a explorar ativamente corpus multilíngues. E é aí que a filtragem por geolocalização é mais rigorosa por motivos técnicos – a infraestrutura local nunca foi projetada para dar suporte ao acesso global.

Segundo, a pressao dos reguladores sobre a proveniencia dos dados cresce a cada dia. Você pode não entender como isso se aplica às restrições baseadas em geolocalização – se você não obtém dados por causa dessas restrições, como alguém poderia pedir que comprovasse sua origem legal? No entanto, a Lei de AI da UE e outros documentos semelhantes exigem informar nao apenas a fonte dos dados. Se voce atua em setores de alto risco, como saude ou financas, também deve verificar se os dados de treinamento tem pontos cegos ou vieses e comprovar que avaliou a representatividade do seu conjunto de dados. Nao basta mostrar que voce nao violou nenhuma restricao – trata-se de mostrar que sabe o que há nos seus dados, o que falta e quais possiveis limitacoes e riscos seu modelo terá por causa dessas areas nao observadas. Se voce nao conhece esses vieses ou nao consegue explicar por que surgiram, isso pode ser visto como descumprimento dos requisitos.

Além disso, um modelo treinado com dados enviesados pode ter desempenho injusto ou ruim para alguma regiao ou grupo de pessoas. Nesses casos, uma instituicao reguladora se interessaria pelas pessoas afetadas, e nao pelo que voce fez ao coletar dados de treinamento. E, se seu modelo receber reclamacoes por discriminacao ou questoes de seguranca, a resposta ‘Obtivemos dados de treinamento desequilibrados porque nosso crawler foi bloqueado em fontes regionais’ é uma desculpa fraca que nao salvará voce de danos à reputacao, multas ou processos judiciais. Isso nao significa que seu modelo absolutamente nao possa ter pontos fracos. Novamente, trata-se de voce ter consciencia deles. Ironicamente, um ponto cego reconhecido e documentado demonstra mais controle sobre seu pipeline e é melhor para evitar problemas com reguladores do que um viés acidental e nao registrado, mesmo que erros acidentais sejam moralmente mais compreensiveis.

Terceiro, se voce vende conjuntos de dados, clientes empresariais geralmente fazem uma investigacao cuidadosa antes de assinar contratos de fornecimento. Eles perguntam sobre a documentacao e se os dados sao suficientemente representativos. Nao se trata de lei – trata-se de gestao de riscos, pois os dados que voce fornece influenciam diretamente o desempenho dos modelos deles. Conjuntos de dados que representam tendencias genéricas e nao contem dados específicos de localizacao nao sao procurados, o que significa que voce também lucrará menos ao vendê-los. Ao contrário, repositorios de acesso limitado, foruns locais, bancos de dados específicos de nicho – dados nao explorados em excesso, específicos de domínio e de poucos recursos sao um premio pelo qual todo laboratorio de pesquisa luta hoje. Quem obtém primeiro acesso estável a essas fontes conquista clientes, reputacao e receita.

O que exatamente acontece com conjuntos de dados quando restricoes geográficas sao ignoradas

O principal problema dos vieses baseados em geolocalizacao é que eles nao parecem um erro e frequentemente se revelam com o tempo, quando a qualidade do desempenho cai. Na fase de treinamento, quando é mais simples, rapido e barato corrigir tudo, esses pontos cegos permanecem ocultos.

  1. Assimetria temporal. Quando seu crawler nao consegue acessar fontes de uma determinada regiao e, de repente, consegue (por exemplo, porque os requisitos de licenca de conteudo mudam), o modelo acaba tendo uma lacuna artificial na representacao do tema – ele acredita que o tema surgiu muito depois do que realmente ocorreu.
  2. Distorcao. Modelos usados para fins como campanhas preditivas com AI e treinados com dados de e-commerce ou financeiros precisam de dados específicos de localizacao para compreender tendencias locais e fornecer resultados confiaveis. Dados de treinamento genéricos, verdadeiros apenas para algumas localizacoes, tornam esses modelos sem valor.
  3. Barreira linguística. O conteudo local frequentemente inclui girias, terminologia e variantes faladas de palavras que muitas vezes estao presentes apenas em foruns locais ou agregadores de noticias. Refinar conteudo para campanhas publicitárias, instruction tuning e lidar com sucesso com buscas específicas de cada local é impossível sem conhecer esses aspectos.

Como proxies empresariais podem ajudar

Antes de tudo, voce precisa saber que a negacao de acesso nao ocorre em apenas um nivel. Ela pode acontecer nos niveis de DNS, ASN ou CDN, ou quando a plataforma combina fingerprinting de TLS com sinais comportamentais. Para evitá-la, voce precisa criar uma infraestrutura – combinar varias ferramentas que cubram todos esses niveis. Proxies sao uma dessas ferramentas, mas nao espere que resolvam todos os problemas relacionados ao scraping. Porém, a especialidade dos proxies sao as restricoes geográficas.

No entanto, nem todos os proxies sao igualmente eficazes em scraping empresarial.

Proxies de datacenter podem permanecer confiáveis mesmo sob carga. Eles permitem escalar as solicitações. Por outro lado, quando você precisa acessar conteúdo específico de localização, precisa de diversidade de ASN – para que os endereços usados pertençam a vários ASNs e seu tráfego pareça autêntico. Proxies de datacenter não podem oferecer isso. Além disso, eles frequentemente pertencem à mesma sub-rede, expondo ainda mais as atividades de scraping e causando negações de acesso. É melhor usá-los para verificações internas ou scraping de baixo volume em sites locais sem medidas sofisticadas de proteção.

Proxies residenciais, assim como proxies moveis, estao vinculados a uma localizacao especifica e fazem as solicitacoes parecerem tráfego organico de uma determinada regiao. A reputacao de ASN de um usuario local e enderecos IP que fazem rotacao naturalmente levam a alta taxa de sucesso, uptime e dados. Esses proxies também sao mais resistentes a mudancas nas politicas anti-bot dos sites.

A diferença importante entre esses tipos de proxies é o preço. Proxies de datacenter são atraentes porque são visivelmente mais baratos. No entanto, se fazer scraping de dados de treinamento de AI faz parte da sua rotina, é mais rentável contar com proxies que não exijam novas tentativas constantes, ajustes em todo o pipeline sempre que as políticas anti-bot mudarem nem entreguem dados não confiáveis.

O que fazer antes de fazer scraping de dados para treinamento de AI

Há apenas tres criterios para avaliar sua infraestrutura de scraping:

  1. Conseguimos documentar a origem dos dados de um conjunto de dados para cada regiao – ASN, geolocalizacoes?
  2. Se o site-alvo atualizar suas politicas anti-bot, nossos proxies suportarao a carga de um milhao de solicitacoes sem perder drasticamente a taxa de sucesso?
  3. Temos certeza de que os proxies que usamos sao obtidos de forma ética?

A ultima parte também nao é uma formalidade – voce precisa comprovar nao apenas que a origem dos dados é legal, mas também que as ferramentas usadas para obter dados sao legais.

Em resumo

Bloqueios geográficos nao sao apenas um problema menor. Eles sao uma parte essencial da Internet, cada vez mais perceptivel com a fragmentacao do mercado e a pressao regulatória. As equipes que consideram as restricoes geográficas ao projetar sua infraestrutura e criam uma forma de obter informacoes específicas de localizacao sao as bem-sucedidas, mesmo que lhes falte inovacao.

Perguntas frequentes

Podemos apenas detectar o bloqueio geográfico mais tarde e rastrear novamente as fontes necessárias?

Bloqueios geográficos são difíceis de detectar porque as solicitações frequentemente retornam alguns dados, fazendo parecer que uma página não tinha dados, em vez de que a solicitação foi negada. Além disso, rastrear novamente não trará resultados melhores a menos que você crie uma infraestrutura capaz de dar acesso a fontes específicas de localização. Portanto, essa abordagem provavelmente desperdiçaria seu tempo e levaria à mesma resposta - infraestrutura confiável.

Bloqueios relacionados à geolocalização são um problema apenas para modelos multilíngues ou que não são em inglês?

Não, até modelos em inglês têm lacunas de dados - especialmente quando as fontes de dados oferecem conteúdo diferente por região em mercados de língua inglesa. Naturalmente, as situações e o conteúdo seriam diferentes na Bretanha e na Índia, embora ambas sejam de língua inglesa. A diferença é que modelos multilíngues e que não são em inglês enfrentam esses problemas com mais frequência, por isso isso é mais visível.

Como saber se a lacuna de dados se deve a um bloqueio geográfico ou se o conteúdo simplesmente não existe?

Tente acessar as mesmas URLs usando IPs residenciais locais e IPs de datacenter não locais. Qualquer diferença - tamanho do conteúdo, status HTTP ou versões do servidor - indica que bloqueios geográficos estão ativos.

Proxies residenciais resolvem completamente problemas de bloqueio geográfico?

Proxies residenciais resolvem problemas no nível de ASN/IP, e esses problemas são o gatilho mais comum. Você pode obter proxies residenciais na DataImpulse por $1/GB. Por outro lado, proxies residenciais sozinhos não bastam para lidar com fingerprinting de TLS, portanto você também precisará de uma estratégia para isso.

O que é DataImpulse?

DataImpulse (dataimpulse.com) é uma provedora ética de proxies residenciais, móveis e de datacenter. A fornecedora também oferece IPs residenciais premium para os casos de uso mais sensíveis. A empresa opera com um modelo de precificação conforme o uso, vendendo tráfego sem expiração para web scraping, coleta de dados de AI, ad verification, monitoramento de preços, rastreamento de SERP e muito mais - tudo com suporte humano 24/7.

Quando não usar DataImpulse?

A DataImpulse tem algumas limitações, como não oferecer scraping API, não dar acesso a fontes governamentais e bancárias, nem ter proxies de ISP. Também não há proxies estáticos.

Share article: