Is Web Scraping Legal 2026 - DataImpulse banner cover

¿El web scraping es legal? La respuesta corta: raspar datos públicos y no-personales es ampliamente legal en la mayoría de las jurisdicciones — pero los detalles deciden todo. Qué raspas (precios de productos vs. perfiles personales), cómo lo raspas (páginas públicas vs. detrás de un login), dónde operas (la lógica del CFAA de EE.UU. vs. el GDPR de Europa), y qué haces con los datos (monitoreo de precios vs. entrenamiento de IA) — cada uno te mueve entre “práctica de negocio defendible” y “acción regulatoria”. Este hub recorre los casos emblemáticos, los litigios de la era-IA de 2025-2026, la posición de cada gran regulador, y un marco práctico — apoyándose en las secciones legales que hemos verificado en más de 25 guías de países y plataformas.

Una cosa de entrada: esto es información general, no asesoría legal. Antes de escalar un pipeline comercial de scraping, consulta a un abogado en tu jurisdicción y en la de tus objetivos.


Datos Clave

  • Raspar datos públicos generalmente no es “hacking” en EE.UU. El fallo de 2022 del Noveno Circuito en hiQ Labs v. LinkedIn sostuvo que raspar páginas públicamente accesibles no viola el Computer Fraud and Abuse Act (CFAA) — no hay “acceso no autorizado” donde no se exigen credenciales. Pero hiQ aun así perdió por incumplimiento de contrato: había aceptado los términos de LinkedIn, y el caso terminó en una sentencia homologada (consent judgment).
  • “Público” no significa “libre de tomar” en el caso de datos personales. Los reguladores de Europa lo dejaron explícito: la AP de los Países Bajos multó a Clearview AI con €30,5 millones, la Garante de Italia la multó con €20 millones, la ICO del Reino Unido con £7,5 millones, y la CNIL de Francia multó a la corredora de datos KASPR con €240.000 — todas por raspar datos personales que eran técnicamente públicos.
  • Deslogueado vs. logueado es la línea que sigue ganando. En Meta v. Bright Data (ene. 2024), un tribunal de EE.UU. se negó a bloquear el scraping de páginas públicas y deslogueadas de Facebook e Instagram — dejando claro que raspar detrás de un login, en violación de términos que has aceptado, es otro asunto.
  • La era de la IA abrió un nuevo frente: reclamos de contrato y licenciamiento. Reddit demandó a Anthropic (2025; remitida al tribunal estatal de California en marzo de 2026) y a Perplexity más tres proveedores de scraping incluyendo Oxylabs (oct. 2025, S.D.N.Y.). Bartz v. Anthropic (junio de 2025) consideró que entrenar con libros obtenidos lícitamente es uso justo “extremadamente transformador” — a la vez excluyendo fuentes pirateadas. La legalidad de la recopilación y la legalidad del entrenamiento son ahora cuestiones separadas.
  • Los proxies en sí son legales. Un proxy es infraestructura de red estándar — la misma tecnología detrás de gateways corporativos y CDNs. La legalidad depende de lo que haces a través de él, no de la herramienta.
  • El carril defendible, en todas partes: recopilación pública y de solo-lectura de datos no-personales (precios, listados, rankings, disponibilidad), a tasas de solicitud respetuosas, honrando el robots.txt, sin sortear logins ni barreras técnicas, sin ningún dato personal en el pipeline.

La Respuesta Corta, por Pregunta

Pregunta Respuesta corta
¿Raspar datos públicos de producto/precio es legal? Generalmente sí — la categoría más defendible en todas partes
¿Raspar datos personales (nombres, perfiles, contactos) es legal? Alto riesgo — los reguladores del GDPR multan por ello incluso cuando el dato es público
¿Raspar detrás de un login es legal? Arriesgado — has aceptado los términos; los reclamos de contrato sobreviven incluso donde el CFAA falla
¿Violar el robots.txt es ilegal? No es una ley por sí sola, pero tribunales y reguladores lo tratan como evidencia de mala fe
¿Usar proxies es legal? — la actividad, no la herramienta, determina la legalidad
¿Raspar para entrenamiento de IA es legal? Sin definir — el uso justo gana para datos obtenidos lícitamente, pero los litigios de contrato/licenciamiento se multiplican

Estados Unidos: el CFAA, hiQ, y la Capa de Contrato

La pregunta fundamental de EE.UU. era si raspar páginas públicas es “acceso no autorizado” bajo el Computer Fraud and Abuse Act — el estatuto anti-hacking. El Noveno Circuito respondió en hiQ Labs v. LinkedIn (2022, aplicando la lógica de Van Buren de la Corte Suprema): no. Donde una página está abierta a cualquiera sin credenciales, no hay una puerta de autorización que vulnerar, así que raspar datos públicos no es una violación del CFAA.

Pero la historia completa de hiQ es la verdadera lección. Tras ganar la batalla del CFAA, hiQ perdió la guerra: en noviembre de 2022 el tribunal concluyó que había incumplido el Acuerdo de Usuario de LinkedIn (que había aceptado al crear cuentas), y el caso terminó en una sentencia homologada — hiQ pagó y aceptó una orden judicial permanente. El CFAA te protege de reclamos de hacking en páginas públicas; no te protege de contratos que has aceptado.

Meta v. Bright Data (enero de 2024) afiló aún más la línea: el tribunal se negó a considerar a Bright Data en incumplimiento por raspar páginas públicas y deslogueadas de Facebook e Instagram, razonando que los términos de las plataformas rigen a los titulares de cuenta actuando como tales — no a visitantes deslogueados recopilando contenido público. La regla práctica que emergió: el scraping público deslogueado es defendible; el scraping logueado contra términos aceptados no lo es. Casos más antiguos de trespass-to-chattels (eBay v. Bidder’s Edge, 2000) aún importan en volúmenes extremos — si tu crawl sobrecarga los servidores de un sitio, reabres esa puerta. Y leyes de privacidad a nivel estatal (la CCPA/CPRA de California, la VCDPA de Virginia y otras) añaden obligaciones de datos personales encima.


La Era de la IA: Litigios de 2025-2026 Que Cambiaron el Mapa

El entrenamiento de IA creó una segunda ola de litigios de scraping — menos sobre “¿estaba autorizado el acceso?” y más sobre contratos, licenciamiento y derechos de autor:

  • Bartz v. Anthropic (junio de 2025, Juez Alsup): entrenar un LLM con libros obtenidos lícitamente es uso justo “extremadamente transformador” — pero el fallo excluyó explícitamente copias-fuente pirateadas. Cómo obtuviste los datos importa tanto como lo que hiciste con ellos.
  • Kadrey v. Meta (junio de 2025, Juez Chhabria): los demandantes perdieron con base en lo que presentaron al expediente, pero la opinión advirtió que esto no era un permiso amplio para el entrenamiento de IA — una victoria estrecha, no una doctrina.
  • Reddit v. Anthropic (presentada en junio de 2025): notable porque Reddit demandó bajo teorías de términos de servicio y enriquecimiento sin causa, no de derechos de autor. A fines de marzo de 2026 un juez federal remitió el caso al tribunal estatal de California, sosteniendo que los reclamos de Reddit no están preemptados por la Ley de Derechos de Autor — confirmando que los reclamos de scraping basados en contrato tienen vida propia.
  • Reddit v. Perplexity, SerpApi, Oxylabs & AWMProxy (oct. 2025, S.D.N.Y.): el primer caso en nombrar a proveedores de infraestructura de scraping como codemandados junto a la empresa de IA. En la primavera de 2026 está en la fase de motion-to-dismiss. Para compradores de proxy, la lección es sobre cadenas de suministro: quién recopila tus datos, y cómo, ahora forma parte de tu exposición legal.
  • NYT v. OpenAI (consolidado, S.D.N.Y.): en enero de 2026 el tribunal ordenó a OpenAI producir una muestra de log de 20 millones de conversaciones en el discovery; el caso prueba si la “regurgitación” de artículos por el modelo socava el uso justo. Aún sin fallo final — pero es el caso con mayor probabilidad de definir los límites del entrenamiento de IA.
  • La economía de licenciamiento es la otra cara: Reddit licencia sus datos a Google (~$60M/año) y a OpenAI; Cloudflare y Stack Overflow lanzaron pay-per-crawl; el protocolo RSL (2025) da a los publishers una forma estándar de fijar precio al acceso de máquinas. “Libre para raspar” y “licenciado para entrenar” son vías que divergen.

Europa: GDPR y los Reguladores Más Estrictos

En la UE (y el Reino Unido), la pregunta rara vez es “¿estaba autorizado el acceso?” — es “¿procesaste datos personales sin una base legal?” Bajo el GDPR, raspar cualquier dato que identifica a una persona (nombres, fotos, perfiles, detalles de contacto) es “procesamiento”, y “era público” no es una base legal por sí sola. El historial de aplicación es inequívoco:

  • Países Bajos (AP) — la línea más dura de Europa. Su orientación de mayo de 2024 llama al scraping de datos personales “casi siempre una violación del GDPR”, y multó a Clearview AI con €30,5 millones por raspar imágenes faciales, con directores advertidos de responsabilidad personal.
  • Italia (Garante) — multó a Clearview con €20 millones y al dueño de un sitio web con €60.000 por raspar datos para construir un directorio telefónico online; su principio declarado: “si es público, puedo tomarlo” es falso.
  • Francia (CNIL) — multó a la corredora de datos de contacto KASPR con €240.000 (decisión de dic. 2024) por raspar detalles de contacto de LinkedIn de usuarios que tenían visibilidad limitada. Su orientación de junio de 2025 permite raspar datos personales públicamente accesibles bajo legitimate interest — pero solo con salvaguardas (listas de exclusión, minimización, transparencia).
  • Reino Unido (ICO) — multó a Clearview con £7,5 millones; el UK GDPR más el Data (Use and Access) Act 2025 mantienen el marco alineado con el de la UE.
  • En toda la UE: la aplicación coordinada de 2026 del EDPB sobre transparencia eleva aún más el escrutinio, y la Directiva de Bases de Datos añade un derecho sui generis separado contra la extracción de partes sustanciales de bases de datos protegidas — un reclamo que existe en Europa pero no en EE.UU.

El matiz crucial: nada de esto apunta a datos no-personales. Precios, listados de productos, disponibilidad, rankings, y reseñas-sin-datos-de-autor están fuera del alcance del GDPR. Los pipelines europeos de inteligencia de precios y SEO funcionan legalmente todos los días — la línea son los datos personales.


El Resto del Mundo, de un Vistazo

Jurisdicción Marco / regulador Postura sobre scraping
Australia Privacy Act 1988 + reforma de 2024 (OAIC) La OAIC concluyó que Clearview violó la Ley al raspar rostros; tort estatutario de privacidad añadido en 2024. Datos públicos de producto: defendible.
Japón APPI (PPC) La dirección es favorable: un proyecto de enmienda a la APPI de 2026 (ante la Dieta) añadiría una exención de consentimiento para el procesamiento estadístico/IA de datos públicos.
Brasil LGPD (ANPD) Aplicación activa (Clearview entre los objetivos); las prioridades de 2026-27 ponen el scraping en la intersección de IA-y-derechos.
India DPDP Act 2023 (en vigencia gradual hasta 2027) Reglas de datos personales endureciéndose; ANI v. OpenAI prueba el entrenamiento de IA con contenido de noticias.
China PIPL + DSL + CSL Estricta con los datos personales y la transferencia transfronteriza; el scraping comercial necesita una revisión cuidadosa de localización.
Turquía KVKK + enmiendas de 2024 Régimen estilo GDPR; multas revaluadas anualmente por inflación.
Países Bajos / Italia / Francia / Reino Unido Ver la sección Europa Los cuatro fiscalizadores más activos en el historial.

Cada guía de país en nuestra biblioteca de blog — de Alemania a Japón — lleva una sección legal local verificada si necesitas profundidad en un mercado específico.


Qué es Defendible vs. Qué es Arriesgado

Generalmente defendible

  • Recopilación pública y de solo-lectura de datos no-personales: precios, specs de producto, stock, rankings, resultados de búsqueda, tarifas aéreas, listados inmobiliarios
  • Acceso solo deslogueado — nada detrás de autenticación
  • Tasas de solicitud a ritmo humano que no sobrecargan la infraestructura del objetivo
  • Honrar el robots.txt y las políticas de crawl publicadas
  • Inteligencia competitiva, investigación de mercado, monitoreo de SEO, verificación de anuncios, investigación académica sobre agregados

Arriesgado a indefendible

  • Raspar datos personales — nombres, fotos, emails, números de teléfono, perfiles — especialmente a escala, especialmente en Europa
  • Raspar detrás de un login, contra términos que aceptaste (la lección de contrato de hiQ)
  • Sortear barreras técnicas: CAPTCHAs presentados como controles de acceso, bloqueos de IP dirigidos específicamente a ti, paywalls
  • Republicar contenido raspado por completo (derechos de autor), o extraer partes sustanciales de bases de datos protegidas (derecho de base de datos de la UE)
  • Volumen que degrada el sitio objetivo (exposición a trespass-to-chattels)
  • Entrenar IA con contenido que obtuviste de fuentes pirateadas o que violan términos (la exclusión de Bartz)

Una Checklist de Cumplimiento para Equipos de Scraping

1. Define el alcance de los datos. Si un campo puede identificar a una persona, trátalo como regulado: o descártalo, o establece una base legal del GDPR con salvaguardas documentadas (la ficha de legitimate-interest de 2025 de la CNIL es el mejor template).

2. Quédate deslogueado. Solo páginas públicas. En el momento en que autenticas, has aceptado un contrato — y los reclamos de contrato son los que ganan.

3. Respeta las señales del sitio. robots.txt, límites de tasa, crawl-delay. No siempre jurídicamente vinculantes, pero lo primero que mira un tribunal o regulador.

4. Diseña para la contención. Cadencia a ritmo humano, caché para evitar re-buscar, sin martillar. El volumen es lo que convierte una disputa de scraping en un reclamo de trespass.

5. Atiende la cadena de suministro. Reddit v. Perplexity nombró a los proveedores de scraping, no solo al comprador de IA. Conoce cómo recopilan tus proveedores de datos, y prefiere infraestructura con pools de IP obtenidos éticamente y basados en consentimiento — la defendibilidad en auditoría ahora se extiende a tu capa de proxy.

6. Separa la recopilación del uso. La recopilación lícita no licencia todo uso: republicación, extracción de bases de datos, y entrenamiento de IA cargan cada uno su propio análisis.

7. Busca asesoría antes de escalar. Un pipeline que está bien a 1.000 solicitudes/día puede necesitar revisión a 10 millones.


¿Los Proxies Son Legales?

Sí. Los proxies son infraestructura de red estándar — la misma tecnología intermediaria detrás de gateways corporativos, CDNs y herramientas de privacidad. Las empresas usan proxies residenciales para ver precios localizados, verificar que los anuncios de hecho se muestran en mercados objetivo, rastrear rankings de búsqueda por ciudad, y probar sitios desde otros países — todas operaciones rutinarias y lícitas. Lo que la ley evalúa es la actividad: raspar datos personales a través de un proxy es exactamente tan regulado como hacerlo directamente, y recopilar precios públicos a través de un proxy es exactamente tan defendible. La única pregunta del lado del proveedor que importa es el sourcing: una red construida sobre IPs residenciales consentidas y obtenidas éticamente mantiene tu capa de recopilación limpia — lo cual, post-Reddit v. Perplexity, tus abogados eventualmente preguntarán.


FAQ

¿El web scraping es legal?

Raspar datos públicos y no-personales es ampliamente legal en la mayoría de las jurisdicciones — el caso hiQ v. LinkedIn (2022) del Noveno Circuito confirmó que raspar páginas públicas no es “acceso no autorizado” bajo el CFAA de EE.UU. El riesgo vive en los detalles: datos personales (multas del GDPR de hasta €30,5M en los casos Clearview), raspar detrás de logins contra términos aceptados (como hiQ acabó perdiendo), sortear barreras técnicas, y republicar contenido protegido por derechos de autor. Los datos públicos de producto, precio y SERP recopilados respetuosamente son el carril defendible.

¿El web scraping es legal en EE.UU.?

Generalmente sí para datos públicos: hiQ v. LinkedIn estableció que raspar páginas públicas no viola el CFAA, y Meta v. Bright Data (2024) se negó a bloquear el scraping deslogueado de páginas públicas de Facebook/Instagram. Pero los reclamos de contrato sobreviven — hiQ perdió por incumplir los términos de LinkedIn que había aceptado — y los volúmenes extremos arriesgan reclamos de trespass. Las leyes estatales de privacidad (CCPA/CPRA) regulan los datos personales encima.

¿El web scraping es legal bajo el GDPR en Europa?

Los datos no-personales (precios, listados, rankings) están totalmente fuera del GDPR. Los datos personales son donde Europa es estricta: la AP holandesa llama al scraping de datos personales “casi siempre una violación” y multó a Clearview con €30,5M; la Garante de Italia la multó con €20M; la CNIL de Francia multó a KASPR con €240K — todas por raspar datos personales públicos. La orientación de 2025 de la CNIL permite el scraping por interés legítimo de datos personales públicos solo con salvaguardas documentadas.

¿Puedo raspar legalmente Amazon, Google, u otras grandes plataformas?

Recopilar datos públicos de producto y búsqueda deslogueado, a tasas respetuosas, es la misma categoría defendible que en cualquier otro lugar — es como operan las industrias de inteligencia de precios y SEO. Los riesgos son específicos de cada plataforma: no inicies sesión (términos), no tomes datos personales (reseñas con identidades de autor), no sobrecargues endpoints, y conoce la postura de fiscalización de cada plataforma. Nuestras guías por plataforma (Amazon, Google Maps, LinkedIn, Reddit) cubren los casos y reglas específicos.

¿Raspar datos para entrenamiento de IA es legal?

Sin definir y dividiéndose en dos cuestiones. Recopilación: las mismas reglas que todo scraping. Entrenamiento: Bartz v. Anthropic (2025) consideró que entrenar con libros obtenidos lícitamente es uso justo transformador, pero excluyó fuentes pirateadas; NYT v. OpenAI prueba si la “regurgitación” de salida derriba el uso justo; los litigios basados en contrato de Reddit contra Anthropic y Perplexity (con sus proveedores de scraping) sobrevivieron las rondas procesales iniciales. Los datos licenciados y las cadenas de suministro limpias se están convirtiendo en el puerto seguro.

¿Los proxies son legales de usar?

Sí — los proxies son infraestructura de red estándar, legales esencialmente en todas partes. La actividad conducida a través del proxy es lo que está regulado: el scraping lícito sigue siendo lícito a través de un proxy, la recopilación ilícita sigue siendo ilícita. Elige proveedores con pools residenciales obtenidos éticamente y basados en consentimiento; después de que Reddit v. Perplexity nombró a proveedores de scraping como demandados, la procedencia de tu infraestructura de recopilación forma parte de tu historia de cumplimiento.

¿Violar el robots.txt hace ilegal el scraping?

El robots.txt no es un estatuto, e ignorarlo no es automáticamente ilegal. Pero los tribunales y reguladores lo tratan como una señal de buena o mala fe, varios fallos lo citan al sopesar reclamos de trespass y contrato, y las salvaguardas de la CNIL esperan que honres los opt-outs. En la práctica: honrar el robots.txt cuesta poco y fortalece materialmente tu defendibilidad — pertenece a todo pipeline en cumplimiento.

¿Qué pasó en hiQ v. LinkedIn, en un párrafo?

hiQ raspó perfiles públicos de LinkedIn para análisis de RR.HH.; LinkedIn envió un cease-and-desist; hiQ demandó y ganó la cuestión de titular — el Noveno Circuito sostuvo (2022) que raspar páginas públicas no es una violación del CFAA. Luego LinkedIn ganó la guerra: el tribunal concluyó que hiQ incumplió el Acuerdo de Usuario que había aceptado, y el caso terminó en una sentencia homologada con hiQ pagando y aceptando una orden judicial permanente. La lección doble: el scraping público no es hacking, pero los contratos que aceptas son exigibles.


Share article: