In this Article
La Ley de IA de la UE es ahora el reglamento que los equipos de datos web e IA no pueden ignorar. A partir de agosto de 2026, adquiere mecanismos reales de aplicación, y dos de sus obligaciones impactan directamente en cómo se recopilan los datos de entrenamiento: los proveedores de modelos de IA de propósito general (GPAI) deben publicar un resumen de sus datos de entrenamiento y aplicar una política de derechos de autor que respete las exclusiones legibles por máquina. En términos simples, las señales que usa un sitio web para decir “no me extraigas datos” — robots.txt, ai.txt, reservas TDM — ahora tienen peso legal para cualquiera que entrene modelos para el mercado de la UE. Esta guía explica qué cambió, a quién afecta y qué hacer si recopilas datos web.
Soy Andrii Byzov, un CMO fraccional AI-Native que trabaja a diario con pipelines de datos web. A continuación, encontrarás una visión general práctica y actualizada para 2026, con la advertencia importante de que se trata de información general, no de asesoramiento legal. Para lecturas relacionadas, consulta robots.txt y crawlers de IA y es legal el web scraping.
Datos clave
- La Ley de IA de la UE (Reglamento 2024/1689) es la primera ley integral de IA del mundo: basada en riesgos, con implementación gradual de 2024 a 2027.
- Las reglas de GPAI comenzaron el 2 Aug 2025; la capacidad de aplicación llega el 2 Aug 2026 (multas de GPAI de hasta €15M o 3% de la facturación, además de obligaciones de alto riesgo y transparencia).
- Resumen de datos de entrenamiento: los proveedores de GPAI deben publicar una descripción general de su contenido de entrenamiento usando la plantilla obligatoria de la Comisión.
- Copyright / exclusión de TDM: los proveedores deben contar con una política que identifique y respete las reservas de derechos realizadas conforme a la excepción de minería de texto y datos de la UE, incluso mediante señales legibles por máquina como robots.txt y ai.txt.
- Se dirige a los proveedores de modelos, no a los proxies: las obligaciones recaen en quienes desarrollan/colocan modelos GPAI en el mercado de la UE y en cómo se recopilan los datos; la infraestructura como los proxies es neutral; lo que importa es qué recopilas y si respetas las exclusiones.
Qué es la Ley de IA de la UE y por qué afecta a los datos web
La Ley de IA de la UE es una regulación basada en riesgos: clasifica los usos de la IA en niveles prohibidos, de alto riesgo, de riesgo limitado y de riesgo mínimo, y establece obligaciones según corresponda. La mayor parte trata sobre cómo se crean e implementan los sistemas de IA, pero una sección específica se enfoca en los modelos de IA de propósito general (los grandes modelos detrás de chatbots y asistentes), y esa sección alcanza la etapa de recopilación de datos. Debido a que los modelos modernos se entrenan con datos a escala web, las reglas de transparencia y derechos de autor de la Ley regulan en la práctica cómo se recopilan y documentan esos datos web.
El cronograma importante
| Fecha | Qué aplica |
|---|---|
| 1 Aug 2024 | La Ley de IA entra en vigor |
| 2 Feb 2025 | Prohibiciones de prácticas prohibidas + obligaciones de alfabetización en IA |
| 2 Aug 2025 | Comienzan las obligaciones de GPAI; entra en vigor el requisito de resumen de datos de entrenamiento |
| 2 Aug 2026 | Medidas de cumplimiento: multas de GPAI, reglas de transparencia, obligaciones de alto riesgo |
| 2 Aug 2027 | Los modelos GPAI heredados (puestos en el mercado antes de Aug 2025) deben publicar su resumen de datos de entrenamiento |
Dos obligaciones que impactan la recopilación de datos
1. El resumen de datos de entrenamiento. Según el Artículo 53, los proveedores de GPAI deben publicar un “resumen suficientemente detallado” del contenido utilizado para entrenar el modelo, usando una plantilla publicada por la Oficina de IA de la Comisión. Solicita los tipos de contenido, las fuentes de datos y los métodos de recopilación, con un mayor nivel de detalle esperado para datos extraídos públicamente que para conjuntos de datos licenciados o privados. El efecto práctico: si extraes datos de la web para entrenar un modelo, necesitas saber y documentar de dónde provienen tus datos.
2. La política de derechos de autor y exclusión de TDM. También según el Artículo 53, los proveedores deben mantener una política para cumplir con la legislación de derechos de autor de la UE y, en particular, para identificar y respetar las reservas de derechos realizadas bajo la excepción de minería de texto y datos (TDM) de la Directiva DSM (Artículo 4). Los titulares de derechos pueden reservar sus obras para que no sean minadas y, algo crucial, esas reservas se expresan mediante señales legibles por máquina. El Código de Práctica de GPAI compromete a sus signatarios a respetar robots.txt y los protocolos de reserva de derechos legibles por máquina. Ese es el puente entre una obligación legal y la configuración de tu crawler.
Las exclusiones legibles por máquina ahora tienen peso legal
Este es el cambio más importante para los equipos de datos. Durante años, robots.txt fue simplemente una norma (consulta nuestra guía sobre robots.txt y crawlers de IA). Bajo el régimen de derechos de autor de la Ley de IA, respetar las exclusiones legibles por máquina — robots.txt, ai.txt y los protocolos emergentes de reserva de TDM — pasa a formar parte de la estrategia de cumplimiento de un proveedor de GPAI. Ignorar una señal válida y legible por máquina de “no minar” ya no es solo una falta de cortesía; puede debilitar la política de cumplimiento de derechos de autor que exige la Ley. La Comisión incluso ha realizado consultas sobre protocolos estándar para expresar estas reservas.
A quién se aplica realmente esto
- Proveedores de modelos GPAI — cualquiera que cree o coloque un modelo de propósito general en el mercado de la UE asume las obligaciones de resumen de datos de entrenamiento y política de derechos de autor, sin importar dónde tenga su sede.
- Equipos que entrenan o ajustan modelos para usuarios de la UE con datos extraídos mediante scraping — heredan las expectativas de documentación y de gestión de exclusiones voluntarias.
- Proveedores de datos y scrapers que alimentan esos flujos — sus prácticas de recopilación pasan a formar parte de la cadena de cumplimiento de un cliente, por lo que la procedencia y la gestión de exclusiones voluntarias importan comercialmente.
Tenga en cuenta la superposición con GDPR: si los datos extraídos mediante scraping contienen información personal, la ley de protección de datos de la UE se aplica además de la AI Act. Ambos regímenes se acumulan.
Qué hacer si recopila datos web para IA
- Respete las exclusiones voluntarias legibles por máquina. Lea y respete las reservas de robots.txt y TDM/ai.txt de las fuentes que utiliza — ahora forma parte del cumplimiento de derechos de autor, no solo de la etiqueta.
- Mantenga la procedencia. Registre de dónde provino cada conjunto de datos, cuándo y cómo se recopiló, para poder completar un resumen de datos de entrenamiento y responder preguntas posteriores.
- Prefiera datos públicos y no personales y filtre la información personal para gestionar la exposición a GDPR; no eluda inicios de sesión ni controles de acceso.
- Recopile de forma ética y transparente. Use infraestructura consentida, de origen ético, y tasas razonables — el origen de sus herramientas forma parte de la historia que se le pedirá contar.
Dónde encajan los proxies
Los proxies son infraestructura neutral: la AI Act regula qué recopila y si respeta las exclusiones voluntarias, no el transporte. Dicho esto, el origen de sus proxies forma parte de un flujo defendible y ético, por eso importan las IP residenciales de origen ético. Los proxies también ayudan en el aspecto de pruebas de cumplimiento: como las reglas, los banners de consentimiento y el contenido varían según el país, comprobar cómo se presenta su propio sitio (o un objetivo) en los mercados de la UE desde IP locales le da una imagen precisa. Los proxies de DataImpulse son de origen ético y de pago por uso, con segmentación por país en toda la UE: la capa de infraestructura limpia bajo un proceso de recopilación responsable, no un sustituto del trabajo legal.
Preguntas frecuentes
¿La Ley de IA de la UE prohíbe el web scraping?
No. No prohíbe el scraping. Regula a los proveedores de modelos de IA de propósito general, exigiendo un resumen de los datos de entrenamiento y una política de derechos de autor que respete las exclusiones legibles por máquina, lo que influye indirectamente en cómo se recopilan y documentan los datos de entrenamiento.
¿Cuándo comienza a aplicarse la Ley de IA de la UE?
Entró en vigor el 1 August 2024 y se implementa por fases: obligaciones de GPAI desde el 2 August 2025, y mecanismos de aplicación (multas de GPAI de hasta €15M o 3% de la facturación, obligaciones de transparencia y de alto riesgo) desde el 2 August 2026.
¿Qué es el resumen de datos de entrenamiento?
Según el Artículo 53, los proveedores de GPAI deben publicar una descripción general suficientemente detallada del contenido utilizado para entrenar su modelo, usando la plantilla obligatoria de la Comisión, que cubre tipos de contenido, fuentes y métodos de recopilación, con más detalle para los datos extraídos públicamente mediante scraping.
¿Tengo que respetar robots.txt según la Ley de IA?
En la práctica, sí, si entrenas modelos para el mercado de la UE. Las normas de derechos de autor de la Ley exigen respetar las exclusiones de minería de texto y datos expresadas mediante señales legibles por máquina, y el Código de Buenas Prácticas de GPAI se compromete a respetar robots.txt y los protocolos de reserva de derechos.
¿La Ley de IA aplica a empresas no pertenecientes a la UE?
Sí. Las obligaciones se aplican a los proveedores que introducen modelos de IA de propósito general en el mercado de la UE, independientemente de dónde estén establecidos, por lo que los equipos no pertenecientes a la UE que atienden a usuarios de la UE están dentro del alcance.
Cree su pipeline de datos de IA sobre una infraestructura limpia y ética
La recopilación responsable de datos para IA comienza por respetar las señales de los sitios y operar con IPs de origen ético. Obtenga proxies residenciales de origen ético desde $1/GB — pago por uso, cobertura en la UE y global, con control geográfico para recopilar y probar de forma responsable.
Este artículo ofrece información general, no asesoramiento legal. Consulte con un asesor jurídico calificado sobre sus obligaciones específicas conforme a la Ley de IA de la UE, la Directiva DSM y el GDPR.
