In this Article
EU AI Act to teraz zbiór zasad, którego zespoły zajmujące się danymi internetowymi i sztuczną inteligencją nie mogą zignorować. Od sierpnia 2026 r. zyskuje realne możliwości egzekwowania prawa, a dwa z jego obowiązków dotyczą bezpośrednio sposobu gromadzenia danych szkoleniowych: dostawcy modeli sztucznej inteligencji ogólnego przeznaczenia (GPAI) muszą publikować podsumowanie swoich danych szkoleniowych i prowadzić politykę praw autorskich uwzględniającą możliwość rezygnacji z odczytu maszynowego. Mówiąc najprościej, sygnały używane przez witrynę internetową w celu powiedzenia „nie kopaj mnie” – rezerwacje robots.txt, ai.txt, TDM – mają teraz wagę prawną dla każdego, kto szkoli modelki na rynek UE. W tym przewodniku wyjaśniono, co się zmieniło, kogo to dotyczy i co zrobić w przypadku gromadzenia danych internetowych.
Nazywam się Andrii Byzov i mam Fractional CMO z natywną sztuczną inteligencją, który na co dzień pracuje z potokami danych internetowych. Poniżej znajduje się praktyczny przegląd na rok 2026 – z ważnym zastrzeżeniem, że są to informacje ogólne, a nie porada prawna. Aby zapoznać się z sąsiednim czytaniem, zobrobots.txt i AI crawlersIjest web scraping legalny.
Kluczowe fakty
- EU AI Act (rozporządzenie 2024/1689)to pierwsze na świecie kompleksowe prawo dotyczące sztucznej inteligencji – oparte na ryzyku, wprowadzane stopniowo w latach 2024–2027.
- Zasady GPAI rozpoczęły się 2 sierpnia 2025 r.;pojawiają się zęby egzekwowania2 sierpnia 2026 r(Kary GPAI do 15 mln EUR lub 3% obrotu plus obowiązki związane z wysokim ryzykiem i przejrzystością).
- Podsumowanie danych treningowych:Dostawcy GPAI muszą publikować przegląd treści swoich szkoleń, korzystając z obowiązkowego szablonu Komisji.
- Prawa autorskie / TDM rezygnacja:dostawcy muszą posiadać politykę identyfikującą i respektującą zastrzeżenia praw złożone w ramach unijnego wyjątku dotyczącego eksploracji tekstów i danych – w tym za pośrednictwem sygnałów odczytywalnych maszynowo, takich jak robots.txt i ai.txt.
- Jest skierowany do dostawców modeli, a nie proxies:obowiązki dotyczą tego, kto buduje/umieszcza modele GPAI na rynku UE i sposobu gromadzenia danych – infrastruktura taka jak proxies jest neutralna; liczy się to, co zbierasz i czy honorujesz rezygnację.
Czym jest EU AI Act – i dlaczego wpływa na dane internetowe
EU AI Act to regulacja oparta na ryzyku: dzieli zastosowania sztucznej inteligencji na poziomy zabronione, wysokiego ryzyka, ograniczonego i minimalnego ryzyka oraz odpowiednio ustala obowiązki. Większość z nich dotyczy tego, jak sztuczna inteligencjasystemysą budowane i wdrażane – ale dotyczą konkretnego wycinkamodele sztucznej inteligencji ogólnego przeznaczenia(duże modele stojące za chatbotami i asystentami), a ten wycinek sięga etapu gromadzenia danych. Ponieważ nowoczesne modele są szkolone na danych internetowych, zawarte w ustawie przepisy dotyczące przejrzystości i praw autorskich skutecznie regulują sposób gromadzenia i dokumentowania tych danych internetowych.
Harmonogram, który ma znaczenie
| Data | Co ma zastosowanie |
|---|---|
| 1 sierpnia 2024 r | AI Act wchodzi w życie |
| 2 lutego 2025 r | Zakazy praktyk zabronionych + obowiązki w zakresie umiejętności korzystania z sztucznej inteligencji |
| 2 sierpnia 2025 r | Rozpoczyna się obowiązek GPAI; wymaganie podsumowania danych szkoleniowych zaczyna obowiązywać |
| 2 sierpnia 2026 r | Zęby egzekucyjne: kary GPAI, zasady przejrzystości, obowiązki obarczone wysokim ryzykiem |
| 2 sierpnia 2027 r | Starsze modele GPAI (wystawione przed sierpniem 2025 r.) muszą publikować podsumowanie danych szkoleniowych |
Dwa obowiązki, które wpływają na gromadzenie danych
1. Podsumowanie danych treningowych.Zgodnie z art. 53 dostawcy GPAI muszą opublikować „wystarczająco szczegółowe podsumowanie” treści wykorzystanych do uczenia modelu, korzystając z szablonu opublikowanego przez Biuro ds. AI Komisji. Pyta o rodzaje treści, źródła danych i metody gromadzenia – przy czym oczekuje się większej szczegółowości w przypadku danych pobieranych publicznie niż w przypadku licencjonowanych lub prywatnych zbiorów danych. Praktyczny efekt: jeśli zeskrobujesz sieć, aby wytrenować model, musisz to zrobićznać i dokumentowaćskąd pochodzą Twoje dane.
2. Polityka praw autorskich i rezygnacji TDM.Również na mocy art. 53 dostawcy muszą prowadzić politykę mającą na celu przestrzeganie unijnego prawa autorskiego, a w szczególności identyfikację i poszanowaniezastrzeżenia praw dokonane w ramach wyjątku dotyczącego eksploracji tekstów i danych (TDM).Dyrektywy DSM (art. 4). Posiadacze praw mogą zastrzec swoje utwory przed wydobyciem i – co najważniejsze – zastrzeżenia te są wyrażane za pośrednictwemsygnały odczytywalne maszynowo. Kodeks postępowania GPAI zobowiązuje sygnatariuszy do przestrzegania robots.txt i protokołów rezerwacji praw do odczytu maszynowego. To pomost pomiędzy obowiązkiem prawnym a konfiguracją crawler.
Możliwość odczytu maszynowego rezygnacji ma teraz wagę prawną
To najważniejsza zmiana dla zespołów zajmujących się danymi. Przez lata robots.txt było po prostu normą (zobacz naszePoradnik robots.txt i AI crawlers). Zgodnie z systemem praw autorskich AI Act honorowanie odczytywalnych maszynowo rezygnacji z usług – robots.txt, ai.txt i nowych protokołów rezerwacji TDM – staje się częścią historii zgodności dostawcy GPAI. Ignorowanie ważnego, czytelnego maszynowo sygnału „nie wydobywaj” nie jest już tylko niegrzeczne; może podważyć politykę przestrzegania praw autorskich wymaganą przez ustawę. Komisja przeprowadziła nawet konsultacje w sprawie standardowych protokołów wyrażania tych zastrzeżeń.
Kogo to właściwie dotyczy
- Dostawcy modelu GPAI– każdy, kto tworzy lub wprowadza na rynek UE model ogólnego przeznaczenia, ponosi obowiązki związane z podsumowaniem danych szkoleniowych i polityką praw autorskich, niezależnie od tego, gdzie ma siedzibę.
- Zespoły szkolą lub dostrajają modeledla użytkowników z UE w przypadku zeskrobanych danych – dziedziczysz dokumentację i oczekiwania dotyczące rezygnacji.
- Dostawcy danych i skrobakizasilanie tych rurociągów – Twoje praktyki gromadzenia danych stają się częścią łańcucha zgodności klienta, więc pochodzenie i obsługa rezygnacji mają znaczenie komercyjne.
Zwróć uwagę na nakładanie się zRODO: jeśli zeskrobane dane zawierają dane osobowe, oprócz AI Act obowiązuje prawo UE dotyczące ochrony danych. Oba reżimy nakładają się na siebie.
Co zrobić, jeśli zbierasz dane internetowe dla AI
- Honoruj rezygnację z odczytu maszynowego.Przeczytaj i szanuj zastrzeżenia robots.txt i TDM/ai.txt dotyczące źródeł, których dotykasz – jest to teraz część przestrzegania praw autorskich, a nie tylko etykiety.
- Zachowaj pochodzenie.Zapisz, skąd pochodzi każdy zestaw danych, kiedy i w jaki sposób został zebrany, aby móc wypełnić podsumowanie danych szkoleniowych i odpowiedzieć na dalsze pytania.
- Preferuj dane publiczne, nieosobowei ekran danych osobowych w celu zarządzania narażeniem na RODO; nie omijaj loginów ani kontroli dostępu.
- Zbieraj etycznie i przejrzyście.Korzystaj z zatwierdzonej, etycznie pozyskiwanej infrastruktury i rozsądnych stawek – pozyskiwanie narzędzi jest częścią historii, którą zostaniesz poproszony o opowiedzenie.
Gdzie pasuje proxies
Serwery proxy są infrastrukturą neutralną: AI Act regulujeCozbierasz i czy honorujesz rezygnację z transportu, a nie transport. To powiedziawszy, pozyskiwanie proxies jest częścią dającego się obronić, etycznego rurociągu – i dlategopozyskiwane etycznieresidential IPs sprawa. Serwery proxy są również pomocne po stronie testowania zgodności: ponieważ zasady, banery zgody i treść różnią się w zależności od kraju, sprawdzenie, jak Twoja witryna (lub cel) prezentuje się na rynkach UE za pomocą lokalnych IP, daje dokładny obraz. DataImpulse proxies pochodzą z etycznych źródeł, a pay-as-you-go są ukierunkowane na poziomie krajowym w całej UE – warstwa czystej infrastruktury podlegająca odpowiedzialnemu procesowi gromadzenia danych, a nie substytut pracy prawnej.
Często zadawane pytania
Czy EU AI Act blokuje web scraping?
Nie. Nie zabrania skrobania. Reguluje dostawców modeli sztucznej inteligencji ogólnego przeznaczenia – wymagających podsumowania danych szkoleniowych i polityki dotyczącej praw autorskich uwzględniającej możliwość rezygnacji z odczytu maszynowego – co pośrednio kształtuje sposób gromadzenia i dokumentowania danych szkoleniowych.
Kiedy zaczyna obowiązywać EU AI Act?
Weszło w życie 1 sierpnia 2024 r. i wprowadza stopniowo: zobowiązania GPAI od 2 sierpnia 2025 r. oraz elementy egzekwowania prawa (kary GPAI do 15 mln euro lub 3% obrotu, obowiązki związane z przejrzystością i wysokim ryzykiem) od 2 sierpnia 2026 r.
Co to jest podsumowanie danych szkoleniowych?
Zgodnie z art. 53 dostawcy GPAI muszą publikować wystarczająco szczegółowy przegląd treści wykorzystywanych do uczenia ich modelu, korzystając z obowiązkowego szablonu Komisji – obejmującego typy treści, źródła i metody gromadzenia, z większymi szczegółami dotyczącymi danych pobieranych publicznie.
Czy muszę przestrzegać robots.txt w ramach AI Act?
Skutecznie tak, jeśli szkolisz modele na rynek UE. Zasady dotyczące praw autorskich zawarte w ustawie wymagają przestrzegania rezygnacji z eksploracji tekstów i danych wyrażonych za pomocą sygnałów odczytywalnych maszynowo, a Kodeks postępowania GPAI zobowiązuje się do honorowania robots.txt i protokołów rezerwacji praw.
Czy AI Act ma zastosowanie do firm spoza UE?
Tak. Obowiązki nakładają się na dostawców wprowadzających modele sztucznej inteligencji ogólnego przeznaczenia na rynek UE, niezależnie od tego, gdzie mają siedzibę, zatem zakres obejmuje zespoły spoza UE obsługujące użytkowników z UE.
Zbuduj potok danych AI w oparciu o czystą i etyczną infrastrukturę
Odpowiedzialne gromadzenie danych AI zaczyna się od honorowania sygnałów z witryny i korzystania z IP pochodzących z etycznych źródeł.Zdobądź etyczny residential proxies od 1 USD/GB– pay-as-you-go, zasięg w UE i na całym świecie, z kontrolą geograficzną w celu odpowiedzialnego gromadzenia i testowania.
Artykuł ten ma charakter informacji ogólnej, a nie porady prawnej. Skonsultuj się z wykwalifikowanym doradcą w sprawie konkretnych obowiązków wynikających z EU AI Act, DSM i RODO.
