In this Article
EU AI Act는 이제 웹 데이터 및 AI 팀이 무시할 수 없는 규칙집입니다. 2026년 8월부터 실질적인 집행력이 생기며, 그중 두 가지 의무는 학습 데이터 수집 방식에 직접 적용됩니다. 범용 AI(GPAI) 모델 제공업체는 학습 데이터의 요약을 공개하고, 기계 판독 가능한 옵트아웃을 존중하는 저작권 정책을 운영해야 합니다. 쉽게 말해, 웹사이트가 “데이터 마이닝을 하지 마세요”라고 알리는 robots.txt, ai.txt, TDM 유보와 같은 신호는 이제 EU 시장용 모델을 학습시키는 모든 주체에게 법적 무게를 갖습니다. 이 가이드에서는 무엇이 달라졌는지, 누가 영향을 받는지, 웹 데이터를 수집하는 경우 무엇을 해야 하는지 설명합니다.
저는 웹 데이터 파이프라인을 매일 다루는 AI 네이티브 프랙셔널 CMO Andrii Byzov입니다. 아래는 2026년 현재 기준의 실용적인 개요이며, 중요한 단서로 이는 일반 정보이지 법률 자문이 아닙니다. 관련 내용은 robots.txt와 AI 크롤러 및 웹 스크래핑은 정당한가에서 확인할 수 있습니다.
핵심 사실
- EU AI Act(규정 2024/1689)는 세계 최초의 포괄적인 AI 법률로, 위험 기반으로 2024년부터 2027년까지 단계적으로 적용됩니다.
- GPAI 규칙은 2025년 8월 2일에 시작되었으며, 2026년 8월 2일부터 실질적인 집행력이 생깁니다(GPAI 벌금은 최대 €15M 또는 매출액의 3%, 여기에 고위험 및 투명성 의무가 더해집니다).
- 학습 데이터 요약: GPAI 제공업체는 집행위원회의 의무 템플릿을 사용해 학습 콘텐츠의 개요를 공개해야 합니다.
- 저작권/TDM 옵트아웃: 제공업체는 robots.txt 및 ai.txt 같은 기계 판독 가능 신호를 포함하여 EU 텍스트·데이터 마이닝 예외에 따라 이루어진 권리 유보를 식별하고 존중하는 정책을 갖춰야 합니다.
- 대상은 프록시가 아니라 모델 제공업체입니다: 의무는 누가 EU 시장에 GPAI 모델을 구축하거나 출시하는지, 그리고 데이터를 어떻게 수집하는지에 따라 부과됩니다. 프록시 같은 인프라는 중립적이며, 중요한 것은 무엇을 수집하고 옵트아웃을 준수하는지입니다.
EU AI Act란 무엇이며, 웹 데이터와 관련되는 이유
EU AI Act는 위험 기반 규정입니다. AI 활용을 금지, 고위험, 제한적 위험, 최소 위험 등급으로 구분하고 그에 따라 의무를 정합니다. 대부분은 AI 시스템이 구축되고 배포되는 방식에 관한 내용이지만, 일부는 범용 AI 모델(챗봇과 어시스턴트의 기반이 되는 대형 모델)을 대상으로 하며, 이 부분은 데이터 수집 단계까지 거슬러 올라갑니다. 현대 모델은 웹 규모의 데이터로 학습되므로, 이 법의 투명성 및 저작권 규칙은 사실상 해당 웹 데이터의 수집 및 문서화 방식을 규제합니다.
중요한 일정
| 날짜 | 적용 내용 |
|---|---|
| 2024년 8월 1일 | AI Act 발효 |
| 2025년 2월 2일 | 금지 관행 금지 및 AI 리터러시 의무 |
| 2025년 8월 2일 | GPAI 의무 시작, 학습 데이터 요약 요건 발효 |
| 2026년 8월 2일 | 집행력 강화: GPAI 벌금, 투명성 규칙, 고위험 의무 |
| 2027년 8월 2일 | 기존 GPAI 모델(2025년 8월 이전 출시)은 학습 데이터 요약을 공개해야 함 |
데이터 수집에 직접 적용되는 두 가지 의무
1. 학습 데이터 요약. 제53조에 따라 GPAI 제공업체는 집행위원회 AI 사무국이 공개한 템플릿을 사용하여 모델 학습에 사용한 콘텐츠를 “충분히 상세히 요약”하여 공개해야 합니다. 여기에는 콘텐츠 유형, 데이터 출처, 수집 방법이 포함되며, 라이선스를 받은 데이터세트나 비공개 데이터세트보다 공개적으로 스크래핑한 데이터에 더 자세한 정보를 제공해야 합니다. 실질적인 의미는 다음과 같습니다. 모델 학습을 위해 웹을 스크래핑한다면 데이터가 어디에서 왔는지 파악하고 문서화해야 합니다.
2. 저작권 및 TDM 옵트아웃 정책. 역시 제53조에 따라 제공업체는 EU 저작권법을 준수하고, 특히 DSM 지침 제4조의 텍스트·데이터 마이닝(TDM) 예외에 따라 이루어진 권리 유보를 식별하고 존중하는 정책을 유지해야 합니다. 권리자는 자신의 저작물이 마이닝되지 않도록 유보할 수 있으며, 결정적으로 그러한 유보는 기계 판독 가능 신호를 통해 표시됩니다. GPAI 실천 강령은 서명자가 robots.txt와 기계 판독 가능한 권리 유보 프로토콜을 존중하도록 약속합니다. 이는 법적 의무와 크롤러 구성 사이를 연결하는 고리입니다.
기계 판독 가능 옵트아웃이 이제 법적 무게를 갖습니다
이는 데이터 팀에 가장 중요한 변화입니다. 수년 동안 robots.txt는 순전히 관행이었습니다(robots.txt 및 AI 크롤러 가이드 참고). AI Act의 저작권 체계에 따라 robots.txt, ai.txt 및 새롭게 등장하는 TDM 유보 프로토콜 같은 기계 판독 가능 옵트아웃을 존중하는 일은 GPAI 제공업체의 규정 준수 체계 일부가 됩니다. 유효하고 기계 판독 가능한 “데이터 마이닝 금지” 신호를 무시하는 일은 더 이상 단지 무례한 행동이 아닙니다. 이는 법이 요구하는 저작권 준수 정책을 약화시킬 수 있습니다. 집행위원회는 이러한 유보를 표시하기 위한 표준 프로토콜에 관해 자문까지 진행했습니다.
실제로 적용되는 대상
- GPAI 모델 제공업체: 본사가 어디에 있든 범용 모델을 구축하거나 EU 시장에 출시하는 모든 주체는 학습 데이터 요약 및 저작권 정책 의무를 집니다.
- 스크래핑한 데이터로 EU 사용자를 위한 모델을 학습하거나 미세 조정하는 팀: 문서화 및 옵트아웃 관련 기대를 이어받게 됩니다.
- 해당 파이프라인에 데이터를 공급하는 데이터 공급업체 및 스크래퍼: 수집 관행은 고객의 규정 준수 사슬 일부가 되므로, 데이터 출처와 옵트아웃 처리는 상업적으로도 중요합니다.
GDPR과의 중첩에 유의해야 합니다. 스크래핑한 데이터에 개인정보가 포함되면 AI Act에 더해 EU 데이터 보호법이 적용됩니다. 두 체계는 중첩 적용됩니다.
AI를 위해 웹 데이터를 수집한다면 해야 할 일
- 기계 판독 가능 옵트아웃을 존중합니다. 접하는 출처의 robots.txt 및 TDM/ai.txt 유보를 읽고 준수해야 합니다. 이는 이제 단순한 예절이 아니라 저작권 준수의 일부입니다.
- 데이터 출처를 보존합니다. 각 데이터세트가 어디에서, 언제, 어떻게 수집되었는지 기록하여 학습 데이터 요약을 작성하고 후속 질문에 답할 수 있도록 합니다.
- 공개된 비개인 데이터를 우선합니다. GDPR 노출을 관리하기 위해 개인정보를 선별하고, 로그인이나 접근 통제를 우회하지 않아야 합니다.
- 윤리적이고 투명하게 수집합니다. 동의를 받고 윤리적으로 조달한 인프라와 합리적인 속도를 사용해야 합니다. 도구를 어떻게 조달하는지도 설명해야 할 내용의 일부입니다.
프록시의 역할
프록시는 중립적인 인프라입니다. AI Act는 전송 수단이 아니라 무엇을 수집하는지와 옵트아웃을 준수하는지를 규제합니다. 그렇지만 프록시를 어떻게 조달하는지도 방어 가능하고 윤리적인 파이프라인의 일부이므로 윤리적으로 조달한 레지덴셜 프록시(residential proxy)가 중요합니다. 프록시는 규정 준수 테스트 측면에서도 도움이 됩니다. 국가별로 규칙, 동의 배너, 콘텐츠가 다르므로 현지 IP에서 자체 사이트(또는 대상)가 EU 시장 전반에 어떻게 표시되는지 확인하면 정확한 상황을 파악할 수 있습니다. DataImpulse 프록시는 윤리적으로 조달되며 종량제이고, EU 전역에서 국가 수준의 타기팅을 제공합니다. 이는 책임감 있는 수집 과정의 기반이 되는 깨끗한 인프라 계층이며, 법적 작업을 대체하지는 않습니다.
자주 묻는 질문
EU AI Act는 웹 스크래핑을 금지하나요?
아니요. 스크래핑을 금지하지 않습니다. 이 법은 학습 데이터 요약과 기계 판독 가능 옵트아웃을 존중하는 저작권 정책을 요구하는 범용 AI 모델 제공업체를 규제하며, 이는 간접적으로 학습 데이터의 수집 및 문서화 방식에 영향을 줍니다.
EU AI Act는 언제부터 집행되나요?
2024년 8월 1일에 발효되었으며 단계적으로 적용됩니다. GPAI 의무는 2025년 8월 2일부터, GPAI 벌금 최대 €15M 또는 매출액의 3%, 투명성 및 고위험 의무를 포함한 집행력 강화는 2026년 8월 2일부터 적용됩니다.
학습 데이터 요약이란 무엇인가요?
제53조에 따라 GPAI 제공업체는 집행위원회의 의무 템플릿을 사용하여 모델 학습에 사용한 콘텐츠를 충분히 상세하게 개괄하여 공개해야 합니다. 여기에는 콘텐츠 유형, 출처, 수집 방법이 포함되며 공개적으로 스크래핑한 데이터에는 더 자세한 정보가 필요합니다.
AI Act에 따라 robots.txt를 존중해야 하나요?
EU 시장용 모델을 학습시킨다면 실질적으로 그렇습니다. 이 법의 저작권 규칙은 기계 판독 가능 신호로 표시된 텍스트·데이터 마이닝 옵트아웃을 존중하도록 요구하며, GPAI 실천 강령은 robots.txt와 권리 유보 프로토콜 준수를 약속합니다.
AI Act는 EU 외 기업에도 적용되나요?
그렇습니다. 의무는 소재지와 관계없이 EU 시장에 범용 AI 모델을 출시하는 제공업체에 부과되므로, EU 사용자에게 서비스를 제공하는 EU 외 팀도 적용 대상입니다.
깨끗하고 윤리적인 인프라로 AI 데이터 파이프라인을 구축하세요
책임감 있는 AI 데이터 수집은 사이트 신호를 존중하고 윤리적으로 조달한 IP에서 운영하는 것으로 시작합니다. $1/GB부터 윤리적으로 조달한 레지덴셜 프록시를 이용하세요. 종량제, EU 및 전 세계 지원, 책임감 있는 수집과 테스트를 위한 지역 제어를 제공합니다.
이 글은 일반 정보이지 법률 자문이 아닙니다. EU AI Act, DSM 지침 및 GDPR에 따른 구체적인 의무에 대해서는 자격을 갖춘 법률 자문가와 상담하시기 바랍니다.
