In this Article
《欧盟人工智能法案》如今已成为网络数据和 AI 团队不可忽视的一套规则。自 2026 年 8 月起,该法案将得到实质性执行,其中两项义务直接关系到训练数据的收集方式:通用 AI (GPAI) 模型提供商必须发布训练数据摘要,并落实一项尊重机器可读退出信号的版权政策。简单说,网站用来表达”不要抓取我”的信号,例如 robots.txt、ai.txt 和 TDM 权利保留声明,如今对任何面向欧盟市场训练模型的人都具有法律意义。本文将说明有哪些变化、哪些主体会受影响,以及收集网络数据时应如何应对。
我是 Andrii Byzov,一名专注于 AI 的兼职 CMO,日常工作与网络数据管道密切相关。以下是一份实用的概览,截至 2026 年仍然适用;但请特别注意,本文仅提供一般信息,并非法律建议。相关延伸阅读可参见 robots.txt 和 AI 爬虫 以及 网络抓取是否合法。
关键事实
- EU AI Act (Regulation 2024/1689) 是全球首部全面规范 AI 的法律,以风险为基础,并将在 2024 年至 2027 年间分阶段实施。
- GPAI 规则已于 2 Aug 2025 开始适用; 执法措施将于 2 Aug 2026 开始实施(GPAI 罚款最高可达 €15M 或营业额的 3%,同时还涉及高风险和透明度义务)。
- 训练数据摘要:GPAI 提供商必须使用欧盟委员会规定的模板,发布训练内容概览。
- 版权 / TDM 退出机制:提供商必须制定政策,识别并尊重依据欧盟文本与数据挖掘例外所作出的权利保留,包括通过 robots.txt、ai.txt 等机器可读信号作出的保留。
- 监管对象是模型提供商,而非代理:相关义务适用于在欧盟市场开发或投放 GPAI 模型的主体,也涉及其数据收集方式。代理等基础设施本身是中立的;关键在于收集哪些数据,以及是否遵守退出要求。
什么是欧盟《AI Act》,它为何会影响网页数据
欧盟《AI Act》是一项以风险为基础的法规:它将 AI 的用途分为禁止、高风险、有限风险和最低风险等类别,并规定相应义务。法案的大部分内容围绕 AI 系统的开发和部署,但其中一部分专门针对 通用 AI 模型,即聊天机器人和助手背后的大型模型,而这些要求会延伸至数据收集阶段。由于现代模型是在网络规模的数据上训练的,因此,法案中的透明度和版权规则也会规范这些网页数据的收集和记录方式。
关键时间线
| 日期 | 适用内容 |
|---|---|
| 1 Aug 2024 | 《AI Act》正式生效 |
| 2 Feb 2025 | 被禁止做法的禁令 + AI 素养义务 |
| 2 Aug 2025 | GPAI 义务开始适用;训练数据摘要要求生效 |
| 2 Aug 2026 | 开始执行:GPAI 罚款、透明度规则和高风险义务 |
| 2 Aug 2027 | 既有 GPAI 模型(2025 年 8 月前投放市场)必须发布训练数据摘要 |
影响数据收集的两项义务
1. 训练数据摘要。 根据第 53 条,GPAI 提供商必须使用委员会 AI Office 发布的模板,公布用于训练模型的内容的”足够详细的摘要”。该模板要求说明内容类型、数据来源以及收集方法。与获得授权的数据或私有数据集相比,公开抓取的数据预计需要披露更多细节。实际影响是:如果抓取网页来训练模型,就需要了解并记录数据的来源。
2. 版权与 TDM 退出政策。 同样根据第 53 条,提供方必须维护一项政策,以遵守欧盟版权法,尤其是识别并尊重 DSM 指令(第 4 条)中根据文本与数据挖掘(TDM)例外作出的权利保留。权利人可以保留其作品不被挖掘的权利;关键在于,这类保留通过机器可读信号表达。GPAI 行为准则要求签署方尊重 robots.txt 以及机器可读的权利保留协议。这正是法律义务与爬虫配置相交之处。
机器可读的退出声明现在具有法律分量
这是对数据团队而言最重要的变化。多年来,robots.txt 只是一项行业惯例(参见我们的 robots.txt 和 AI 爬虫指南)。在《AI Act》的版权制度下,遵守机器可读的退出声明,例如 robots.txt、ai.txt 及新兴的 TDM 权利保留协议,已成为 GPAI 提供商合规要求的一部分。无视有效的机器可读”不要抓取”信号,不再只是有失礼节,也可能削弱法案要求的版权合规政策。委员会甚至已经就表达这些保留的标准协议开展了咨询。
这些规定实际上适用于哪些主体
- GPAI 模型提供商:任何在欧盟市场开发或投放通用模型的主体,无论总部位于何处,都须履行训练数据摘要和版权政策义务。
- 为欧盟用户训练或微调模型的团队:如果使用抓取数据,就应满足有关记录和退出机制的预期要求。
- 数据供应商和抓取服务商:向这类数据管道提供数据时,你们的采集做法会成为客户合规链的一环,因此数据来源和退出机制的处理具有商业意义。
注意与 GDPR 的重叠:如果抓取的数据包含个人信息,欧盟数据保护法将在 AI Act 之外同样适用。两套制度会同时适用。
如果你为 AI 采集网络数据,该怎么做
- 遵守机器可读的退出声明。 读取并尊重所采集来源的 robots.txt 以及 TDM/ai.txt 权利保留声明。这如今是版权合规的一部分,而不只是礼仪。
- 保留来源记录。 记录每个数据集的来源、采集时间和采集方式,以便填写训练数据摘要,并回应下游环节的问题。
- 优先使用公开且不含个人信息的数据,并筛查个人信息以控制 GDPR 风险;不要绕过登录或访问控制。
- 以合乎道德且透明的方式采集。 使用取得同意、来源合乎道德的基础设施,并保持合理速率。所用工具的来源也是可能需要说明的事项。
代理在其中的作用
代理是中立的基础设施:AI Act 监管的是采集什么以及是否遵守退出声明,而非数据的传输方式。不过,代理的来源也是可辩护、合乎道德的数据管道的一部分,因此来源合乎道德的住宅 IP 很重要。代理也有助于合规测试:由于不同国家/地区的规则、同意横幅和内容有所不同,使用本地 IP 检查你自己的网站(或目标网站)在欧盟各市场中的呈现方式,可以帮助你准确了解实际呈现效果。DataImpulse 的代理来源合乎道德,采用按需付费模式,并支持欧盟范围内的国家级定位。它为负责任的数据采集流程提供可靠的基础设施层,而不能替代法律工作。
常见问题
欧盟 AI 法案会禁止网页抓取吗?
不会。它并不禁止抓取。该法案监管的是通用 AI 模型提供商,要求其提供训练数据摘要,并制定尊重机器可读退出声明的版权政策。这会间接影响训练数据的收集和记录方式。
欧盟 AI 法案何时开始执行?
该法案已于 1 August 2024 生效,并分阶段实施:GPAI 义务自 2 August 2025 起适用,而执行措施(GPAI 罚款最高可达 €15M 或营业额的 3%,以及透明度和高风险义务)自 2 August 2026 起适用。
什么是训练数据摘要?
根据第 53 条,GPAI 提供商必须使用委员会的强制模板,发布对其模型训练所用内容的足够详细概览,涵盖内容类型、来源和收集方法;对于公开抓取的数据,需要提供更多细节。
根据 AI 法案,我必须遵守 robots.txt 吗?
如果你为欧盟市场训练模型,实际上需要遵守。该法案的版权规则要求尊重通过机器可读信号表达的文本与数据挖掘退出声明,而 GPAI 行为准则承诺遵守 robots.txt 和权利保留协议。
AI 法案是否适用于非欧盟公司?
是的。相关义务适用于将通用 AI 模型投放到欧盟市场的提供商,无论其所在地在哪里,因此为欧盟用户提供服务的非欧盟团队也在适用范围内。
在可靠、合乎道德的基础设施上构建您的 AI 数据管道
负责任的 AI 数据采集始于尊重网站信号,并使用来源合乎道德的 IP。获取 $1/GB 起的来源合乎道德的住宅代理,按量付费,覆盖欧盟和全球范围,并提供地理位置控制,帮助你负责任地采集和测试。
本文仅提供一般信息,不构成法律建议。请就您在 EU AI Act、DSM Directive 和 GDPR 下的具体义务咨询合格的法律顾问。
