Is Web Scraping Legal 2026 - DataImpulse banner cover

网页抓取合法吗?网页抓取的合法性取决于四件事:你抓取什么(公开产品价格与个人资料)、你如何抓取(公开页面与登录后内容)、你在哪里运营(美国的 CFAA 规则与欧洲的 GDPR),以及你会如何处理这些数据(价格监控与 AI 训练)。因此,当人们问”从网站抓取数据是否合法”时,诚实的答案是:在大多数司法管辖区,抓取公开可用的非个人数据总体上是合法的,但上述每个因素都会影响你的做法是合规稳妥,还是可能面临监管处罚。本指南将梳理标志性案例、2025–2026 年 AI 时代的诉讼、各主要监管机构的立场,以及一套实用的合规框架。

先说明一点:这是一般信息,不构成法律建议。在扩大商业抓取规模之前,请在你所在司法管辖区以及目标网站所在司法管辖区寻求法律建议。


要点

  • 抓取公开的非个人数据通常是合法的,细节(抓取什么、如何抓取、在哪里抓取、为何抓取)决定一切。
  • 对于个人数据而言,”公开”并不意味着”可自由获取”,欧盟监管机构会因此开出罚单(Clearview:荷兰 €30.5M、意大利 €20M、英国 £7.5M)。
  • 未登录与已登录的界线越来越得到法院支持,未登录抓取公开数据通常更站得住脚(hiQ、Meta v. Bright Data);但在已接受条款后绕过登录限制则不然。
  • AI 时代增加了合同、许可和版权主张收集的合法性与训练的合法性现在是两个独立问题。
  • 代理本身是合法的,决定合法性的是行为,而不是工具。

常见问题速览

问题 简要回答
抓取公开的产品/价格数据合法吗? 通常合法,通常是风险最低、最容易站得住脚的情形
抓取个人数据(姓名、资料、联系方式)合法吗? 高风险,即使数据是公开的,GDPR 监管机构也会因此处罚
抓取登录后才能访问的内容合法吗? 有风险,你已经接受了条款;即使 CFAA 主张不成立,合同索赔仍可能成立
违反 robots.txt 是违法的吗? 其本身并不是法律,但法院和监管机构会将其视为恶意行为的证据
使用代理合法吗? 合法,决定合法性的是活动本身,而不是工具
为 AI 训练抓取数据合法吗? 尚无定论,合法获取的数据在合理使用方面有胜诉案例,但合同/许可诉讼正在增多

关于网络抓取合法性的常见误区

人们对网络抓取合法性的大多数困惑,都源于将技术能力与法律许可混为一谈。在进入细节之前,有三个误区值得先澄清。

误区 1:网络抓取就是黑客行为

抓取公开页面并不是未经授权的访问,抓取程序请求的页面,与普通浏览器请求的是同一个。美国第九巡回上诉法院在 hiQ v. LinkedIn (2022) 中裁定,在未绕过身份验证限制的情况下,抓取公开页面很可能不违反 CFAA。人们也会问”屏幕抓取合法吗?”,答案相同:像浏览器一样读取公开页面并不是”黑客行为”。

误区 2:”公开数据”意味着可以自由获取

公开并不意味着不受限制。个人数据即使公开可见,仍然受到保护,欧洲监管机构会因抓取公开个人数据而开出罚单。版权仍然保护公开文章和图片。即使无需登录,服务条款也可能对你有约束力。因此,真正的问题,数据抓取是否合法?,很大程度上取决于数据本身到底是什么。

误区 3:违反 ToS 就是犯罪

违反服务条款属于民事问题,而不是刑事问题。违反 ToS 并不自动构成违法,但它可能成为被封锁的理由、民事诉讼的依据,以及法庭上证明恶意的证据。关于网络抓取服务条款的更多内容见下文。


美国:CFAA、hiQ 与合同问题

核心问题,即在美国网站抓取是否合法,取决于抓取公开页面是否构成 Computer Fraud and Abuse Act 下的”未经授权访问”,它是一部反黑客法规。第九巡回法院在 hiQ Labs v. LinkedIn(2022 年,依据最高法院的 Van Buren 逻辑)中给出了答案:不构成。如果一个页面无需凭据即可向任何人开放,就不存在可被突破的授权门槛,因此公开数据抓取不违反 CFAA。

但 hiQ 的完整故事才是更值得注意的部分。在赢得 CFAA 之争后,hiQ 却在案件整体上败诉:2022 年 11 月,法院认定其违反了 LinkedIn 的用户协议(它通过创建账户接受了该协议),案件最终以同意判决结束。CFAA 可避免你因抓取公开页面而被指控黑客行为,但无法免除你已同意的合同约束。

Meta v. Bright Data(2024 年 1 月)进一步明确了界线:法院拒绝认定 Bright Data 因抓取公开、未登录的 Facebook 和 Instagram 页面而违约,因为这些平台的条款约束的是账户持有人,而不是未登录访客。由此可见,未登录的公开抓取更站得住脚;在已接受条款的情况下进行登录抓取则风险更高。较早的侵害动产案件(eBay v. Bidder’s Edge,2000 年)在极端流量下仍然具有约束力,而州级隐私法(加州的 CCPA/CPRA、弗吉尼亚州的 VCDPA)还会叠加个人数据义务。


服务条款:浏览式协议、点击确认式协议,以及规则何时会带来法律风险

服务条款并不是法律,但法院会高度重视它们,而关键问题在于用户是否确实接受了这些条款。

浏览式协议与点击确认式协议:哪种 ToS 真正约束你

浏览式协议只是页面某处的一个链接,无需主动确认;法院很少会对从未点击过的人强制执行它。点击确认式协议要求明确动作,例如勾选复选框或点击”我同意”按钮;法院几乎每次都会执行它。实际界限是:你主动接受的条款(通常是在注册账户时)会约束你;你只是本来可能看到的条款通常不会。

ToS 违规何时成为法律证据

违反网页抓取服务条款并不是刑事犯罪,但它有三个实际后果:平台可以立即封禁你;它可以成为民事违约诉讼的依据(这正是最终让 hiQ 败诉的主张);如果 CFAA 或相关索赔进入法庭,它会被解读为恶意行为。


AI 时代:改变格局的 2025-2026 年诉讼

AI 训练引发了第二波抓取诉讼,其重点不再主要是”访问是否获得授权”,而更多转向合同、许可和版权(这些问题同样影响着用于 AI 训练数据收集的代理):

  • Bartz v. Anthropic(2025 年 6 月,Alsup 法官):使用合法获得的图书训练 LLM 属于”极具转换性”的合理使用,但该裁决明确排除了盗版来源副本。你如何获得数据,与之后如何使用数据同样重要。
  • Kadrey v. Meta(2025 年 6 月,Chhabria 法官):原告基于其提交的案卷败诉,但判决意见警告称,这并不等于对 AI 训练给予广泛许可,这是一次狭义胜诉,而不是一项原则。
  • Reddit v. Anthropic(2025 年 6 月提起):Reddit 基于服务条款和不当得利理论提起诉讼,而非版权。2026 年 3 月下旬,一名联邦法官将该案发回加利福尼亚州法院,认定这些主张不受《版权法》优先适用规则排除,确认了基于合同的抓取主张具有独立生命力。
  • Reddit v. Perplexity, SerpApi, Oxylabs & AWMProxy(2025 年 10 月,S.D.N.Y.):这是首个将抓取基础设施供应商与 AI 公司一并列为共同被告的案件。对代理买家而言,关键启示在于供应链:谁在收集你的数据,以及如何收集,现在都已成为你法律风险的一部分。
  • NYT v. OpenAI(合并审理,S.D.N.Y.):2026 年 1 月,法院命令 OpenAI 在证据开示中提交一份 包含 20 million 段对话的日志样本;该案检验模型”复述”是否会削弱合理使用抗辩。
  • 许可经济是另一面:Reddit 将数据授权给 Google(~$60M/yr)和 OpenAI;Cloudflare 和 Stack Overflow 推出了按抓取量付费的模式。”可免费抓取”和”获许可用于训练”正在走向不同轨道。

Web scraping case law timeline


欧洲:GDPR 与监管最严格的地区

在欧盟(以及英国),问题很少是”访问是否获得授权”,而是 “你是否在没有合法依据的情况下处理了个人数据?” 根据 GDPR,抓取任何能够识别个人身份的数据(姓名、照片、个人资料、联系方式)都属于”处理”,而”它是公开的”本身并不是合法依据。执法记录已经说明问题:

  • 荷兰(AP),欧洲立场最强硬的监管机构之一。其 2024 年 5 月指南称,抓取个人数据”几乎总是违反 GDPR”,并对 Clearview AI €30.5 million 处以罚款,同时警告董事可能承担个人责任。
  • 意大利(Garante),对 Clearview 处以 €20 million 罚款;其明确原则是:”如果它是公开的,我就可以拿来用”是 错误的
  • 法国(CNIL),对联系数据经纪商 KASPR €240,000 处以罚款(2024 年 12 月)。其 2025 年 6 月指南允许基于合法利益抓取公开个人数据,但前提是采取保障措施(排除列表、最小化、透明度)。
  • 英国(ICO),对 Clearview 处以 £7.5 million 罚款;UK GDPR 以及 Data (Use and Access) Act 2025 使该框架与欧盟保持一致。
  • 欧盟层面: Database Directive 还增加了一项单独的 sui generis 权利,用于防止提取受保护数据库的实质性部分,这是一项存在于欧洲但不存在于美国的主张。

关键细微差别在于:上述内容均不针对非个人数据。 价格、产品列表、库存和排名均不属于 GDPR 的适用范围,欧洲的价格情报和 SEO 工作流程每天都在合法运行。下方风险图展示了个人数据抓取风险如何因司法管辖区而异。


Web scraping jurisdiction risk


除欧洲和美国之外,个人数据抓取的情况差异很大:

司法管辖区 框架 抓取立场
澳大利亚 《1988 年隐私法》及 2024 年改革 公开产品数据通常更站得住脚;个人数据则不具备。
日本 APPI 整体趋势较为宽松,2026 年修正案将放宽 AI 对公开数据的使用。
巴西 LGPD (ANPD) 正在积极执法个人数据相关问题,包括 Clearview。
印度 DPDP Act 2023 个人数据规则正在收紧;AI 训练相关案件正在推进。
中国 PIPL + DSL + CSL 对个人数据和跨境传输要求严格;需要进行本地化审查。

如果你需要深入了解某个特定市场,我们的 博客 中的每一篇国家指南,从 Germany日本,都包含经过事实核查的本地法律部分。


版权法:哪些内容可以抓取,哪些不能抓取

版权是抓取中最常见的法律风险来源之一,但只要将事实与创意内容区分开来,大多数商业使用场景都处于相对安全的范围。

哪些受保护,哪些不受保护

事实不受版权保护,价格、评分、可用性和规格都可以自由收集,这也是为什么抓取产品数据属于相对安全的范围。真正保护的是:文章、照片、视频、原创文本,以及数据库中具有创意性的选择或编排。原样大段转载这些内容,才会引发版权侵权主张;美国《数字千年版权法》(DMCA) 则是另一回事,它适用于绕过访问控制或移除版权管理信息的情况,而不是单纯的转载。

合理使用(美国)和 DSM Directive(欧盟):何时允许抓取受版权保护的内容

在美国,合理使用会权衡四个因素:使用目的(是否具有转换性,还是仅仅用于商业用途?)、作品性质、使用量,以及对市场的影响,其中 Authors Guild v. Google(Google Books)是转换性使用的经典判例。在欧盟,DSM Directive 允许在你拥有合法访问权限且权利人未选择退出的情况下进行文本和数据挖掘(通常通过 robots.txt 表示)。两者都为抓取受版权保护内容用于分析留出了空间,但都不授权原样大段转载。


哪些做法更站得住脚,哪些风险更高

不同抓取活动的风险并不相同,这取决于数据类型、你的访问方式,以及你如何使用结果。下面两个列表可帮助你快速判断项目所处的位置。

通常较易站得住脚

  • 公开、只读地收集非个人数据:价格、产品规格、库存、排名、搜索结果、机票价格、房地产列表
  • 仅在未登录状态下访问,不访问任何需要身份验证的内容
  • 以接近人工浏览的速度控制请求频率,不给目标基础设施造成负担
  • 遵守 robots.txt 和已发布的抓取政策
  • 竞争情报、市场研究、SEO 监控、广告验证、基于汇总数据的学术研究

Web scraping defensible vs risky


高风险甚至难以成立的做法

  • 抓取个人数据,姓名、照片、电子邮件、电话号码、个人资料,尤其是大规模抓取,尤其是在欧洲
  • 在登录后抓取,违反你已接受的条款(hiQ 合同教训)
  • 绕过技术屏障:被用作访问控制的 CAPTCHA、专门针对你的 IP 封锁、付费墙
  • 整批重新发布抓取的内容(版权),或提取受保护数据库的实质性部分(欧盟数据库权利)
  • 导致目标网站性能下降的访问量(可能面临动产侵害责任)
  • 使用从盗版或违反条款的来源获取的内容训练 AI(Bartz 的例外 carve-out)

面向抓取团队的合规检查清单

1. 界定数据范围。如果某个字段可以识别个人身份,就应将其视为受监管数据:要么删除该字段,要么依据 GDPR 确立合法基础,并配套记录在案的保障措施(CNIL 的 2025 年合法利益说明表是最佳模板)。

2. 保持未登录状态。仅限公开页面。一旦你进行身份验证,就表示你已接受一份合同,而合同类主张往往最容易胜诉。

3. 尊重网站的信号。robots.txt、速率限制、crawl-delay。它们并不总是具有法律约束力,但通常是法院或监管机构首先会查看的内容。

4. 以克制为原则进行工程设计。采用接近人工节奏的访问频率,通过缓存避免重复抓取,不要高频冲击网站。访问量正是会让抓取纠纷升级为侵害动产的主张的因素。

5. 关注供应链。Reddit v. Perplexity点名的不只是 AI 买方,也包括抓取供应商。你需要了解数据提供商是如何收集数据的。

6. 将收集与使用分开看待。合法收集并不意味着所有用途都被许可:重新发布、数据库提取和 AI 训练都需要分别进行分析。

7. 在规模化前咨询法律顾问。一个在 1,000 次请求/天 时看似没有问题的抓取流程,规模达到 10 million 时可能就需要审查。

8. 选择来源合乎道德的代理基础设施。重要的不是工具本身,而是其来源:代理是合法的,但合乎道德的网页抓取也包括 IP 的获取方式。基于同意、来源合乎道德的住宅代理可以让你的数据采集环节在有人询问供应链时更站得住脚。


常见问题

网页抓取合法吗?

抓取公开可访问的非个人数据,在大多数司法管辖区通常是合法的,第九巡回法院的 hiQ v. LinkedIn (2022) 确认,抓取公开页面并不构成美国 CFAA 下的”未经授权访问”。风险在于细节:个人数据(Clearview 案件中 GDPR 罚款最高达 €30.5M)、在登录后违反已接受条款进行抓取(hiQ 最终败诉的原因)、绕过技术屏障,以及重新发布受版权保护的内容。以负责任方式收集公开的产品、价格和 SERP 数据,是更稳妥的做法。

在美国,网页抓取合法吗?

对于公开数据通常是合法的:hiQ v. LinkedIn 确立了抓取公开页面不违反 CFAA,而 Meta v. Bright Data (2024) 拒绝阻止对公开 Facebook/Instagram 页面进行未登录抓取。但合同索赔仍然成立,hiQ 因违反其已接受的 LinkedIn 条款而败诉,流量过大也可能引发侵害动产索赔。州隐私法(CCPA/CPRA)还会进一步监管个人数据。

在欧洲,网页抓取符合 GDPR 吗?

非个人数据(价格、列表、排名)完全不属于 GDPR 范围。个人数据才是欧洲监管严格的领域:荷兰 AP 称抓取个人数据”几乎总是违规”,并对 Clearview 罚款 €30.5M;意大利 Garante 对其罚款 €20M;法国 CNIL 对 KASPR 罚款 €240K,这些都涉及抓取公开个人数据。CNIL 的 2025 指南允许基于合法利益抓取公开个人数据,但前提是有记录在案的保障措施。

我可以合法抓取 Amazon、Google 或其他大型平台吗?

在未登录状态下、以合理频率收集公开产品和搜索数据,与其他场景一样属于更容易站得住脚的情形,价格情报和 SEO 行业正是这样运作的。风险取决于具体平台:不要登录(条款)、不要获取个人数据(含作者身份信息的评论)、不要让网站接口过载,并了解每个平台的执法态度。我们的分平台指南(Amazon、Google Maps、LinkedIn、Reddit)涵盖具体案例和规则。

为 AI 训练抓取数据合法吗?

尚未定论,并分化为两个问题。收集:适用与所有抓取相同的规则。训练:Bartz v. Anthropic (2025) 认定,使用合法取得的书籍进行训练属于转换性合理使用,但排除了盗版来源;NYT v. OpenAI 正在检验输出”复述”是否会削弱合理使用;Reddit 基于合同对 Anthropic 和 Perplexity(及其抓取供应商)提起的诉讼已通过初步程序审查。授权数据和来源清晰的供应链正在成为安全港。

使用代理合法吗?

合法,代理是标准网络基础设施,基本上在任何地方都是合法的。受到监管的是通过代理进行的活动:合法抓取通过代理仍然合法,非法收集通过代理仍然非法。请选择提供来源合乎道德、基于同意的住宅代理池的提供商;在 Reddit v. Perplexity 将抓取供应商列为被告之后,收集基础设施的来源已成为合规考量的一部分。

违反 robots.txt 会让抓取变成非法吗?

robots.txt 不是法律,忽略它并不会自动构成违法。但法院和监管机构会将其视为善意或恶意的信号,多项判决在权衡侵害动产和合同索赔时都提及了它,CNIL 的保障措施也要求你尊重退出选择。实践上:遵守 robots.txt 成本很低,也能显著提升你立场的合理性。

用一段话说明 hiQ v. LinkedIn 发生了什么?

hiQ 抓取公开的 LinkedIn 个人资料用于 HR 分析;LinkedIn 发出停止抓取通知;hiQ 提起诉讼,并赢得了核心争议,第九巡回法院认定 (2022),抓取公开页面不构成 CFAA 违规。随后 LinkedIn 赢得了最终结果:法院认定 hiQ 违反了其已接受的用户协议,该案以同意判决告终。这带来两点启示是:公开抓取不是黑客行为,但你接受的合同具有可执行性。


摘要

那么,网页抓取合法吗?抓取公开可用的非个人数据在很大程度上是通常合法,也较为稳妥的,三大主要风险是个人数据(GDPR 及其全球同类法规)、违反已接受条款的访问(曾令 hiQ 败诉、如今也推动 AI 时代诉讼的合同主张),以及创意内容上的版权。保持未登录状态,收集非个人数据,遵守 robots.txt,并将收集与使用分开。2026 年之后,供应链也成为合规的一部分:你的数据以及你的代理来自哪里,如今都已成为法律风险格局的一部分。关于基础设施方面,请参阅用于网页抓取的最佳代理。本文仍属于一般信息,并非法律建议,请就你的具体情况寻求法律建议。

最后更新:2026 年 6 月 24 日。



Share article: