automating_linkedIn_scraping_using_proxies
  • Published:
  • Last Updated:
  • Tools
  • 1 min read

LinkedIn 是 HR、销售、营销及其他专业人士获取宝贵数据的重要来源。它能帮助你实时洞察市场趋势,并获取所需的海量联系人信息。然而,信息量庞大,手动处理并不现实。这正是网页抓取的用武之地:它能在获取数据的同时节省时间和资源。本文将介绍 LinkedIn 抓取需要注意的方方面面。

LinkedIn 爬取的挑战 

LinkedIn 致力于为用户打造安全的环境,其策略之一是通过严格界定允许的行为来保护用户数据。因此,LinkedIn 的服务条款明确禁止网页抓取。因此,DataImpulse 不鼓励你尝试抓取 LinkedIn。下文信息仅供学习参考。DataImpulse 不对可能产生的任何后果承担责任。 

回到网页抓取这一话题。LinkedIn 会采取多种措施确认用户是真人而非机器人。因此,抓取该平台会面临一系列挑战,例如:

  • 速率限制 
  • 反机器人机制 
  • CAPTCHAs 
  • 登录限制 
  • 数据结构复杂 
  • IP 和账号封禁 
  • 法律考量 

换句话说,换句话说,如果 LinkedIn 认为同一 IP 或账号发出的请求过多,或活动出现在异常时段,例如圣诞节这类人们通常不会办公的时间,就很可能对你实施临时封禁,让此前的抓取工作付诸东流。此外,LinkedIn 的机制并不公开,而且会定期变化,往往不会提前通知。因此,昨天还有效的方法今天可能就失效了。你必须始终保持警惕,及时调整策略,甚至在摸清新规则、确定新方法之前暂停抓取活动。不过,成功抓取的案例也不少,下面看看哪些做法会有帮助。

实现有效 LinkedIn 爬取的技巧 

以下几条重要原则值得遵守。

  • LinkedIn 网页抓取处于灰色地带,因此定期查看该平台的服务条款非常重要。如有变化,例如新增限制、规定或许可要求,你应相应调整抓取流程。这也有助于避免访问被拒。  
  • 必须遵守 GDPRCCPA 等数据法规。你需要对获取的数据负责,切勿出售数据或将其用于非法活动。
  • 只抓取公开可得的数据,例如公司名称、职位或联系方式,不要试图获取私人信息。 
  • 留意互动指标。指标突然下降,可能表明 LinkedIn 认为你的行为可疑,并限制了你的触达范围。 
  • 如果收到警告或被临时封禁,请停止抓取活动并停用自动化工具。你可以在我们的博客文章中进一步了解此时该如何处理。 
  • 有时你可能听说,最好为不同的抓取目的使用不同账号。然而,拥有多个账号违反 LinkedIn 的 ToS。在考虑这一做法前,可以阅读我们的专题文章,了解更多信息后再做决定。 

最佳 LinkedIn 爬取工具 

LinkedIn 网页抓取最重要的是让整个过程看起来像真人操作,而不是机器人参与。你需要在请求之间设置间隔,与不同类型的内容互动,随机进行较长时间的暂停,并执行多样化操作。关键是避免重复可预测的行为模式,因为这类模式很像机器人,容易立刻暴露。因而,选择一款兼顾上述细节、并针对 LinkedIn 优化的工具至关重要。你可以考虑以下选项。 

这款无代码工具十分适合非技术人员,拖放式界面简单易用。它提供网页抓取任务的预设模板,并采用云端抓取,因此即使电脑关机,抓取流程仍会继续。 

Scrapy 本质上是一个 Python 库,需要较强的编程能力或开发团队。不过,你可以针对自己的具体场景构建工具,并按需深度定制。它完全免费,也能处理大规模项目。 

如果你主要关注联系信息和潜在客户开发,这款工具很值得考虑。它可以提取电子邮件地址和电话号码,并可直接保存到 CRM 中。即使不擅长编程也能使用;它还提供 Chrome 扩展,使用更方便。 

该工具针对 LinkedIn 进行了优化,提供开箱即用的模板,也支持构建自定义脚本。它同样基于云端,可通过 API 与其他工具集成。对于需要良好可扩展性的中大型企业而言,这是不错的选择。 

这款专注于 LinkedIn 的工具不仅适合网页抓取,也能自动化其他流程,例如发送邀请。它同样易于使用,你可以创建自己的使用场景。不过,它是付费工具,没有免费计划,仅提供 14-day 试用期供你测试。 

用于 LinkedIn 爬取的其他工具 

为了让行为更像真人,你还可以使用以下工具。 

  • 反检测浏览器 

这类浏览器会创建具有独特特征的独立配置文件,例如 Cookie、IP 地址和用户代理字符串。这让 LinkedIn 更难追踪全部活动,并将其关联到特定用户或设备。浏览器指纹识别是该平台检测机器人的主要技术之一,因此反检测浏览器会是你的得力助手。你可以在这篇专题文章中了解更多值得考虑的选项。 

  • VPN

如果你需要从多个地点抓取数据,VPN 可以帮助隐藏真实地理位置。它还能提供额外的安全保护,保障你的个人数据。像 ZoogVPN 这样的可靠选择不会花费太多,却能帮你避免封禁并省去不少麻烦。 

  • 无头浏览器 

如果你决定构建自己的爬虫,并使用 Scrapy 或类似工具,无头浏览器是必备工具。它们能节省系统资源,让你快速处理大量数据,同时也有助于加强身份保护。你可以查看这篇文章,从几个不错的选项中选择最适合自己的方案。 

  • 会话管理工具 

一次性抓取大量数据看起来很可疑;能保存和恢复会话的工具有助于让你的行为更像普通用户。当抓取任务呈现为连续的浏览器会话时,就更不容易引人注意。 

  • 代理 

代理是你与目标服务器之间的中介,可同时完成多项任务。它们代你与服务器通信,隐藏真实 IP 和位置,使流量更难被追溯到你,也更难将所有抓取活动关联到你的设备。它们还能加快流程,因为你可以把任务分配到多个连接线程,这对大型项目至关重要。Residential proxies 是不错的选择,因为它们使用真实家庭的 IP,并与真实服务提供商相关联。Mobile proxies 也是一种选择,被检测到的可能性更低,但价格可能稍高。

另一方面,选择代理时需要谨慎。免费代理往往不可靠,因为它们广为人知,平台可能会预先封禁它们。请选择能提供第一方、以合乎道德方式获取的 IP 的供应商。这样既不会白花钱,也能借助真实且独享的代理大幅提高成功抓取 LinkedIn 的机会。例如,DataImpulse 提供来自 195 个地点的 90+ million 个合法获取的 IP,帮助抓取顺利进行。我们不参与非法使用,因此我们的 IP 资源干净,不与非法活动有关。我们还提供地理定位、设置轮换间隔等功能,让流量显得更自然。如有更多问题,请通过 [email protected] 联系支持团队;团队 24/7 在线,并会在几分钟内回复。或者点击 立即试用 按钮,开始使用我们的服务,免去网页抓取的烦恼。 

Share article: