仅在 5 年前,企业获取数据几乎只会想到 API:供应商提供端点,签约、按调用付费,即可获得结构化数据流。这曾被视为解决数据访问问题的一劳永逸之策。
设想这样一种情况:10:20 时,竞争对手将首尔至伦敦航班的价格下调了 12%。你的价格监控系统本应在 10:21 发现这一变化。但一个请求被禁止,IP 被封锁,下一个请求还在等待处理。因此,系统在 11:40 才通知你价格变动。在这 1 小时 20 分钟里,客户已经在竞争对手的网站订了票。而这些收入本可能属于你。
大城市中的 Uber 用户可以看到数十种可用出行选项、更准确的司机到达时间,以及多种定价方案。相比之下,小型社区的用户会有截然不同的体验。同样,Yelp 平台会根据用户所在位置展示不同的餐厅推荐、评分、评价和搜索结果。
获取网络数据有两种方式:购买可直接使用的数据,或从零搭建抓取基础设施并自行选择每一种工具。相应地,有出售数据集的公司,也有提供包括代理在内工具的公司。Zyte 和 DataImpulse 正是体现这两种路径的供应商。两者都能帮助获取公开数据,同时避免遭遇封锁。本文将介绍两家供应商提供的服务及其适用场景。
面向工程师的 PerimeterX 绕过指南:HUMAN 传感器模型如何分类客户端、三阶段传感器模型、我们的路由测试、真正有效的客户端修复措施,以及法律边界所在。
面向工程师的 Imperva 绕过指南:了解 Imperva(原 Incapsula)如何在四个阶段过滤流量、其 700 个维度对爬虫的意义、我们的路由测试,以及何时应停止。
详解网页抓取中的 403 forbidden 错误:该状态实际意味着什么、用于找出真正原因的 5 步排查流程、有效的解决方法,以及何时 403 就是最终答案。
面向工程师的 Kasada 绕过指南:为何客户端执行决定结果、四步证明循环、如何修复自己的客户端,以及边界在哪里。
详解 Shopify 数据抓取:哪些商店数据公开、每家 Shopify 商店公开的 JSON 端点、三层商店数据模型、速率限制、代理选择及法律界限。
详解 Airbnb 抓取:哪些房源数据公开、四阶段房源采集模型、为何价格与货币取决于出口、房东个人数据边界,以及官方途径。
