In this Article
无论是查询天气预报等日常信息,还是查看自己网站在 SERP 中的排名等工作任务,大多数人都会先使用搜索引擎,也就是 Google。不过,若想获得尽可能准确的搜索结果、制定有效的 SEO 策略等,就需要了解它的运作方式。本文将介绍 Google 的工作原理,并探讨 Google API Content Warehouse 泄露事件带来的启示。
为什么是 Google
Google 是一项帮助人们在万维网上查找信息的服务。但我们为什么需要它,Google 又为何如此受欢迎?
简单来说,互联网是由计算机、服务器等设备构成的庞大网络。每一份文本文件、视频、图片等都存储在这些设备上。没有搜索引擎,你必须知道每个网页的准确 URL 才能访问它,这几乎不可能做到。搜索引擎会为网上的内容建立索引,并根据你的查询提供所需页面。借助这类工具,你无需记住网页 URL,只需几分之一秒便能找到信息。
随着数据量快速增长,搜索引擎必须跟上用户不断变化的需求。Google 持续改进算法以提供更相关的搜索结果、推出新功能,并建立有效的商业模式,从而在搜索领域保持领先。它也因此成为全球使用最广泛的搜索引擎,截至 2024 年 6 月,市场份额为 91.05%。
除 Google 外,还有 Yahoo 和 Bing 等知名搜索引擎,也有 Baidu 这类更”本地化”的搜索引擎。这些引擎通常针对特定市场量身定制,适配本地语言、平台和在线服务,因此更便于使用。不过,这类引擎的一个重要局限是,它们受政府法规和所在国家审查制度的约束。这可能会严重限制用户在线查找某些信息。
本文主要关注 Google,不过,其他搜索引擎通常也遵循类似的运作逻辑。
那么,Google 是如何工作的?
首先,需要记住,万维网搜索并不是实时进行的。换句话说,当你在搜索栏中输入查询时,Google 不会立刻在整个互联网上搜索信息,而是向你展示已收录在数据库中的页面。
与此同时,Google 每时每刻都在扩充和更新自己的数据库。
一切都始于所谓的种子 URL。它们是一组可信、相关且权威的来源。由于它们是 Google 爬虫的起点,有时会经过人工收集和整理,以确保其可靠性。Google 爬虫会访问这些 URL,并下载页面的完整 HTML 代码。这些代码提供了页面内容、链接和元数据等重要信息。
随后,Google 利用从 HTML 代码中提取的数据识别关键词。标题标签和元关键词中的词语和短语能反映页面主题。借助自然语言处理 (NLP) 技术,Google 会分析网页文本,识别单个词语、短语及其相互关系,并理解其语义。接着,搜索引擎会分析锚文本(即超链接文字)以及词语和短语的使用频率。这些信息共同帮助判断哪些词属于关键词。Google 还会进一步评估它们的位置、上下文和与主题的相关性。出现在标题中或与其他关键词共同使用的关键词会被视为更相关,因此 Google 会赋予其更高权重。
最后,Google 会将从 HTML 代码中获取的关键词和其他数据存入名为 Google Index 的庞大数据库。
除关键词外,Google 爬虫还会关注抓取种子 URL 时发现的链接。
当爬虫发现指向尚未编入索引页面的链接时,会将该页面加入队列,以便抓取并编入索引。
Google 爬虫还会定期重新访问此前已编入索引的页面,以更新数据。如果 Google 认为某个页面很重要,就会更频繁地重新访问它。影响页面重要性的主要因素包括页面权威性、内容新鲜度和用户参与度等。
那些尚未在任何地方被提到的新页面会怎样?
Google 可以通过多种方式发现它们:
– 定向抓取
Google 爬虫会持续探索互联网,寻找新的 URL 模式、IP 地址和域名注册信息。这些线索可能表明有新网页存在。
– 社交媒体和论坛
在线社区成员经常提及、讨论和分享网站,这有助于发现尚未编入索引的新来源。
– 分析数据
失效链接报告、新内容建议、用户参与度指标和数据模式,都可能有助于识别仍在发展、尚未建立稳固反向链接体系的网站。机器学习和 AI 驱动的技术经常用于分析如此庞大的数据量。
– 特殊工具
网站管理员也可以主动向搜索引擎提交新网页。爬虫会将这些网页加入队列,随后为其建立索引。
然而,拥有庞大的数据库还不足以满足用户需求。Google 必须理解用户的意图,才能提供相关的搜索结果。首先,同一个词可能有几十种含义。其次,我们会使用行话和不同方言,输入时也可能出错,这让判断需求更加困难。最后,人们经常搜索自己并不熟悉的主题,因此未必清楚自己究竟在找什么。因此,Google 会不断学习和分析查询,以更好地理解我们的搜索意图。
此外,Google 还会参考位置、搜索历史、设备指纹和偏好等不同信号,提供个性化而非笼统的搜索结果。例如,如果你是 Linking Park 的粉丝且经常听他们的音乐,Google 会知道这一点。因此,当你在搜索栏中输入 “crawling” 时,搜索引擎可能提供包含歌词的网页、YouTube 上的翻唱视频等链接,而不是解释它在技术语境中表示网页抓取的含义。
至于你在搜索引擎结果页 (SERP) 上看到的内容,Google 如何决定哪些链接优先显示,哪些排在页面末尾?直到 2024 年 3 月,Google 的排名算法都受到严格保护,我们只能猜测它在排序时考虑了哪些因素。然而,在 2024 年 3 月至 5 月期间,一份 Google 内部文档 Google API Content Warehouse 泄露并在 GitHub 上公开。这 2569 页文档提供了大量有价值的洞见,揭示 Google 如何对页面进行排名,以及哪些 SEO 技术有效、哪些无效。例如,曾经流行的 Link Juice 和 PageRank sculpting 技术已不再使用。同时,Google SEO 人员的一些公开说法与文档内容并不一致。例如,Gary Ilyes 曾表示 Google 在页面排名时不考虑点击,但文档显示事实并非如此。”hostAge” 属性表明 Google 会对新网站实施沙盒处理,而 Google 此前曾否认这一点。文档还表明,页面排名时会广泛使用 Chrome 数据,这同样与 Google 过去的否认相矛盾。
还有一些更关键的细节。例如,网站是否同时提供桌面版和移动版、是否提供本地化版本,以及是否是拥有强大社交媒体影响力的成熟品牌,这些因素都会影响排名。视觉内容也愈发重要,应当质量上乘,并突出页面的核心主题和要点,尤其是在分步指南等垂直领域。
该文档还确认,Google 使用机器学习技术,并致力于改进处理社交媒体帖子等非结构化内容的方式。非结构化内容的占比持续增长,但上文所述的传统关键词搜索在这类内容上并不十分有效。另一种搜索方法是全文搜索。全文搜索不仅为关键词和元数据建立索引,也为全文建立索引。它使检索大型文档等非结构化内容成为可能,即使关键词不完全匹配,也能找到相关结果。目前,你可以在 Google 中一定程度上使用全文搜索,例如用引号进行短语搜索、用 “site:” 运算符在特定域名内搜索,以及使用 “or” 和 “and.” 等布尔运算符。不过,如果这还不够,也可以考虑 Algolia 或 Elasticsearch 等专用全文搜索引擎。
结论
了解 Google 的工作方式,能帮助你更快找到所需内容,并让你的网站在 SERP 中获得更高排名。此外,还有许多合规工具可帮助你更有效地使用搜索引擎。代理服务器在需要避开个性化结果影响、查看其他地区 SERP 等场景中非常有用。DataImpulse 以合理价格提供合规获取且已获授权的代理服务器。点击屏幕右上角的”立即试用“按钮即可开始使用;如需客服团队协助,也可使用屏幕右下角的小组件。
