跳至正文
中

搜索引擎如何运作?抓取、索引与排名

Jack Lee

作者 Jack Lee

两个人比较图表与搜索受众资料

网页已经发布,为什么在 Google 找不到?有时页面明明被收录了,却仍然没有搜索流量。要找到原因,先要分清搜索引擎的三项工作:发现并抓取网页、建立索引,以及在有人搜索时选择结果。

下面以 Google 为例,最后用 Search Console 检查自己的页面。

搜索引擎工作的三个阶段

搜索引擎不会等到你输入问题,才临时浏览整个互联网。它会事先收集网页信息;有人搜索时,再从索引中寻找合适的结果。

阶段发生什么你需要问什么
抓取(Crawling)发现网址并尝试取得页面内容。Google 知道这个网址,而且能访问它吗?
索引(Indexing)分析页面,决定是否将信息存入搜索索引。Google 理解并收录了这个页面吗?
提供结果(Serving)针对一次搜索选择、排列并展示结果。这个页面符合搜索者当下的需求吗?

被发现不等于被收录;被收录也不等于每次搜索都会排在前面。这三个阶段要分开检查。

抓取:Google 怎样发现网页?

Googlebot 是 Google 用来访问网页的爬虫。它可以沿着已知页面上的链接发现新网址。比如汽车零件商新增刹车片产品页,并从分类页链接过去,爬虫访问分类页时就有机会找到它。这也是SEO需要关注页面可访问性的原因。

网站地图(Sitemap)也能列出重要网址,帮助 Google 发现页面。但把网址放进地图,不代表它一定会被抓取或收录。重要页面仍应有清楚的站内链接,让人和爬虫都找得到。

发现网址之后,Google 还得成功取得内容。登录限制、服务器错误或禁止抓取的设置,都可能让它无法访问。若重要内容由 JavaScript 加载,Google 还可能需要渲染页面。因此,网页在你的浏览器里能打开,不足以证明爬虫看到了相同内容。

抓取预算是什么?

抓取预算(Crawl Budget)指 Google 在一定时间内能够并且愿意抓取的网站网址。它受服务器承受能力和 Google 对这些页面的抓取需求影响。

大型网站若产生大量重复或无用网址,爬虫可能花时间访问它们,延后发现重要页面。对于页面不多、更新正常的网站,通常不必专门“优化抓取预算”;先确保重要页面有链接、网站地图正确、服务器稳定即可。

索引:抓取之后一定会收录吗?

不一定。Google 会分析页面的文字、标题、图片等资料,判断它讲什么、是否适合存入索引。页面被抓取,不代表 Google 一定会收录它。

前面的刹车片产品页即使成功抓取,Google 仍要判断是否收录。若车辆筛选让同一产品出现多个几乎相同的网址,Google 可能选择其中一个作为主要版本,也就是规范网址(Canonical URL)。其余版本没有分别出现在索引中,不一定代表网站出错。

网站也可能主动阻止收录。例如,noindex 指示 Google 不要把页面加入索引;robots.txt 主要控制爬虫能否访问网址。两者作用不同:如果你用 robots.txt 挡住页面,Google 可能连页面里的 noindex 指令都读不到。

所以遇到“未收录”,不要立刻重复提交网址。先查明是无法访问、重复页面、主动排除,还是 Google 处理后未选择收录,再决定下一步。

排名:为什么同一网页在不同搜索中表现不同?

有人搜索时,Google 从索引中寻找与问题相关、可能有帮助的结果,并按这次搜索排列。它会考虑页面内容,也会考虑搜索词、位置、语言和设备等背景。搜索系统的完整计算方法并不公开。

前面的刹车片产品页可能适合“某车型刹车片价格”这类搜索;“刹车片异响原因”更需要解释原因和排查方法的文章。两种搜索都提到刹车片,合适的结果却不是同一类页面。这是搜索意图的差别。

这也是为什么网页没有一个永远固定的排名。对于价格或新闻等需要最新资料的搜索,时间因素可能更重要;位置、竞争页面和搜索系统变化,也会改变结果。提高某页的可见度,应先确认它确实回答目标搜索,而不是把关键词重复更多次。

为什么搜索结果不只是网页链接?

Google 展示结果的方式也取决于问题。搜索产品可能出现商品信息;寻找附近的汽车维修店,可能出现地图和本地商家;问一个概念,可能看到摘要、图片或 AI 生成的回答。广告也可能出现,但广告位置不等于自然排名。

因此,判断页面表现时,先实际看看目标搜索的结果页。如果结果主要是本地商家,单靠一篇泛泛的博客文章,未必能满足想马上预约维修的人。这不是给文章加几个关键词就能解决的页面类型问题。

怎样检查自己的页面卡在哪一步?

选一个希望用户能找到的重要页面,在 Google Search Console 的网址检查工具输入完整网址,再按顺序检查:

  1. 发现:Google 是否知道这个网址?若尚未发现,检查相关分类页或文章有没有链接到它,网站地图是否列出正确网址。
  2. 抓取:Google 能否访问页面?查看抓取权限、页面获取状态,以及重要内容是否能被读取。
  3. 索引:页面是否被收录?若没有,查看具体原因和 Google 选择的规范网址,不要把所有“未收录”都当成同一种故障。
  4. 搜索表现:已收录后,到搜索效果报告查看它获得哪些搜索词的展示与点击。没有流量时,再对照实际结果页,检查内容是否匹配搜索需求。

网址检查最初显示的是 Google 已掌握的索引资料;修改页面后,可以用“测试实际网址”检查当前版本。测试通过只表示工具可以访问它,不保证收录或排名。修复问题后可以请求编入索引,但重复提交同一网址不会让它更快被抓取。

常见问题

搜索引擎是按什么步骤工作的?

先发现并抓取网页,再分析内容、决定是否建立索引。有人搜索时,搜索系统从索引中选择并展示相关结果;页面进入前一个阶段,不保证能进入下一个阶段。

搜索引擎会使用 AI 吗?

会。Google 的一些系统用 AI 帮助理解搜索词和网页内容。AI 生成的摘要只是搜索结果中看得见的一种应用,不能把所有搜索排名都理解成由一个 AI 模型单独决定。

为什么 Google 抓取了页面却仍未收录?

抓取只表示 Google 访问了网页,不保证收录。如果 Search Console 显示“已抓取,目前尚未编入索引”,表示 Google 暂时未将它加入索引,将来仍可能收录。用网址检查工具核对具体状态和可能的重复版本,再决定是否需要修改页面。

本地设计预览

此表单仅用于设计预览,尚未连接订阅服务或外部工具。

浏览文章库