跳至正文
中

Google Caffeine:让搜索更新鲜的索引系统

Jack Lee

作者 Jack Lee

整理成可搜索索引的文档卡

谷歌于 2010 年 6 月宣布完成 Caffeine。它用一个可以分析网络较小部分并不断更新搜索索引的系统取代了分层索引过程。谷歌表示,这产生的结果比之前的索引更新了 50%。这一历史性的说法描述了相关网络内容的可用速度有多快——这不是 50% 的排名提升,也不是每天发布的奖励。

五个已验证点的咖啡因含量

Caffeine 是一种新的网络索引系统。 谷歌于2010年6月9日宣布完成;这是基础设施,而不是所谓的质量惩罚。

旧索引被分层刷新。 谷歌表示,主层可能需要几周时间才能刷新,从而在查找页面和使其可搜索之间产生延迟。

咖啡因连续处理较小的部分。 新页面和现有页面上的新信息可以更快地在全球范围内添加到索引中。

“新鲜度 50%”是新鲜度指数的说法。 这并不意味着每个页面的抓取速度提高了 50%、排名提高了 50% 或获得了新鲜度奖励。

现代搜索仍然将爬行、索引和服务分开。 Google 不保证合规页面会被抓取、编入索引或显示,并且被编入索引并不能保证排名。

历史状态:谷歌确认

2010年6月

Google 在 2010 年记录的内容以及仍然正确的内容

时期记录变更负责任的解释
在咖啡因之前谷歌描述了一种由以不同速率刷新的层组成的索引。刷新层需要分析网络,而主层只能每几周更新一次。发现和搜索可用性可能会因严重的处理延迟而分开。
2009年8月谷歌开放了下一代基础设施(通常称为咖啡因沙箱)的开发者预览版,并邀请就结果差异提供反馈。预览观察结果是有用的测试信号,而不是公开的排名因素规范。
2010 年 6 月 9 日谷歌宣布 Caffeine 已经完成。它对网络进行小部分分析,并在全球范围内持续更新索引。主要变化是处理架构以及合格信息进入索引的速度。
Google 2010 年规模数据谷歌表示,Caffeine 每秒并行处理数十万个页面,并在一个数据库中存储近 1 亿 GB 的数据。这些是历史工程数据,而不是当前的容量声明或网站可以优化的目标。
今天搜索谷歌记录了三个主要阶段——抓取、索引和服务。 JavaScript 页面在渲染的 HTML 被索引之前也会经过渲染。使用当前搜索文档来诊断当前站点;使用咖啡因来理解历史转变。

索引基础设施不是排名更新

搜索引擎不会在用户每次键入查询时搜索实时网络。它搜索根据其系统发现、获取、在必要时呈现、分析和选择存储的页面构建的索引。 Caffeine 重新设计了该索引背后的机制,因此可以增量地合并新信息,而不是等待大的层刷新。

这种区别很重要,因为索引改进可以改变文档可用于排名的时间,而无需决定该文档应排名的位置。排名系统仍然在查询时评估相关性、有用性和许多其他信号。

咖啡因也不应该与谷歌的新鲜度排名系统混淆。这些系统尝试识别用户期望最新信息的查询。咖啡因可以更快地提供更新的文档;新鲜度系统决定新近度何时对特定查询有用。

实际教训不是“发表更多内容”。它是“使有用页面的正确版本易于发现、获取、呈现和理解”。快速索引无法挽救被阻止的 URL、损坏的服务器响应、空的应用程序 shell、冲突的规范或没有有用理由建立索引的页面。

从发现到排名的流程

将索引视为管道。一个阶段的失败可能看起来像是另一个阶段的问题,因此请在更改内容或请求另一次爬网之前验证最早损坏的阶段。

舞台会发生什么要验证什么
1. 发现Google 通过链接、之前的抓取、站点地图或其他支持的发现路径了解 URL 的存在。可抓取的 HTML 链接、正确的绝对 URL、有用的站点地图包含。
2. 爬行Googlebot 根据机器人规则、抓取需求、主机容量和可用性请求 URL。Robots.txt、DNS、TLS、状态代码、响应时间、日志和爬网统计信息。
3. 渲染Google 可以通过其 Web 渲染服务运行 JavaScript,并使用渲染的 HTML 进行索引。渲染的 DOM、阻止的资源、控制台错误、应用程序 shell 内容和链接。
4. 索引和规范化Google 分析内容和元数据,对相似的页面进行分组,并可能选择具有代表性的规范 URL。可索引性、内容价值、重复簇、声明和选择的规范。
5.发球和排名排名系统检索符合条件的索引文档并对特定查询和上下文的结果进行排序。查询相关性、页面质量、语言、位置、设备、SERP 功能和需求。
6. 重新处理谷歌根据需求和容量重新访问页面,然后可以更新其存储的理解和规范集群。有意义的更改、准确的 Lastmod、内部链接、服务器稳定性和重新抓取证据。

Caffeine 为技术 SEO 带来了什么改变

咖啡因减少了发现信息和在索引中提供信息之间的结构延迟。对于发布商来说,这使得可靠的发现和干净的更新信号更有价值,因为谷歌可以处理更改而无需等待大型索引刷新。

它还暴露了一个常见的诊断错误:团队经常将每个可见性问题称为“索引问题”。 URL 可能未被发现、未被爬网、被阻止渲染、被排除为重复项、已编入索引但不相关,或者排名超出了正在检查的位置。这些是不同的问题,需要不同的修复。

对于 JavaScript 网站,初始 HTML 和呈现的 HTML 都很重要。谷歌记录了渲染队列,这意味着客户端渲染的内容可以引入另一个处理步骤。服务器端渲染或预渲染在提高用户和爬虫的速度、弹性和访问权限时仍然有用。

对于大型或快速变化的网站,URL 库存和服务器运行状况会影响爬网效率。 Google 当前的抓取预算指南主要针对具有大约 100 万个更改页面的网站、每天更改 10,000 个或更多页面的网站或许多“已发现 - 目前未编入索引”的 URL。大多数小型网站不需要复杂的抓取预算项目。

用持久的实践取代索引快捷方式

先前的假设持久的教训
咖啡因是一种排名惩罚。这是网络索引基础设施的变化;排名系统在符合条件的文档可用后决定排序。
每天发布让 Google 每天抓取。抓取频率遵循需求、已知的更改模式、站点价值和服务器容量,而不是发布承诺。
站点地图迫使 Google 为每个列出的 URL 建立索引。站点地图是一种发现和规范提示; Google 不保证抓取或索引。
重复的 URL 检查请求可加快爬行速度。谷歌表示,对同一网址的重复请求并不会使其抓取速度更快。
更改日期证明该页面是新鲜的。仅在发生重大更改后才使用lastmod和dateModified;表面上的日期更新并不是有意义的证据。
如果 URL 被索引,技术 SEO 就完成了。验证 Google 选择的规范、呈现的内容、查询相关性、片段、内部信号和结果。
Indexing API 适用于普通博客文章。Google 将其限制为嵌入 VideoObject 中的合格 JobPosting 页面和 BroadcastEvent 页面。
每个小型网站都需要优化抓取预算。大多数小型网站需要准确的站点地图、干净的索引和可靠的服务器,而不是抓取预算的活动。

管道在常见情况下的行为方式

新闻或现场活动

由于来源经常变化并且查询需要最新信息,因此可以快速发现新文章并为其建立索引。排名仍然取决于相关性、来源质量和用户背景。

常青指南刷新

当任务不变时保持稳定的 URL,修改不准确的部分和来源,仅在重大修改时更新 Lastmod,并在有用时请求重新抓取一次。

新电商产品

从可抓取类别链接产品,在站点地图中包含其规范 URL,返回真正的 200 响应并避免近乎空的制造商副本。仅库存状态并不会产生搜索需求。

JavaScript应用程序

如果有意义的内容仅在 API 调用后出现,请检查呈现的 HTML 和控制台输出。使导航链接成为真正的锚点,并避免仅在单击或滚动后才加载重要内容。

多面目录

数千个过滤器组合可能会创建重复或低价值的 URL 空间。确定哪些组合值得可索引页面,并保持规范、链接、站点地图和控件一致。

站点迁移

咖啡因并不能消除迁移风险。尽可能保留有用的 URL;否则将每个旧 URL 映射到其最接近的替换、更新内部信号并监视新旧属性。

实用的索引诊断工作流程

  1. 准确定义症状。 记录确切的 URL、预期规范、查询、区域设置、设备以及问题开始的时间。
  2. 确认发现。 确保该页面至少有一个可爬行的内部 HTML 链接,并且不会孤立在搜索、表单或 JavaScript 事件后面。
  3. 测试实时响应。 检查 DNS、TLS、重定向链、最终状态代码、响应正文和移动可用性。
  4. 检查爬网控制。 将 robots.txt、robots 元和 X-Robots-Tag 与页面的预期索引状态进行比较。
  5. 检查渲染。 使用 URL 检查或合适的渲染测试来比较原始 HTML、渲染的 HTML、加载的资源和控制台错误。
  6. 检查规范化。 将重定向、自我规范、内部链接、hreflang 和站点地图与一个首选的可索引 URL 对齐。
  7. 评估指标值。 询问该页面是否提供了独特、完整的答案,还是仅仅复制了另一个 URL、过滤器状态或精简模板。
  8. 维护准确的站点地图。 包括首选规范页面,删除已停用或被阻止的 URL,并仅在重大更改时使用 lastmod。
  9. 有选择地请求索引。 对一些重要的已更改 URL 使用 URL 检查;重复请求不会加速爬行。
  10. 将索引与排名分开。 建立索引后,评估查询意图、内容有用性、竞争、内部链接和搜索需求。
  11. 按 URL 类别进行监控。 对文章、产品、类别、过滤器和语言版本进行细分,而不是阅读整个站点的百分比。
  12. 记录结果。 记下修复、部署时间、重新抓取证据、选定的规范、印象和转换,以便可以重复诊断。

用正确的证据衡量每个阶段

不要使用一个“索引/未索引”数字作为整个诊断。将每个问题与 Search Console、服务器日志、实时响应和业务分析中的证据进行匹配。

问题有用的证据避免下结论
URL被发现了吗?URL 检查发现详细信息、内部链接抓取、站点地图状态。“它在站点地图中,所以谷歌知道它。”
是取来的吗?服务器访问日志、爬网统计、上次爬网、响应测试。“没有结果意味着谷歌从未访问过。”
谷歌可以渲染它吗?Rendered HTML, screenshot, resource failures and console output.“它在我的浏览器中运行,所以渲染效果很好。”
哪个 URL 被编入索引?声明规范、Google 选择规范、重复原因和实时可索引性。“规范标签迫使谷歌做出选择。”
该页面是否符合条件但未排名?Search Console 页面查询对、展示次数、平均排名和目标市场 SERP。“索引意味着它应该为我的关键字排名。”
是否已处理刷新?有意义的页面差异、准确的最后修改、最后抓取、呈现的内容和相关的更改片段。“可见日期发生了变化,因此索引是新鲜的。”
工作对生意有帮助吗?合格的点击、潜在客户、销售、辅助转化和支持减少。“仅进行更多的爬行就是一个成功的结果。”

十大咖啡因和退休索引神话

  • 咖啡因并不是现场惩罚。 不要将流量损失诊断为“咖啡因惩罚”。
  • 更快的索引并不意味着有保证的索引。 Google 仍然选择将哪些发现和处理的页面输入索引。
  • 索引不是排名。 索引页面可能没有展示次数,因为它与搜索查询不具有竞争力或不相关。
  • 新鲜供应并不能普遍提高新鲜度。 Recency matters only where the query and facts require it.
  • 站点地图是提示。 它们支持发现和规范偏好,但不强制爬行、索引或排名。
  • Lastmod 必须值得信赖。 版权年份或外观模板更改并不是有意义的页面更新。
  • Robots.txt 不是索引删除工具。 有时,被阻止的 URL 可能仍然为人所知,而 Google 无法读取其内容。
  • 规范是一个信号,而不是命令。 冲突的重定向、链接、站点地图和页面相似性可能会导致 Google 选择另一个 URL。
  • Indexing API 不是一般的提交快捷方式。 Google 将其支持的用途限制为特定的工作和直播页面。
  • 对于大多数网站来说,抓取预算并不是第一个问题。 在出现容量问题之前解决访问、重复、内容价值和服务器可靠性问题。

咖啡因和索引问题已解答

Google Caffeine 是算法更新吗?

这是一个经过谷歌确认的网络索引系统。从广泛的历史时间线来看,将其称为“算法更新”是可以理解的,但这并不是一种记录在案的质量惩罚或排名因素。

咖啡因改变了排名吗?

它改变了排名系统获取合格信息的速度。这可能会改变所考虑的文件集,但不会披露或取代排序结果的系统。

“结果更新 50%”是什么意思?

这是谷歌 2010 年与其之前指数的比较。它描述了更新鲜的搜索可用性——并不是对每个 URL、查询或发布者的承诺。

Google 需要多长时间来索引一个页面?

没有保证的时间表。谷歌表示,在收到请求后,抓取可能需要几天到几周的时间,即使这样也不能保证被收录。

提交站点地图是否能保证索引?

不。Google 将站点地图提交称为提示。保持准确,因为它支持发现、监控和规范偏好。

我应该多次请求索引吗?

不是为了速度。谷歌表示,重复请求同一网址并不会提高抓取速度。重新检查管道并等待有意义的更改。

我可以对博客文章使用 Indexing API 吗?

不属于 Google 记录的支持使用范围。该 API 仅限于在 VideoObject 中嵌入 JobPosting 或 BroadcastEvent 的页面。

为什么某个页面已被索引但对于我的关键字不可见?

索引只会使页面符合条件。该页面可能与意图不符,可能不如竞争结果有用,可能排名低于您检查的水平,或者查询可能没有什么需求。

每次更新都应该更改lastmod 和dateModified 吗?

不需要。使用它们对主要内容、结构化数据或重要链接进行重大更改。不要因为版权年份或琐碎的样式更改而更新它们。

咖啡因和新鲜度更新有何不同?

咖啡因改善了索引基础。谷歌的新鲜度系统会尝试在查询值得时显示较新的内容。可用性和排名需求是相关但不同的决定。

主要和官方参考资料

继续实用的技术 SEO

抓取和索引指南SEOWithJackXML 站点地图和 robots.txtSEOWithJackJavaScript SEO 指南SEOWithJack规范 URL 和重定向SEOWithJack内容刷新工作流程SEOWithJack谷歌新鲜度更新SEOWithJackSEO审核工作流程SEOWithJack谷歌算法历史SEOWithJack

继续 Google 算法历史系列

打开完整的算法时间线1998–2026PageRank 到现代搜索1998 年至今佛罗里达更新2003熊猫和内容质量2011企鹅和垃圾链接2012蜂鸟及其意义2013鸽子和本地搜索2014适合移动设备的更新2015RankBrain 和机器学习2015谷歌文斯更新:品牌、信任和权威的真正含义是什么2009年2月谷歌新鲜度更新:当更新的内容真正重要时2011年11月谷歌精确匹配域名更新:关键词不是排名捷径2012年9月Google 发薪日贷款更新:垃圾邮件查询、安全和信任2013年6月Google HTTPS 排名信号:安全性和安全迁移2014年8月Google Possum 更新:本地过滤、邻近度和证据2016年9月Google Fred 更新:内容价值、广告和货币化证据2017年3月医疗广泛核心更新2018神经匹配2018站点分集系统2019BERT 和自然语言2019通行排名2020–2021评论系统2021有用的内容系统2022–2024垃圾邮件大脑2018年–今天AI生成的内容指导2023 年–今天2023 年 10 月垃圾邮件更新20232024 年 3 月核心更新2024有用的内容集成2024大规模内容滥用2024 年–今天过期域名滥用2024 年–今天网站声誉滥用2024 年–今天AI概述和AI模式2024 年–今天
SEOWithJack需要帮助区分更新和网站问题吗?

在选择修复之前,请检查受影响的页面、查询、日期、发布、抓取、需求和转化。

在 WhatsApp 上讨论更改

本地设计预览

此表单仅用于设计预览,尚未连接订阅服务或外部工具。

浏览文章库