跳至正文
中

抓取和索引:实用的 Google 搜索指南

Jack Lee

作者 Jack Lee

整理成可搜索索引的文档卡

有机可见性取决于几个独立的系统。 Google 必须发现一个 URL,选择抓取它,接收可用的响应,呈现任何所需的 JavaScript,处理页面,选择规范,最后考虑该页面足够相关以服务于查询。通过一个阶段并不能保证进入下一阶段。

诊断第一个失败阶段

不要以“请求索引”开头。首先确定问题是发现、爬虫访问、服务器响应、渲染、可索引性、重复、规范选择、内容价值还是查询相关性。每个阶段都有不同的证据和不同的解决方案。

从 URL 到结果的搜索管道

谷歌将搜索描述为三个主要阶段——抓取、索引和服务——但技术诊断可以通过分离它们内部的转换而受益。 URL 可以在未获取的情况下已知、在未成功呈现的情况下获取、在未选择为规范的情况下进行处理、或者在未出现在您正在检查的查询中的情况下进行索引。

舞台决定或活动最好的证据常见的错误结论
发现Google 得知某个 URL 存在内部链接、站点地图、重定向、外部链接“它在站点地图中,所以它被抓取了”
抓取调度Google 决定是否以及何时提出请求日志、爬网统计、上次爬网“已知意味着立即排队”
抓取爬虫请求URL和资源HTTP 响应、标头、计时“浏览器可以工作,所以 Googlebot 也可以工作”
渲染HTML 和 JavaScript 生成渲染文档源 HTML、渲染 HTML、屏幕截图“Google 总是能看到每个客户端状态”
索引处理分析内容、元数据、指令和重复项页面索引和 URL 检查“HTTP 200 保证索引”
规范选择从相似的 URL 中选出一名代表宣布并被 Google 选择为 Canonical“规范是一个命令”
服务可以选择索引页面进行查询按页面/查询列出的性能数据“索引意味着我的关键字排名”

从技术资格开始

Google 列出了一小部分技术要求:Googlebot 不得被阻止,页面必须以 HTTP 成功状态运行,并且必须包含可索引的内容。满足这些要求才使得索引成为可能;它不保证抓取、索引或排名。

最低资格门槛
  • 确切的首选 URL 是公开且可解析的。
  • 该主机的 robots.txt 文件允许使用 Googlebot。
  • 最终页面返回稳定的 HTTP 200 响应。
  • 主要内容在移动设备上呈现并可用。
  • 没有机器人元标记或 X-Robots-Tag 会无意中阻止索引。
  • 该页面不依赖于登录、同意或交互来获取基本内容。
  • 声明的 Canonical 有效且与页面一致。
  • 该内容不违反垃圾邮件或法律政策。

发现需要持久的可爬行路径

Google 通过先前已知的页面、标准链接、重定向、站点地图和来自其他网站的链接查找 URL。站点地图是有用的库存,而不是导航的替代品。重要页面应该具有来自相关中心的正常 HTML 锚链接,以便用户和爬虫可以访问它们,而无需提交表单或触发脚本事件。

使用 网站架构指南 和 内部链接指南 连接服务、主题中心和支持文章。

发现源实力审核问题
正常 <一> 有有效目的地主要可重复路径用户可以从可转位集线器访问它吗?
XML站点地图首选 URL 库存提示URL 是最终 URL、Canonical 和 200 吗?
重定向旧路径或备用路径指向它目的地是否相关且直接?
外部链接自主发现和参考它是否可以解决而没有访问或路由错误?
JavaScript 插入锚点渲染后即可工作渲染的 HTML 中是否存在真正的 href?
Button、onclick 或仅限片段的路由与 URL 发现一样不可靠能否成为标准航线和锚点?

发现并不意味着立即抓取

发现后,Google 通过算法决定抓取什么、抓取的频率以及主机可以处理的 URL 数量。调度反映了抓取需求、主机容量、已知更改、重要性、重复和更广泛的 URL 库存。每个页面没有固定的抓取频率。

当 Google 知道但尚未获取新 URL 时,新 URL 可以保持“已发现 - 当前未编入索引”。在假设解决方案是重复手动提交之前,提高有意义的内部重要性、服务器可靠性和库存质量。

信号或条件可能的效果负责任的回应
相关内部链接更清晰的重要性和发现来自适当中心的链接,而不是每个页面
准确的站点地图和lastmod更清晰的调度提示仅在实质性更改后更新
快速稳定的服务器更高的安全爬行能力通过模板监控延迟和 5xx
许多重复/过滤 URL抓取活动遍布低价值库存控制 URL 生成和规范
需求低或内容不变重新爬行频率降低不要制造无意义的更新
站点迁移或重大发布抓取需求临时变化提供直接重定向和新的站点地图

robots.txt 控制请求,而不是索引

robots.txt 规则告诉合规爬虫它们可以在确切的协议、主机和端口上请求哪些 URL。它不是索引删除或安全工具。当其他页面链接到被阻止的 URL 时,它可能仍然是已知的,并且显示的信息有限,因为 Google 无法抓取该页面以读取其内容或 noindex 规则。

如果必须从搜索中删除公共页面,请允许爬网并使用 noindex,使用正确的 4xx 响应将其删除,或通过身份验证保护私有内容。请参阅 站点地图和 robots.txt 指南.

目标正确控制为什么
减少对不重要URL空间的抓取robots.txt 以及 URL 生成控件阻止允许的爬网程序请求路径
从搜索中排除可访问的 HTML 页面机器人元索引爬虫可以抓取并读取规则
排除 PDF 或非 HTML 内容X-Robots-标签 noindex通过响应头应用
删除已删除的公共 URL404或410表示内容不再存在的信号
保护机密内容认证/授权防止未经授权的检索

HTTP 响应定义了进入处理的内容

回应爬虫/索引含义审计行动
200 好内容可以进入处理;不保证索引确认有用的内容和指令
301/308永久移动信号关注一个相关的最终 200 个网址
302/303/307临时路由确认来源应长期保留
304 未修改重用之前抓取的表示确保验证器反映真实的内容更改
404/410资源不存在,可以离开索引有意移除时保留
429服务器过载信号控制负载和重试行为
5xx,网络或 DNS 错误主机无法可靠地服务请求将持续的模式视为紧急的
200 内容为空/错误可归类为软404返回诚实状态或恢复内容

浏览器的成功还不够

测试响应而不仅仅依赖于可视浏览器访问。 CDN 规则、防火墙、机器人防护、地理位置、cookie、设备检测、重定向和间歇性源故障可能会给 Googlebot 智能手机和普通用户带来不同的结果。

获取证据以捕获
  • 确切的请求 URL、最终 URL 和每个重定向跃点。
  • HTTP 状态、响应标头、内容类型和响应时间。
  • 正确主机和爬网程序的 Robots.txt 结果。
  • 在 JavaScript 执行之前获取 HTML 源代码。
  • 渲染的 HTML 和必需的加载资源。
  • 移动内容、元数据、规范和结构化数据奇偶校验。
  • 重复采样以暴露间歇性 5xx 或 CDN 变异。
  • 服务器日志确认爬网程序已到达预期应用程序。

渲染是一个单独的诊断层

Google 使用最新的 Chromium 版本渲染页面,并且可以执行 JavaScript,但渲染会增加依赖项:脚本、API、CORS、CSP、客户端路由、水合作用和资源可用性。基本内容不应等待点击、滑动、打字、同意非必要的跟踪或滚动事件。

已经包含主要内容、标题、可爬行链接和稳定元数据的源 HTML 对于用户和爬虫来说更具弹性。服务器端渲染或静态生成可以提供帮助,但前提是交付的 HTML 正确并且水合作用不会将其替换为错误状态。

图层比较什么失败例子
HTTP响应状态、标头和原始正文200 个没有主要内容的应用程序外壳
源 HTML标题、H1、内容、链接、Canonical、机器人仅在 API 调用失败后添加元数据
渲染的 DOM最终可见内容和锚点水合会删除服务器渲染的文本
资源/APIJS、CSS、图像、数据和权限被阻止的 API 返回空页面
索引视图Google 上次抓取时处理的内容实时修复尚未反映在索引数据中

移动内容是索引基线

Google 使用网站内容的移动版本进行索引和排名。响应式设计通常最容易保持一致,但任何配置都必须在移动设备上提供等效的主要内容、元数据、结构化数据、图像和索引控件。

当移动手风琴的内容存在于呈现的页面中时,移动手风琴是可接受的。仅在用户交互后加载的主要内容并不是可靠的索引策略。

移动奇偶校验
  • Primary copy, headings and important links are equivalent.
  • 标题、描述、机器人和规范值符合意图。
  • 结构化数据描述相同的可见实体。
  • 图像保留有用的替代文本和可访问的 URL。
  • 不会出现仅限移动设备的 noindex、nofollow 或阻止规则。
  • 延迟加载的主要内容不需要用户交互。

索引就是分析和选择

抓取和渲染后,Google 会处理文本、图像、视频、标题、alt 属性、结构化数据、语言、区域设置和其他信号。它评估主要内容,检测重复内容,并可能存储有关选定 Canonical 及其集群的信息。并非每个已处理的页面都被索引。

技术上有效的 200 页面可以保持未索引状态,因为它重复另一个页面,具有不兼容的 Canonical,类似于软 404,提供很少的唯一价值,或者未被 Google 系统选择。重复请求无法将无差别的页面变成更强大的资源。

分度门健康状态未能调查
索引权限没有意外的 noindex元/标头冲突或暂存规则
主要内容有用、可见且特定于模板内容空洞、单薄、重复或类似错误
规范的自我一致的最终 200 偏好不同的目标、重定向或无索引目标
语言/区域设置页面和备用簇一致部分翻译或混合语言模板
移动/渲染奇偶校验基本内容在渲染后仍然存在API或交互隐藏内容
站点上下文相关中心和内部链接支持该页面孤立或近似重复的路线

规范选择发生在索引内部

Google 对相似的页面进行聚类并选择一个代表。重定向和 rel=canonical 是强烈的偏好信号;站点地图包含较弱。内部链接、HTTPS、内容相似性和其他信号也很重要。当声明的目标不等同或证据冲突时,Google 可能会选择不同的 Canonical。

使用 规范和重定向指南 在更改 URL 或合并页面之前。

观察状态通常意味着行动
具有适当 Canonical 的替代页面预期重复合并确认是故意的
无需用户选择 Canonical 即可复制谷歌对没有明确声明的变体进行了分组对齐首选 URL 信号
Google 选择了不同的 Canonical另一个页面看起来更有代表性比较内容和所有 Canonical 信号
带有重定向的页面源不是可索引的目标单独检查最终目标
规范目标未编入索引Target 有自己的准入、质量或选择问题从第一个失败阶段开始诊断目标

索引和服务是不同的结果

索引页面有资格出现,但无权排名。当用户搜索时,Google 会评估相关性和质量以及语言、位置和设备等上下文。搜索功能也会根据查询而变化。

如果 URL 检查显示某个页面已编入索引但未收到展示次数,请调查搜索意图、查询需求、竞争、页面实用性、内部上下文和测量 - 默认情况下不进行爬网。使用 搜索意图指南 和 SEO测量指南.

证据它证明了什么它没有证明什么
URL 已编入索引Google 存储了选定的页面表示目标查询的排名
印象显示查询/上下文的结果点击或转化
点击用户选择了结果这次访问很有用
有机登陆会议Analytics 记录了一次访问Search Console 归因将完全匹配
潜在客户/转化率发生了定义的业务行为SEO 本身就造成了结果

解释页面索引状态而不追求 100%

状态含义优先规则
已发现 – 目前未编入索引已知但尚未抓取优先考虑具有薄弱发现或库存膨胀的重要 URL 群组
已爬网 – 目前未编入索引已获取但未选择检查值、重复、规范和软 404 模式
被 noindex 排除已读取索引规则仅当页面应该公开时才修复
被 robots.txt 阻止无法获取内容修复 Google 必须访问内容或读取 noindex 的问题
带有重定向的页面来源在别处解析当路由是故意的时预期的
替代/重复选择了另一个 Canonical预计会有故意的变体
服务器错误主机或页面返回 5xx持续或广泛存在时紧急
软404尽管有 200,但响应看起来是空的、缺失的或类似错误的恢复有用内容或返回诚实状态

将每个 Search Console 报告用于其实际工作

工具/报告最佳使用重要限制
页面索引已知 URL 的模式和总数示例列表只能显示一个子集
URL检查索引数据一个确切 URL 的最后处理状态反映最后一次抓取/索引周期
URL 检查实时测试修复后当前的获取和渲染检查不测试重复聚类或保证索引
站点地图获取/解析状态和提交的库存提交只是提示,不是索引批准
抓取统计数据主机状态、请求、响应、类型和目的高级报告;例子并不全面
性能查询、页面、国家/地区、设备和搜索外观规范归因和隐私过滤影响总数
搬迁暂时隐藏拥有的 URL不是永久索引或规范解决方案

按正确的顺序阅读 URL 检查

单一URL诊断
  1. 检查确切的首选 URL,包括协议、主机、路径和尾部斜杠。
  2. 检查 Google 是否知道该网址并记下上次抓取日期。
  3. 确认允许抓取、页面获取和观察到的响应。
  4. 确认允许建立索引并检查机器人规则。
  5. 比较用户声明的 Canonicals 和 Google 选择的 Canonicals。
  6. 查看引用发现信号和站点地图关联(如果可用)。
  7. 使用实时测试来验证当前响应和渲染输出。
  8. 将索引证据与实时结果进行比较;不要混淆他们。
  9. 修复生成模板或路由规则,而不仅仅是采样页面。
  10. 在进行有意义的修复后请求索引一次并监控队列。

抓取统计信息和服务器日志回答不同的问题

抓取统计信息按主机、响应、文件类型、目的和 Googlebot 类型总结了 Google 抓取情况。其示例 URL 具有代表性,并非完整导出。服务器或 CDN 日志提供所有记录的爬虫的请求级证据,但不能证明 Google 已对页面建立索引或排名。

问题最好的证据注意事项
Googlebot 是否已到达主机?爬网统计主机状态和验证日志需要时验证正版 Googlebot
哪些回应正在增加?抓取统计响应组和日志一次峰值可能反映启动或移动
具体哪些 URL 模式会消耗请求?完整的服务器/CDN 日志示例报告无法清点每个 URL
重定向是否会产生额外的请求?跳级日志和爬虫输出每个重定向请求单独计数
URL 是否已编入索引?URL检查索引数据记录的爬行不是索引
能见度有变化吗?按页面/查询群组划分的搜索性能Search Console 和分析总数不同

大多数网站不需要高级抓取预算项目

Google 为非常大或经常更新的网站定位抓取预算管理。 Search Console 还指出,大约一千个页面以下的网站通常不需要抓取统计级别的优化。对于普通的服务网站来说,技术清晰度和内容价值通常更重要。

大型电子商务、市场、出版商和多方面网站可能需要更深入的控制。 Google 根据抓取容量和抓取需求定义抓取预算:抓取工具在不损害主机的情况下可以请求什么以及它们想要重新抓取什么。

现场情况优先级典型动作
小型服务网站低抓取预算问题修复损坏的链接、错误、孤立链接和重复链接
外部信号很少的新站点发现与价值强大的枢纽、链接和干净的站点地图
大面电商URL清单和日志控制组合、空状态和重复路径
经常更新的发布者新鲜度和响应能力准确的更新、稳定的服务器和主题中心
迁移临时抓取需求和重定向一跳地图、新站点地图和双主机可用性
持续的 5xx/网络故障爬行能力紧急情况在内容调整之前修复基础设施

从源头管理 URL 库存

请勿尝试通过重复的 Search Console 清理来解决无限过滤器、会话 ID、日历、内部搜索页面或重复路径的问题。防止生成或链接不必要的 URL、定义规范行为、返回诚实状态并仅公开有目的的路由。

SEOWithJack 当前的构建将 710 个 HTML 文档与 459 个可索引站点地图 URL 分开,保留 27 个原始 WordPress 文章路由并审核每个生成的内部目标。这种区别是经过深思熟虑的:公共文件、重定向响应和可索引的规范是相关的清单,而不是必须匹配的数字。

库存应包含应排除
可抓取的站点图有用的公共页面和资源损坏的目的地和仅限活动的路线
可转位规范集用于搜索的独特最终页面重定向、无索引、错误和重复
XML站点地图首选 200 个规范 URL搜索结果、参数和停用的 URL
重定向地图每个已知的旧来源和结果未知的包罗万象的决定
质量检查爬行所有模板、区域设置和边缘情况仅主页采样

可抓取和可索引页面的释放门

投产前
  • 每个预期的着陆页都有一个稳定的最终 URL 和 HTTP 200。
  • Robots.txt 在每个生产主机上都可用,并允许进行所需的爬网。
  • Temporary staging noindex does not leak into production.
  • 源和呈现的 HTML 包含等效的主要内容和元数据。
  • 移动设备包含相同的有意义的内容、链接和结构化数据。
  • Canonical、hreflang、内部链接和站点地图使用最终 URL。
  • 删除的路由会返回相关的重定向、404 或 410,而不是 200 的错误页面。
  • 重定向直接解析,没有循环或可避免的链。
  • 自定义 404、表单、电话和 WhatsApp 操作有效。
  • 代表性页面在启动后通过 URL 级检查。
  • 监控涵盖服务器可用性、索引群组和转化。

以阶段为主导的故障排除工作流程

症状第一阶段测试第一个证据
所有报告中均缺少 URL发现内部链接和站点地图库存
发现,未抓取调度/库存链接重要性、服务器健康状况和 URL 增长
抓取失败抓取状态、DNS、网络、防火墙和日志
Google 的实时页面为空渲染源与渲染的 HTML 和 API 失败
已爬网,未建立索引索引处理内容值、软 404、无索引和重复项
选择了不同的 Canonical规范聚类三网址内容和信号比较
已编入索引但没有展示次数服务/相关性页面查询意图和竞争有用性
迁移后印象下降路由和传输旧/新队列、重定向、规范和日志
流量存在,但销售线索下降转化交付表格、电话、WhatsApp 和分析事件

消除爬行和索引误区

  • “提交的站点地图可以保证抓取和索引。”
  • “重复请求索引可以让 Google 抓取速度更快。”
  • “HTTP 200 表示该页面已被索引。”
  • “索引页面必须对其目标关键字进行排名。”
  • “robots.txt 阻止 URL 出现在搜索中。”
  • “Google 总是等待每个 JavaScript 请求。”
  • “实时 URL 检查显示索引的规范决策。”
  • “每个未索引的 URL 都是 SEO 错误。”
  • “网站应该对每个发现的 URL 实现 100% 的索引。”
  • “小型企业网站需要先进的抓取预算操作。”
  • “更改发布日期会导致重新抓取。”
  • “服务器日志证明页面已被索引和排名。”

常见问题

爬行和索引有什么区别?

爬行是请求 URL 及其资源。索引正在处理检索到的内容、指令、重复项和信号,以确定可以在搜索中存储和表示的内容。

Google 需要多长时间来索引一个页面?

没有固定时间。谷歌表示,重新抓取可能需要几天到几周的时间,并且请求并不能保证索引。发现、需求、服务器健康状况、重复和有用性都很重要。

站点地图能否保证索引?

不。它有助于发现并传达首选 URL,但每个页面仍必须通过访问、处理、规范和质量决策。

为什么页面被抓取但未被索引?

常见原因包括重复、选择不同的 Canonical、薄值或重复值、soft-404 行为、渲染问题或 Google 未选择存储的页面。

当 robots.txt 阻止页面时,该页面可以被索引吗?

URL 有时会根据外部信息显示,因为 robots.txt 会阻止提取,而不是 URL 发现。被阻止时,Google 无法读取页面内容或其 noindex 规则。

noindex 是否可以节省抓取预算?

noindex必须爬取才能读取,可以继续重新访问。将其用于索引控制,而不是作为无限 URL 空间的主要修复。

我应该在每次编辑后请求索引吗?

不会。将其用于一些重要的新的或有意义的固定 URL。对于正常发布和较大的更改,请维护可抓取的链接和干净的站点地图。

URL Inspection 索引数据与现场测试有什么区别?

索引数据显示 Google 最后处理的视图。实时测试检查当前的获取和渲染状态,但不会重现每个索引决策,包括重复集群。

我需要优化抓取预算吗?

通常不适用于中小型服务站点。当大量、快速变化或多面的库存造成有意义的发现和新鲜度延迟时,请考虑高级工作。

当自然流量下降时,我应该首先检查什么?

单独的技术可用性、索引覆盖范围、规范更改、排名/查询需求和转化跟踪。流量下降并不一定会成为爬行问题。

官方参考资料

需要实际的下一步吗?找到实际上失败的第一个阶段。

分享受影响的网址群组、Search Console 状态、最新版本和任何服务器证据。 Jack 可以在建议更改之前将发现、获取、渲染、索引、规范和查询相关性问题分开。

讨论 WhatsApp 上的抓取和索引

本地设计预览

此表单仅用于设计预览,尚未连接订阅服务或外部工具。

浏览文章库