一家汽车零件店有一张刹车泵分类页。网页在浏览器能打开,店主却在 Google 找不到它。是 Google 还没发现、决定不收录,还是选了另一个网址?
收录,是 Google 决定把网页加入可搜索索引。noindex 则要求 Google 不收录。网页出现在网站地图、甚至已被抓取,都不能证明它已被收录。先查准确的网址,再决定要不要改内容。
收录是什么意思?
Google 可以从链接或网站地图发现网址,随后请求网页进行抓取,再决定是否把某个版本的内容加入索引。被收录的网页才有机会在相关搜索中被考虑,但不保证排名。技术 SEO 指南解释了从发现到搜索的完整流程。
以刹车泵分类页为例:网站地图列出它,只代表店家提供了这个网址;抓取成功,只代表 Google 取得了网页。两者都不能证明 Google 把这条准确网址留在索引里。XML 网站地图指南解释了清单该列哪些网址。
哪些网页值得让 Google 收录?
先问:这张网页本身能不能成为有用的搜索入口?主要的刹车泵分类页可能帮买家比较适配零件、找到产品。相反,一张不含个人资料、只告诉用户“预约完成”的通用确认页,通常不是搜索入口;若页面含有个人资料,还必须用权限控制保护。
不要假设每个公开网址都必须收录。筛选和排序网址可能重复分类页的内容;Google 可能选定一个规范版本,略过其他近似网址。如果主要分类页已经收录,其他版本被排除未必是错误。
noindex 会做什么?
noindex 指令告诉 Google 不要收录网页。HTML 网页可以在 <head> 里设置 robots meta 标签,例如 <meta name="robots" content="noindex">;HTTP 回应标头 X-Robots-Tag 也能表达这条指令,并适用于 PDF 等文件。Google 必须能够抓取网址,才看得到指令;已经收录的页面也要等它再次读取,才可能移出索引。
因此 robots.txt 与 noindex 不能互换。前者若阻挡抓取,Google 可能读不到后者;它仍可能通过别处的链接知道被挡的网址。robots.txt 指南专门解释抓取限制。
只有公开可访问、却不该出现在搜索结果的网页,才考虑 noindex。它不能保护隐私。不要为了排除单张网页,就把标签加到整站共用模板;也不要对重复产品网址一律加 noindex,应先决定哪一个才是规范版本。
想收录的网页,为什么可能没被收录?
“未收录”没有万能修法。Google 可能不知道这条网址、无法抓取、收到错误回应、看到 noindex,或把它当成另一条网址的替代版本。“已发现—尚未编入索引”表示它知道网址,但还没抓取;“已抓取—尚未编入索引”表示已取得网页,却还没将它收录。先看准确网址的状态,不要同时乱改多个设置。
刹车泵分类页与车辆筛选页就是一个例子:如果被排除的是筛选网址,而清楚的主分类网址已经收录,这可能正是想要的结果。若缺席的反而是主分类网址,才检查它的访问、索引指令、规范网址信号和实际内容。
怎样检查一条网址?
- 打开准确的公开网址,确认它显示预期内容,并正常回应
200,而不是错误页;主要信息也不应要求登录。 - 在 Search Console 的「网址检查」查看 Google 已记录的资料;若页面最近改过,再运行实时测试。检查抓取许可、noindex,以及报告中 Google 选定的规范网址。实时测试不保证收录。
- 比较其他相似版本。如果 Google 选了另一个网址,检查内部链接、网站地图和 canonical 提示是否一致指向你想保留的页面。如果已经抓取但未收录,再看该页是否提供独立而有用的答案。
- 修正具体问题后,视情况请求编入索引。请求只是邀请 Google 再检查,不是完成期限或保证。
常见问题
SEO 里的收录是什么意思?
Google 决定把网页或所选版本加入可搜索索引,就叫收录。发现与抓取在前,收录本身不保证好排名。
什么时候该用 noindex?
公开可访问、却不该出现在 Google 搜索的网页可以使用,例如不含个人资料的通用确认页。要允许 Google 抓取,才能让它读到指令。
Google 没收录网页,怎么处理?
先在 Search Console 检查准确网址。根据报告修复访问问题、误设的 noindex 或不符合预期的规范网址,再让 Google 重新检查。
“已抓取—尚未编入索引”怎么处理?
这表示 Google 已取得网址,却还没收录。检查它是否选了别的网址作为规范版本,以及本页有没有独立而有用的答案。解决实际问题;反复提交未修改的页面并不是修法。


