跳至正文
中

AI 爬虫、搜索访问与训练控制

Jack Lee

作者 Jack Lee

开发者操作三块互相连接的屏幕

AI 产品可以在搜索中找到你的网页,同时不拿它训练模型吗?在部分平台,可以。关键是先分清你要控制哪一种用途。

AI 访问网页,可能在做三件不同的事

搜索发现是自动抓取网页,供产品在回答中考虑是否链接。模型训练是将收集到的资料用于改进未来的模型。用户发起的读取则是有人要求产品打开某个网页,或根据它回答问题。同一家公司可能为这些用途设置不同的爬虫或控制项。

被抓取不代表一定会获得引用。封锁一个爬虫,也不一定影响其他爬虫。想先了解整体概念,可以阅读我们的 AI 搜索入门。

不同平台分别提供哪些控制?

平台搜索或回答的访问训练或其他控制
OpenAIOAI-SearchBot 用于 ChatGPT 搜索。GPTBot 涉及可能用于基础模型训练的内容;ChatGPT-User 则是用户发起的独立访问。
GoogleGooglebot 抓取普通搜索内容。Search Console 另设 AI 摘要、AI 模式等生成式搜索功能的站点控制。Google-Extended 是 robots 控制标记,涉及未来 Gemini 模型训练及部分 Gemini 内容依据用途;它不影响普通搜索的收录或排名。
AnthropicClaude-SearchBot 用于改善搜索结果;Claude-User 根据用户问题读取网页。ClaudeBot 是训练爬虫。Anthropic 表示其爬虫遵守 robots.txt。
PerplexityPerplexityBot 帮助网页出现在搜索结果中;Perplexity-User 根据用户请求读取网页。Perplexity 表示其搜索爬虫不用于基础模型训练;用户读取程序一般不遵守 robots.txt。

以上是各公司截至 2026 年 10 月公布的用途,并不是通用的“AI 爬虫”标准。Perplexity 也没有把它的搜索爬虫描述成训练开关。修改全站规则前,应重新核对该平台的最新说明。

可以允许搜索,却拒绝训练吗?

对 OpenAI 而言可以:它把 OAI-SearchBot 和 GPTBot 设为独立控制。如果网站选择允许搜索抓取,却不允许未来的模型训练抓取,根目录的 robots.txt 可以采用以下示例:

User-agent: OAI-SearchBot
Allow: /

User-agent: GPTBot
Disallow: /

这样设置不保证网页会出现在 ChatGPT 答案中,也不能撤回过去的数据使用。OpenAI 表示,拒绝 OAI-SearchBot 后,网站不会出现在 ChatGPT 搜索答案中,但仍可能作为导航链接出现。规则变更反映到系统可能需要约一天。

Google 的方式不同。Google-Extended 是 robots 控制标记,不是独立的 HTTP 请求爬虫;它不控制普通 Google 搜索的收录。Search Console 的“搜索生成式 AI”设置,另行决定站点链接和内容是否进入所涵盖的生成式搜索功能。具体范围见我们的 AI 摘要与 AI 模式指南。

robots.txt 能做什么,不能做什么?

robots.txt 告诉愿意配合的爬虫哪些网址不要抓取。它不是密码、全面的授权决定,也无法撤销过去的训练。公开网址仍可能通过其他网页被发现。私人资料应使用身份验证保护。

文件应放在每个主机的根目录,例如 https://example.com/robots.txt;子域名需要自己的规则。要测试规则针对的 user-agent 分组:如果误对搜索爬虫使用 Disallow: /,可能失去搜索访问。我们的 robots.txt 指南介绍语法与测试。可选的 llms.txt 文件不能代替访问控制。

用户发起的读取也各不相同:OpenAI 表示 ChatGPT-User 可能不遵守 robots 规则;Perplexity 表示 Perplexity-User 一般不遵守;Anthropic 则表示包括 Claude-User 在内的爬虫会遵守。

如何检查一个网站的 AI 访问设置?

  1. 先写下目标。你想保留普通 Google 搜索曝光、某个 AI 搜索功能、限制模型训练,还是几者兼顾?不要一开始就照抄爬虫名称列表。
  2. 检查现有控制。打开每个域名和子域名正在使用的 robots.txt。另行查看 Google Search Console 的生成式 AI 设置,以及可能挡住爬虫的 CDN 或防火墙规则。
  3. 一次改一项。保留旧文件,记录规则针对的 user-agent 和网址范围,并测试你打算允许的搜索爬虫能否访问公开页面。
  4. 验证结果。重新获取 robots.txt,检查服务器或 CDN 日志,并使用平台提供的官方检查方式。单凭 user-agent 字符串不能验证请求来源;适用时还要核对官方公布的 IP 范围。给规则生效留出时间;没有 AI 引用不代表爬虫被挡住。

例如,一个厨房家电网站可能希望安装指南能被搜索发现,却不希望某平台为训练而抓取。它应先确认指南是公开网页,再调整该平台的训练控制,同时避免误挡搜索爬虫。这只是政策情境,不是客户成效。

访问问题解决后,再用我们的 抓取与索引指南检查页面层面的条件。

常见问题

挡住训练爬虫后,我会从 AI 搜索消失吗?

不一定。OpenAI 将 GPTBot 与 OAI-SearchBot 分开控制。其他平台的规则不同,应核对你要处理的具体产品。

封锁 Google-Extended 会让网站退出 Google 搜索吗?

不会。Google 表示 Google-Extended 不影响普通搜索的收录或排名。另一个 Search Console 设置控制所列出的生成式搜索功能。

一条 robots.txt 规则能挡住内容的所有 AI 用途吗?

不能。不同平台使用不同爬虫,部分用户发起的读取也可能不遵守 robots 规则。robots.txt 是抓取指令,不是访问保护;私人内容应使用身份验证。

本地设计预览

此表单仅用于设计预览,尚未连接订阅服务或外部工具。

浏览文章库