BERT(来自 Transformers 的双向编码器表示)是 Google 于 2018 年开源的一种语言表示技术,并于 2019 年 10 月应用于搜索。它可以帮助 Google 通过考虑周围的上下文来理解单词组合如何表达含义和意图。 BERT 提高了语言理解;它没有创建网站所有者可以直接优化的特殊 SEO 分数、插件、架构类型或惩罚。
2019年10月
发生了什么变化
最初的 BERT 研究从未标记的文本中训练深度双向表示,然后针对问答和语言推理等任务对其进行微调。在普通语言中,单词的表示可以根据其前后的单词而变化。金融账户中的“银行”和河边的“银行”不应该是同一个意思。
当谷歌在搜索中推出 BERT 时,其公开示例集中在小词和关系改变任务的查询上:谁要去哪个国家旅行、是否为另一个人提供药物、是否没有路缘、或者“stand”是否描述的是体力工作而不是“独立”。谷歌表示,它将 BERT 模型应用于排名和精选片段。
目前的谷歌排名系统指南仍然将 BERT 列为人工智能系统,帮助理解单词组合如何表达不同的含义和意图。这并不意味着 2019 年最初的模型、覆盖范围或实施被冻结。搜索同时使用许多系统,Google 不会针对单个网站或查询发布 BERT 报告。
BERT 时间表:搜索系统的研究技术
下面的覆盖率数据是过时的历史陈述,而不是今天的永久百分比。
| 日期 | 记录的里程碑 | 证据支持什么 |
|---|---|---|
| 2018 年 10 月至 11 月 | 谷歌研究人员推出并开源了 BERT 作为一种 NLP 预训练技术。 | BERT 最初是作为可重用语言研究,而不是 SEO 更新。 |
| 2018–2019 | 该研究报告了 11 项自然语言任务的强劲成果,并发表在 NAACL 2019 上。 | 基准性能解释了技术重要性,但并未揭示搜索排名权重。 |
| 2019 年 10 月 25 日 | 谷歌在美国英语搜索排名和多个国家的特色片段中宣布了 BERT。 | 谷歌在推出时表示,它帮助理解了大约十分之一的美国英语搜索。 |
| 2019 年 12 月 9 日 | Google 宣布推出涵盖 70 多种语言的搜索。 | BERT 很快就实现了多语言化;并没有承诺每种语言都有相同的质量。 |
| 2020 年 10 月 15 日 | Google said BERT was used in almost every English query. | 原来的百分之十的数字在一年之内就已经过时了。 |
| 当前文档 | 谷歌继续将 BERT 与其他著名的排名系统一起列出。 | BERT 仍然具有相关背景,但现代搜索并不能仅由 BERT 来解释。 |
翻译 BERT 术语,不要将其变成 SEO 神话
研究概念、搜索产品和内容推荐是相关的,但它们不是同一个主张。
| 期限 | 准确的工作意义 | 请勿推断 |
|---|---|---|
| 双向上下文 | 在 BERT 预训练期间,单词表示可以使用两侧的上下文。 | 谷歌就像一个人一样阅读一个页面或理解每一个陈述。 |
| 变压器 | 通过注意机制将输入元素关联起来的神经架构。 | 网站需要 Transformer 标记或特殊的 JavaScript 库。 |
| 预训练 | 在针对特定任务进行微调之前,从大量未标记文本中学习通用语言表示。 | 每当措辞发生变化时,谷歌都会直接在网站上进行训练。 |
| 微调 | 预先训练的模型适用于下游任务。 | 网站所有者可以通过重复查询变体来微调 Google 搜索。 |
| 搜索排名使用 | 谷歌表示,BERT 在选择和排序有用结果时有助于理解查询含义。 | BERT 是唯一的排名系统或公共页面质量评分。 |
| 精选片段使用 | 谷歌还应用 BERT 模型来提高片段理解。 | 写一个短段落可以保证一个特色片段。 |
这对 SEO 意味着什么
自然地写作,但不要将自然语言与随意或模糊的语言混淆。每当他们改变答案时,都要明确参与者、动作、对象、方向、条件、时间、地点、数量和例外情况。语法上流畅的句子仍然可能含糊不清或事实上空洞。
保持关键词研究。谷歌建议使用人们在标题和主标题等显着位置使用的单词,同时指出语言匹配系统可以将页面与查询相关联,而无需每种精确的变体。实际的转变是从笨拙的关键字字符串转向一项具有完整上下文的清晰任务。
将相关性与质量分开。 BERT 可以帮助解释查询或段落的含义;它不能独立证明该信息是准确的、原始的、最新的或值得信赖的。证据、作者身份、链接、页面体验和其他系统仍然很重要。
误解与负责任的解释
| 误解 | 负责任的解释 |
|---|---|
| BERT 使关键字变得过时。 | 用户词汇仍然有助于发现和清晰度;精确匹配的重复并不能代替意图。 |
| BERT 分数有待提高。 | Google 不公开 BERT 分数、搜索控制台过滤器或页面级诊断。 |
| 需要 BERT 插件或模式。 | 不存在用于 Google 搜索资格的 BERT 特定标记或插件。 |
| 长对话文案自然会更好。 | 有用的上下文可以简洁;填充物和不必要的复杂性使任务变得更加困难。 |
| 使用每个同义词和相关实体。 | 选择支持页面目的的精确自然术语,而不是生成的词汇列表。 |
| BERT 奖励正确的语法。 | BERT 是一个语言理解系统,而不是公共语法质量因素。清晰的编辑仍然有利于用户。 |
| BERT 是一个事实检查器。 | 了解主张的语言并不能确定该主张是否真实或值得信赖。 |
| BERT、RankBrain 和神经匹配是相同的。 | 谷歌将它们记录为具有相关语言理解角色的不同系统。 |
| BERT 创建了 AI 概述。 | BERT 早于生成式搜索体验,与基于 Gemini 的答案生成不同。 |
| 2019 年 10 月的流量变化证明了 BERT 的影响。 | Google 不提供站点级 BERT 报告;必须对技术、需求、意图、竞争对手和其他系统进行调查。 |
BERT, RankBrain, Neural Matching and other language systems
使用谷歌的公开描述来保持系统的独特性。他们真正的生产交互比单一系统 SEO 图更复杂。
| 系统 | 谷歌记录的重点 | 什么不可以索赔 |
|---|---|---|
| 蜂鸟 | 2013 年 Google 整体排名系统的重大改进;现已列为历史。 | 后来的每一个语言系统都只是蜂鸟的另一个名字。 |
| 兰克大脑 | 帮助理解单词与概念的关系,以便返回相关内容。 | 它是一个可测量的用户信号分数或同义词计数器。 |
| 神经匹配 | 理解查询和页面中概念的表示并进行匹配。 | 这是一个 LSI 关键字清单。 |
| 伯特 | 了解单词组合如何表达不同的含义和意图。 | 这是页面质量分数或一次性惩罚。 |
| 通道排名 | 识别页面的各个部分以更好地了解页面相关性。 | Google 将段落索引为单独的 URL。 |
| 妈妈 | 理解并生成某些特定搜索应用程序的语言。 | Google 将 MUM 列为每个查询的通用排名系统。 |
| 搜索中的双子座 | 支持更新的生成搜索体验和功能。 | 每个 AI 概述引文都可以通过 BERT 进行解释。 |
实际反应
- 在起草之前定义页面的一项主要用户任务、目标受众和成功结果。
- 从 Search Console、客户对话、内部搜索、社区和关键词研究中收集真实的查询语言。
- 将具有相同意图和预期答案的变体分组;不要为每个短语创建一页。
- 尽早使用完整、精确的句子而不是一串关键字来陈述直接答案。
- 当“it”、“they”或“this”等代词可以指代多种事物时,命名参与者和对象。
- 保留方向、否定、比较、单位、资格、地点、日期和其他可能颠倒含义的小细节。
- 使用基于决策和子问题的描述性标题,然后将每个部分保持在其承诺的范围内。
- 定义专业术语并将其与初学者或买家实际使用的语言联系起来。
- 当解决真正的不确定性时,添加示例、计算、屏幕截图、证据或例外情况。
- 编辑人工智能辅助草稿,以查找缺失的参照物、虚构的确定性、矛盾的条件和不受支持的主张。
- 链接到真正相关的支持页面,并带有简洁的锚点;避免为每个长尾查询构建瘦页面。
- 衡量查询集群、登陆页面结果和转化,然后从证据中改进被误解或不完整的部分。
一页的上下文清晰度审核
此审核改善了人和机器的通信,而无需假装计算 BERT 分数。
| 上下文元素 | 通过问题 | 警告标志 |
|---|---|---|
| 演员 | 是否清楚谁执行或接收该操作? | 一个代词可以指多个人、公司或产品。 |
| 方向 | from、to、for、by 和 Between 是否表达了正确的关系? | 颠倒出发地和目的地就会改变答案。 |
| 否定 | 是否保留了“不”、“不”、“没有”和“例外”? | 摘要消除了否定并颠倒了指示。 |
| 适用范围 | 该声明是否指定了受众、产品、地点或情况? | 有条件的答案作为通用建议提出。 |
| 时间 | 日期、版本和有效期是否明确? | 该页面混合了历史和当前规则。 |
| 数量 | 数字有单位、分母和比较基准吗? | 显示的百分比没有样本或时间范围。 |
| 参考 | 读者能辨别出 this、that、前者、后者指的是什么吗? | 所指对象在另一段中或缺失。 |
| 术语 | 官方术语是否以受众语言使用和解释? | Synonym variation creates several names for one concept. |
| 答案完整性 | 是否存在决定、原因、下一步以及相关限制? | 该页面与关键字匹配,但会将读者带回搜索。 |
这不意味着什么
- Google 不提供 BERT 分数、影响报告、手动操作、恢复请求或优化开关。
- 这个十分之一的数字描述的是 2019 年 10 月美国英语的发布,而不是当前的报道。
- 超过 70 种语言的声明描述了 2019 年 12 月的扩展,但并未承诺每种语言都有相同的性能。
- “几乎所有英文查询”是谷歌 2020 年 10 月的声明;不应将其转换为当前的确切百分比。
- 谷歌的公开示例说明了语言挑战,但并未公开所有生产功能或排名权重。
- BERT有助于语言理解;它不保证抓取、索引、排名、特色片段、人工智能引用或点击。
- BERT 不能替代事实准确性、第一手证据、来源质量或技术资格。
- 写得更长、添加问题或使用会话填充物都不是 BERT 优化。
- 第三方NLP和内容评分可以支持编辑,但无法验证Google的内部解释。
- Search Console 的更改无法将 BERT 与需求、意图、SERP 布局、竞争对手或其他搜索系统隔离开来。
常见问题
BERT 代表什么?
Transformers 的双向编码器表示,一种预训练上下文语言表示的技术。
Google 何时开始在搜索中使用 BERT?
谷歌于 2019 年 10 月 25 日宣布在美国英语搜索排名中使用,并很快将其扩展到 70 多种语言。
Google 还在使用 BERT 吗?
是的。谷歌当前的排名系统指南继续将 BERT 列为用于理解单词组合、含义和意图的著名人工智能系统。
我可以专门针对 BERT 进行优化吗?
没有什么特殊的设置。相反,改进页面的任务、上下文清晰度、证据和实用性。
BERT 取代了关键词吗?
不可以。使用观众使用的词语,尤其是在标题和标题中,但避免尴尬的重复和每个确切变体的页面。
BERT 和 RankBrain 一样吗?
不会。Google 将 BERT 记录为单词和意图的组合,而 RankBrain 则帮助将单词与概念联系起来。
BERT 和神经匹配一样吗?
谷歌将神经匹配描述为匹配查询和页面中的概念表示;系统可以具有相关的角色,但并不完全相同。
BERT 判断内容质量吗?
不是靠它自己。语言理解有助于相关性,而谷歌使用许多其他系统和信号来评估有用性和可靠性。
结构化数据对 BERT 有帮助吗?
结构化数据可以支持符合条件的搜索功能,但 Google 不提供特定于 BERT 的架构或标记。
多语言网站应如何应对?
编写和审查每种语言的原生含义,保留方向和条件,并避免直译,从而改变用户的任务。
官方来源和主要参考资料
- Google 搜索:比以往更好地理解搜索
- 谷歌研究:开源 BERT
- 谷歌研究出版物:BERT
- Google 搜索排名系统指南:BERT
- Google 搜索:BERT 几乎用于每个英语查询
- 搜索引擎领域:BERT 推出到 70 多种语言
- Google 搜索:Google 如何提供可靠的信息
- Google 搜索:创建有用、可靠、以人为本的内容
- Google 搜索中心:SEO 入门指南
- Ahrefs:搜索意图和 3C
- Semrush:Google 搜索算法的工作原理


