via https://moz.com/blog/does-schema-markup-impact-serp-rank
结构化标记(Schema markup)长期以来在 SEO 行业中一直备受争议,有人认为它是任何 SEO 策略中不可或缺的组成部分。一方面,有些人完全相信 Google 官方的说法,即结构化标记仅通过富摘要(rich snippets)和上下文理解来影响搜索外观。而另一方面,也有人坚信,如果 Google 推荐通过 schema 添加结构化标记,那么它必然对排名有某种直接的积极影响。
这些年来,我们见过 LinkedIn 上的意见领袖、零星的“证据”以及相关性研究,似乎各自为双方观点提供了支持。但零星的个人经验无法被验证,且通常缺乏足够的样本量;相关性研究只能说明相关,不能证明因果,而且无法排除研究对象之间的其他独立变量。
大多数个人和机构并没有条件去开展如此大规模的对照实验来隔离变量。像行业、业务地点、权威度、网站规模、技术栈和网站结构等因素,往往都是无法轻易隔离的额外变量。
这正是我们机构非常适合开展这类研究并辨别事实与迷思的原因。
在 Evergrow Marketing 进行的一项为期 10 周的研究中,我们将 29 个客户置于受控环境中,以精确观察 schema 标记如何影响 Google、Google 移动版、Bing 和 Yahoo 的 SERP 排名。
该研究将受试对象分为对照组和测试组:
- 全部属于园林绿化行业
- 全部位于美国,并按地区划分
- 所有其他 SEO 工作均暂停
- 所有网站规模和权威度相近
- 所有网站使用相同的内容管理系统(CMS),并由我们机构使用相同的网站模板构建
结果与我们预想的颇有不同。
方法论
原始方法论是一份 8 页的 Google 文档,已在原始 schema 研究的方法论部分中重新整理为可折叠的章节。为了便于理解,我在此处提供简版。
我们机构的背景及研究概况
简要介绍我们机构的背景,有助于更好理解这项研究以及为何选择该行业进行实验。
我们是一家专注于园林绿化和草坪护理企业(以及其他绿色和户外生活类企业)的数字营销机构。我们的客户均为严格意义上的本地企业,在规模、策略和服务上极为相似。
除此之外,我们要求几乎所有新客户的网站都由我们基于 WordPress 的模板主题来构建或重建。各网站之间唯一的真正区别在于品牌标识、图片、内容和本地化信息。
本研究的目的在于,鉴于我们客户的本地业务分类,确定 schema 标记是否是一种有效的排名提升手段。
我们使用的 schema 标记
此环节的一个主要考量是决定使用哪种 schema。虽然部分客户网站有博客文章、常见问题解答和工作列表页面,但另一些客户没有。我们需要一种能适用于所有测试对象的统一 schema 标记。
因此,我们选择了 schema.org 中的 LocalBusiness 标记。我们甚至就 LocalBusiness 标记中应使用的项目和类型咨询了 Jarno Van Driel、Yoast 和 Moz。
在使用 schema 标记时,最大的考量是:我们希望仅隔离“在网站上添加 schema 这一行为本身”对排名的影响,而不是“通过富摘要提高点击率(CTR)进而影响排名”的影响。
除了 JobPosting schema 之外,本地服务行业中能产生富结果的标记并不多,尤其是 FAQ 富摘要已在 2023 年 8 月之后被完全弃用,仅保留给政府机构和卫生组织使用。
考虑到这一点,我们避免使用任何可能产生富摘要且仍有效的 schema 标记,例如 priceRange 或 reviewRating。
完整使用的标记可在原始研究的“方法论”部分找到。
测试前准备与客户分组
在任何对照实验中,最难的部分是确定符合条件的受试对象。在我们的 50 个客户中,我们找到了 29 个符合条件的客户。
这 29 个客户均满足以下条件:
- 仅使用我们的基础级 SEO 服务
- 位于美国
- 网站由我们构建(使用 WordPress 和 Divi)
- 没有持续产生新的或常规内容
- 已与我们合作六个月或更长时间
这 29 个客户随后被分为两组:
- 对照组
- 测试组
对照组的所有 SEO 工作暂停,且不向其网站添加任何 schema。测试组的所有 SEO 工作同样暂停,但该组会获得 LocalBusiness schema 标记。
我们行业面临的一个独特挑战是搜索量和竞争具有季节性。由于我们是在 2 月至 4 月之间进行实验,正好处于春季繁忙期开始之时。我们的南方客户不像刚从雪冬中走出的北方客户那样明显感受到这种高峰期。
为了控制季节性变量,我们确保对照组和测试组在美国各个地理区域拥有相同数量的客户。
(数据表格展示测试组和对照组的地理分布,表格将 29 个参与域及其对应的 Google 商家资料均匀分布在南部、东北部、中西部和西部,以控制季节影响。)
对照组有 13 个客户:
- 南部 6 个
- 东北部 3 个
- 中西部 3 个
- 西部 1 个
测试组有 16 个客户:
- 南部 6 个
- 东北部 3 个
- 中西部 6 个
- 西部 1 个
注意:由于每个客户拥有的门店数量不同,按地理位置划分时组间更为均衡。尽管每组客户数量不同,但每组拥有的 Google 商家资料(GBP)位置数量均为 18 个。
如何清理环境并设定基准
任何对照研究的一部分工作都是“净化”环境,以避免任何偏差或结果污染。在我们的研究中,这意味着从实验中的所有客户网站上完全移除任何已有的 schema。
由于我们机构之前并未采用添加任何 schema 标记的做法,因此我们唯一需要移除的是所有网站上都使用的 Yoast 插件原生添加的面包屑 schema。
随后,我们通过 Google Search Console 验证了最新的索引和抓取报告,确保其未检测到任何 schema,并且网站已在新的“净化”环境中被 Google 正确索引。
定义对照期和测试期
移除了 schema 并确认所有网站均无 schema 之后,我们等待了 5 周,以让任何潜在的 schema 相关排名变化趋于平稳。
这段时间即为对照期。
对照期结束后,我们进入了为期五周的测试期,在此期间仅向测试组添加 schema。
在五周测试期的第一天之前,我们会为所有受试对象创建一份基准报告,并在测试期的最后一天创建最终报告。
我们跟踪的搜索引擎和查询
当提到“SEO”时,大家首先想到的就是 Google。显然,Google 的市场份额遥遥领先,但了解其他搜索引擎如何处理 schema 标记也很有价值。
为此,我们使用 Moz Pro 在以下搜索引擎中跟踪所有结果:
- Google(桌面)
- Google 移动版
- Bing
- Yahoo!
如果 Google 不重视,也许 Bing 会重视。
为此测试,我们跟踪了两种不同类型的查询:
- 一般查询
- 特定查询
一般查询如“[服务] 公司 [目标地点]”,而特定查询如“你能推荐一家服务 [区域]、且在周五中午营业的 [服务] 公司吗?”
任何 SEO 可能只关心一般查询结果,但由于 schema 标记本就是为了向搜索引擎提供特定的、基于实体的信息,因此纳入一个搜索引擎可能从中提取信息的特定查询是有意义的。
结果
一项好的测试不会简单地在测试期结束时取一组的平均排名位置与另一组进行比较。一个极端值就可能打乱整个数据集。
高质量的研究通常使用 Welch’s T-Test(韦尔奇 t 检验),它能将受控变量导致排名改善的置信度以百分比形式计算出来。
本次测试我们使用单尾 Welch 双样本 t 检验。该公式不仅考虑整体平均排名变化,还考虑每个受试对象排名变化的标准差。仅说“这组平均比另一组有改善”是不够的;该公式能给出一个置信度表述,例如:
“不仅该组比另一组有改善,而且我有 90% 的把握认为引入的变量会提升排名,因为测试组 16 个受试对象中有 14 个看到了改善,而对照组 13 个中只有 7 个有改善,且这些改善在统计上显著。”
关于置信区间的简要说明:当你看到本报告中的置信百分比时,请理解 50% 基本相当于抛硬币。50% 的置信度无法告诉我们任何信息。
同样,75% 的置信区间也不足以说明变量是排名改善的原因。医学研究通常接受超过 95% 的置信度。低于此标准则被认为不确定或不太可能。
我们不是医学领域。Schema 标记是一种相对低投入的做法,因此在本研究中,我会将 90% 或以上的结果视为事实。不过,对于 80% 或以上的结果,我也会给予一定关注。
我无法确定 80% 的置信度就一定意味着 schema 有影响,但它可能有,也可能没有。
基于上述标准,我们来看结果。
一般查询的结果
坦率地说,我在开始这项实验时的假设是:schema 标记对 Google 的排名完全没有作用。我始终乐于接受惊喜;可惜 Google 并没有给我这样的惊喜。
最大的意外是,schema 标记竟然也未能对 Bing 产生任何有信服力的影响。
(置信区间图表显示 schema 标记对一般本地查询的搜索引擎排名影响:Google 和 Google 移动版为 0.00%,Bing 为 70.33%,Yahoo! 为 81.96%。)
我原以为在所有搜索引擎中,Bing 会有显著影响,因为 Bing 的首席项目经理 Fabrice Canel 曾评论说 Bing 如何利用 schema 帮助其 LLM 理解上下文。
但这项测试表明,Google 可能并不需要 schema 来理解上下文,而 Gemini 能够利用 Google 的索引和知识图谱进行上下文理解。如果 CoPilot 用它来进行上下文理解,那为什么 Bing 不呢?
Yahoo 落入“可能”的范畴。虽然没有达到 90% 或更高的置信度,但 81.96% 仍然较为显著。我认为 schema 标记会影响 Yahoo,因为 Yahoo 可能没有 Google 那样的资源来在没有 schema 的情况下理解上下文。
对于 Google,我们可以明确地说:schema 标记对排名没有直接的任何影响。
注意:当我们看到 0.00% 时,表示测试组的表现平均上并不优于对照组。为了运行 Welch’s t-test,测试组的表现必须优于对照组;如果不满足,则必须输入“0.00%”。
特定查询的结果
我们很好奇,当查询中包含特定信息时,schema 会如何影响排名,从而迫使搜索引擎寻找客观性,而不仅仅是主观性。
(置信区间图表显示 schema 标记对特定本地查询的搜索引擎排名影响:Google 和 Yahoo! 为 0.00%,Google 移动版为 82.87%,Bing 为 83.94%。)
结果再次令人意外。
我们原本预期 Yahoo 会像一般查询那样达到 80‑90% 的范围,但这一次对照组的表现反而优于测试组。
另一个意外结果是 Google 移动版和 Bing,当输入特定查询时,它们都显示出 LocalBusiness schema 标记具有“潜在”影响。
在这个示例中,我们要求搜索引擎查找关于某个企业的非常具体的信息。
这让我不禁思考:Google 和 Bing 是否更倾向于展示来自拥有最完整数据集来源的客观信息。
不过作为 SEO,我个人并不特别关注特定查询测试的结果,原因有二:
- 它过于特定
这类查询非常具体,在 SERP 中几乎没有任何搜索量。如果一般查询测试能得到这些结果,我才会更重视 Google 移动版和 Bing 的表现。 - 它更可能是面向 LLM 的查询,而非 SERP
这种查询可能更常在 AI 模式或 LLM 中被提出,在这种情况下,SEO 从业者会更关注查询扇出和检索时的接地查询,而不是输入查询本身。
搜索可见性结果
我们使用 Moz 进行的最后一项测试是评估添加 LocalBusiness schema 对搜索可见性报告的影响。换句话说,就是针对我们跟踪的关键词,在‘x’次搜索中我们能预期获得的点击百分比。
每个受试对象在 SERP 中排名越高,其搜索可见性就越好。如果某个受试对象排名第 10 位(第一页),其搜索可见性可能为 10%;如果上升到第 1 位,则可见性可能达到 50%。
排名超过第 20 位(第二页)之后,可见性即为 0%。
(置信区间图表显示 schema 标记对搜索可见性的影响:Google、Google 移动版、Bing 和 Yahoo! 均为 0.00%。)
在我看来,搜索可见性测试的结果是最重要的。在所有搜索引擎中,对照组的平均表现均优于测试组,因此无法进行 t 检验。
这意味着,我们之前对一般查询中 Yahoo 以及特定查询中 Google 移动版和 Bing 所给出的“可能”标签,现在可能更倾向于“否”。
当然,测试组确实更频繁地出现排名上升,但搜索可见性测试表明,这些排名上升甚至不足以产生显著影响,也无法将平均排名提升到第 20 位(Google 第二页)以上。
Schema 共识
基于本研究的结果,我们可以确信:在网站或页面上添加 schema 标记并不能提高排名,也不是任何影响排名的信号。
但这并不意味着 schema 标记本身就毫无用处。恰恰相反,在许多行业和应用中,schema 标记是一种非常有价值的工具。
如果你希望在 SERP 中获得更多可见性,使用能够产生富摘要的标记是一种明智的脱颖而出方式。
遗憾的是,在本地服务类业务中,能产生富摘要的标记仅限于少数几种选择,例如 priceRange 和 Product 类型下的 review 属性。
注意:在本地服务类业务网站上标记评论时要小心,因为 Google 的评论标记政策禁止标记聚合的第三方评论或由网站所有者自己生成的评论,这被视为利益冲突。可标记的评论必须是用户针对特定产品或服务生成的,且必须使用 Product 类型下的 review 属性,并仅展示在该产品或服务的页面上。
(Google 结构化数据指南截图,警告在 LocalBusiness schema 中使用自我服务评论或聚合第三方评论可能导致人工处罚。)
Schema 标记至关重要的场景
某些应用和行业几乎将 schema 标记视为必需的 SEO 策略。本地企业可以利用的一个例子是 JobPosting schema。
当你在 Google 中搜索“我附近的园林绿化工作”时,要在下方结果中出现的唯一方法,就是用正确的 JobPosting schema 标记职位列表页面。
(Google 职位富结果示例,由 JobPosting schema 生成,截图显示搜索结果中直接出现的交互式职位板,用于本地园林绿化职位。)
这是 Google 在自然列表之前显示的第一批结果。如果没有此类 schema,你的职位发布在 Google 上几乎不可见。
Product schema 是另一种在传统搜索中展示产品的重要类型。当然,你可以使用 Merchant Center 在 Google Shopping 中展示,但如果没有 Product schema,你的产品详情就无法在传统搜索结果中出现。
(相机产品的 Google 自然搜索结果截图,Best Buy 列表下方显示价格、库存状态、星级评分和配送详情等富摘要,由 Product schema 生成。)
LocalBusiness schema 在 SEO 策略中的定位
LocalBusiness schema 被我归类为“非富摘要型 schema”。这类 schema 对搜索外观或排名完全没有影响。
然而,我对此的立场是:
LocalBusiness schema 实施起来非常简单,而且只需做一次。我们知道 Google 和其他搜索引擎会抓取 schema 内的内容并理解其上下文,因此这不过是搜索引擎可以依赖的额外信息。
对于本地企业而言,这是一种良好的“内务管理”做法。
考虑 AI 和大语言模型(LLMs)
虽然基础 LLM 依赖于其预训练知识,但现代 AI 搜索引擎使用检索增强生成(RAG)从网络上获取实时数据。由于处理大量检索到的文本会消耗令牌(进而耗费算力和金钱),因此“分块”(chunking)的理念有助于只向 AI 提供最相关的片段。
同时,也有理由认为像 JSON‑LD 这样的 schema 标记对令牌消耗是有利的。其严格的结构提供了明确的上下文。通过明确定义实体、价格和关系,JSON‑LD 允许自动化的 AI 网络爬虫和 RAG 系统以极高的准确性解析和理解页面内容,从而显著影响 AI 在最终回答中选择包含哪些数据。
我预见未来可能出现两种情况:一种是这些系统更倾向于使用 JSON‑LD 来防止幻觉;另一种则是 LLM 足够强大,不再需要它。
幸运的是,我们在完整测试中实际测试了三种不同的 LLM。你可以在 Evergrow Marketing 的完整研究中查看相关内容。
结论:Schema 标记是有用的工具,而非排名策略
尽管本研究得出了上述结果,但这不应阻止任何人使用 schema 标记,也不应将其视为像 meta keywords 那样过时的策略。
它仍然有非常适用的场景,也存在未知的变量。
它易于添加,你甚至可以使用免费的 Mozbar 来检查 schema 的实施情况。
