必应网站管理员工具 AI 性能评测:我们喜欢的 7 个方面。

via https://searchenginewatch.com/bing-webmaster-tools-ai-performance/

我本人是必应网站管理员工具的粉丝。 我已经说过很多次了,今天还要再说一遍:我认为他们在过去几年里取得了长足的进步,产品确实有了很大的提升。

今天,我们要来研究一个相对较新的功能:AI 性能报告。我们将使用我们自己的一个网站,向您展示真实的(已脱敏)数据,并带您逐步解读。开始吧!


什么是必应网站管理员工具中的 AI 性能?

AI 性能是必应网站管理员工具内的一份免费报告,用于显示已验证网站中的页面在受支持的 AI 生成答案中被引用的次数。微软于 2026 年 2 月推出了该功能的公开预览版。第一个版本报告了总引用次数、日均引用页面数、基础查询(grounding queries)、页面级引用活动以及随时间的变化趋势。

2026 年 6 月,微软为报告增加了四项新功能:

  • 意图(Intents):为基础查询添加分类标签,如信息型、商业型、研究型、比较型、规划型和本地型。
  • 主题(Topics):将相关的基础查询归入更宽泛的主题类别。
  • 引用份额(Citation Share):估算您的网站在某个特定基础查询的全部引用中所占的比例。
  • 比较(Compare):叠加两个时间段,使引用活动的变化更加一目了然。

根据微软的 AI 性能文档,该报告覆盖了 Microsoft Copilot、必应中的 AI 生成摘要以及“部分精选的合作伙伴 AI 集成”。我们稍后会回到这个刻意模糊的第三类。


报告涵盖的最重要指标

指标通俗含义我们如何使用
总引用次数网站内容被明确引用为来源的次数观察整体方向性趋势,而非业务影响
日均引用页面数每天被引用的独立页面数量的平均值查看引用可见性是集中于少数页面还是分散分布
基础查询检索引用内容时使用的分组短语理解系统如何将页面与主题和意图关联起来
页面级引用附加到单个 URL 上的引用计数发现意料之外的“黑马”页面以及表现不佳的重点页面
引用份额您的网站在某个特定基础查询下获得的引用占比追踪真正对业务重要的查询中,您的相对存在感

“基础(grounding)”这个词听起来比实际复杂得多。AI 系统需要依据来源来生成答案,而用于找到这些来源的检索短语就是基础查询。它们不一定等同于用户实际输入的词语。


我们喜欢必应 AI 性能的 7 个方面

1. 它免费为发布者提供第一方 AI 引用数据

我们先从必应做得最简洁的一点说起:已验证的网站所有者无需购买其他工具,就能查看第一方 AI 引用数据。在 AI 可见性产品像其仪表盘一样迅速激增的当下,免费获取数据比以往任何时候都更重要。

大多数人首先注意到的数字是总引用次数。这个数字很大、很清晰,而且方便截图。但它也极易被误用。一次引用意味着某个页面在受支持的 AI 回答中被明确提及或展示为来源。它并不代表该引用很突出、用户点开了它,甚至不代表该页面在答案中起到了决定性作用。

微软对此异常直白:它明确表示,AI 性能不衡量排名、权威性、重要性或表现。报告只统计引用次数。

这使得总引用次数作为一个基准和方向性趋势指标是有用的。它给团队提供了一个合理的起点去提出问题,尽管它并不能代替流量、读者量或商业价值。


2. 页面与查询的映射关系非常实用

基础查询视图是 AI 性能报告超越普通装饰性图表的关键所在。

每一行都显示一个与检索和引用活动相关的简短短语。您可以选择一个查询,查看为该查询引用的页面;或者选择一个页面,查看与之关联的基础查询。一个查询可以映射到多个页面,一个页面也可以映射到多个查询。

对于发布者来说,这可以引发三种有益的探索(见下一点)。


3. 基础查询展示了必应如何理解您的内容

基础查询为发布者提供了大多数 AI 可见性报告难以提供的东西:了解引用背后的检索上下文。它们显示了微软系统与页面关联的主题和任务,这可能会揭示编辑部之前未曾考虑过的有用角度。

这里有一个重要的边界:基础查询并非完整的用户提示词。微软将其描述为经过分组、概括后的短语,代表多个 AI 答案中的活动。它们可能显得简短或模糊,因为仪表盘是在汇总大量交互。

如果有人将这些短语当作“用户使用的确切提示词”来呈现,那便是过度解读了数据。

尽管如此,这些短语对于理解宽泛的检索上下文仍然非常有用,但不适合用来推断精确的用户语言。我们不会像对待传统关键词报告那样,直接把它们复制到内容简报中。它们的价值在于揭示了主题与被引用页面之间的关联关系。


4. 意图和主题让杂乱的数据集更易解读

意图主题的加入,使得大量数据导出后更容易浏览。

意图将基础查询分类,超越了传统的信息型、导航型和交易型模型。必应包含的类别有:学习和解决、研究、比较、规划、实用、创作和对话等。

这很有用,因为同一个主题可以支撑截然不同的任务。一个正在了解产品功能的人,和另一个正在将其与两个竞品比较的人,处于不同的阶段。

主题则高一个层级,将相关的基础查询归入更宽泛的主题集群,这样发布者就能看到引用活动是围绕某个主题在增长,还是仅仅围绕某个单一短语。

我们会将两者用作编辑部审核的筛选条件,但不会让任意一个分类器自动决定编辑计划。

微软表示,这些标签由不断演进的 AI 和机器学习系统生成。模糊的查询可能被分配不准确的意图,而专业性很强的查询可能被归入过于宽泛的主题。这是一个诚实的局限,我们预计在技术类出版物中会经常遇到。


5. 引用份额提供了原始总数所缺乏的上下文

引用份额是指您的网站在同一个基础查询下,在所有引用总数中所占的百分比。

这比原始总数更有用,因为它引入了上下文。您的网站可能引用次数在增加,但如果整个引用空间增长更快,份额反而可能下降。反之,您的总数可能不大,但在某个狭窄但有价值的查询中份额很高。这比孤立地庆祝引用次数更有意义。

我们更倾向的做法是:选择一小部分对您的出版物真正重要的基础查询,并持续监控它们。而一味寻找网站上最高的百分比,大多只会得出虚荣结论。


6. “比较”功能为内容更新提供了恰当的前后对比视图

“比较”功能将上一周期以虚线叠加在当前周期之上。您可以选择标准周期或自定义范围。

这使得在更新内容后使用报告变得容易得多。记录发布或更新日期,留出重新抓取和处理的时间,然后比较更改前后相同时间窗口的数据。

微软还列出了引用模式可能变动的其他原因:用户需求变化、模型更新、合作伙伴刷新周期、新鲜度信号以及网络上其他地方的变化。“比较”功能可以为实验提供支持,但不能将实验转化为因果证明。


7. 导出功能和文档非常务实,令人耳目一新

必应允许用户将基础查询、被引用页面和时间序列数据导出为 CSV 或 Excel 格式,并应用当前筛选器。这听起来很基础,但正是这一点,让报告从只能在浏览器中欣赏的工具,变成了编辑部或 SEO 团队可以真正深入研究的资源。

我们还很欣赏微软对数据局限性的坦诚记录,而不是假装仪表盘是一本完美的账本。这部分内容应该放在每一篇严肃产品评测的靠前位置。

必应表示,仪表盘呈现的是有代表性的汇总视图,而非每一次引用的完整日志。低频活动可能不会出现。页面表格、基础查询表格和时间线之间的总数可能不一致。数据每日刷新并有一定的处理延迟,后续处理可能会对结果进行修正。

还有一个更奇怪的细节:当您筛选一个查询,然后查看其下某个页面时,该页面的引用次数可能与您筛选该页面并查看同一查询时显示的次数不同。微软表示,这是因为页面视图和查询视图可能采样的时间窗口略有不同。

Leave a Reply

Your email address will not be published. Required fields are marked *

Leave a Reply

Your email address will not be published. Required fields are marked *