via https://moz.com/blog/demystifying-grounding-queries-with-real-data
用真实数据揭秘查询锚定
与实时更新的搜索不同,像 Gemini 这样的大语言模型(LLM)严重依赖于训练数据,而这些数据可能已经过时一年甚至更久。为了弥补这一差距,LLM 会自行运行搜索,这些搜索有时被称为“锚定查询”(grounding queries)。
最近,谷歌为我们提供了更多访问这些查询的权限,因此我们深入研究了基于 1,000 个子主题、涵盖多个行业的 5,000 多个示例。
什么是锚定查询?
锚定查询是大语言模型(LLM)为了深入挖掘用户的提示词、检索最新信息(超出训练截止时间),并将其答案锚定在可验证事实之上而进行的搜索。锚定查询是由机器为机器运行的搜索,旨在弥补 LLM 固有的局限性。
锚定查询长什么样?
作为一个缺陷多多的人类,我常常觉得示例比技术定义更容易理解。为此,我们从 Google Gemini 中收集了 5,333 个锚定查询,这些查询基于 1,000 个子主题(大约每个子主题 5 个)。完整数据可在本文末尾获取,但这里先介绍锚定查询的三个关键特征:
1. 锚定查询属于“长尾”查询
锚定查询的长度从 3 到 17 个单词不等,平均长度为 6.56 个单词。超过一半的锚定查询长度为 6-7 个单词。以下是整体分布(柱状图略):
让我们看三个正好落在 6-7 个单词区间的示例:
- standard types of auto insurance coverage
- must have baking tools equipment beginner
- extended stay hotel amenities vs traditional hotels
这些查询在传统搜索中可能被视为长尾查询。至于在提示词和 LLM 时代这个概念是否仍然有用,还有待商榷,但乍一看,这些示例很像我们在 2026 年深度关键词研究中会碰到的查询。
2. 锚定并不基于人类搜索
那么,锚定查询是由人类搜索数据驱动的吗?其实不是。来看我们数据集中的三个较长示例(从最长的 17 个单词开始):
- “best indie games of 2025” OR “biggest indie game hits of 2025” OR “popular indie games 2026”
- laptop gpu vs desktop gpu performance difference 2025 2026 rtx 40 50 series
- semiconductor fabrication front end back end steps lithography deposition etching doping
第一个明显使用了搜索运算符,后两个则是一堆相关术语挤在一起。我敢打赌,这些短语的月搜索量肯定是个位数(而且那个数字可能是 0)。虽然锚定查询可能受到搜索数据的启发,但锚定过程最终是由机器驱动的。
作为 SEO 从业者,我们很容易假设锚定的工作方式与我们熟知并热爱的关键词研究类似,但数据可不在乎我们的舒适感。锚定是谷歌为自己运行搜索,以挖掘那些它可能会遗漏的内容。
3. Gemini 能识别自身的训练截止时间
你可能注意到了上述示例中具体提到了 2025 和 2026 年。在我们收集的锚定查询中,整整三分之一(33%)提到了年份,有些情况下还连续列出多个年份(如“2025 2026”)。请注意,谷歌报告称 Gemini 3.5 的训练截止时间为 2026 年 3 月,但也承认某些数据可能早至 2025 年 1 月(与早期 Gemini 模型一致)。锚定的一个可能目标就是克服训练数据的局限性,收集最新的结果。
锚定查询有用吗?
是的,我认为揭开谷歌所用流程的面纱是有益的。不过,锚定查询只是查询扩展(query fan-out)过程的一部分。请看下面针对查询“游戏主机”(Gaming Consoles)的简化示例(示意图略):

查询扩展必须考虑搜索者的意图以及该意图下的具体需求。搜索“游戏主机”的人可能有意购买(商业意图)、寻找特定品牌或产品,并且很可能希望获得最新信息。锚定查询的生成就是为了覆盖这些意图和需求。
锚定查询让我们得以窥见扩展过程,但它们是机器对搜索者意图的解读。我们仍然需要加入人类的视角。
我们是如何获取这些查询的?
Gemini(Vertex)API 现在有限度地开放了锚定查询的访问权限,并在 [groundingMetadata] 对象中返回搜索短语。理论上这令人兴奋,但实践中却很混乱。我们遇到了两个主要问题:
1. Gemini 在锚定方面很“贪婪”
即使将 Gemini 3.5 Flash 的“思考”级别设为 [中等] 或更高,也很少能获得超过 1-2 个锚定查询。许多情况下甚至一个都没有。如果你经常使用 AI 模式,就会知道它几乎总是运行多个锚定查询。我们通过调整系统指令,促使谷歌生成了 4-6 个锚定查询。虽然这些查询是“真实”的(谷歌确实执行了搜索),但可以说我们稍微作弊了。AI 模式与实际查询扩展的行为可能大相径庭。
2. 谷歌对金钱也很“贪婪”
除了令牌费用之外,目前(截至 2026 年 8 月)锚定查询的费用为每 1,000 次查询 14 美元。这不是按提示词计费。在我们的测试中,每个提示词大约运行 5 个锚定查询,因此锚定数据的成本大约为每 100 个提示词 7 美元。这比令牌费用高出几个数量级,在企业级规模下,成本会迅速累积。如果你使用依赖自己 API 密钥的第三方工具,请密切关注费用。
想亲自看看这些数据吗?
我们已公开分享 5,333 个锚定查询,以及用于生成它们的 1,000 个子主题。请自行查看,尤其关注与你所在行业最相关的主题——机器的搜索方式可能会让你大吃一惊。
