via https://www.searchpilot.com/resources/blog/conversations
购买旅程更适合建模为对话,而不是提示词;每一步的随机性意味着提示词追踪会漏掉大量图景。
这可能听起来显而易见,但你不能把购买旅程建模为向 AI 智能体发出的单个提示词。就像旧式搜索时代一样,真实购买旅程涉及发现、兴趣和研究等多个步骤。与那个时代不同的是,当时每一步可能都会带来一次点击进入你的网站,而现在购买旅程的很大一部分发生在围墙花园内,我们看不到。
这一事实并不会让这些发现平台价值降低。如果说有什么影响,它反而增强了它们的力量,但这确实让营销人员难以将数据与真实业务影响串联起来。
我看到太多 AI 可见性报告本质上只是毫无意义的百分比,与业务影响脱节,与因果无关。无法判断这些数字变化是因为你做的事、平台做的事、消费者使用 AI 的增长、竞争对手做的事,还是季节性。同时,也无法判断将这个可见性数字从 43% 提高到 45% 对你的业务值多少钱。
但这并不是我对提示词可见性追踪的唯一问题。以下每一点都可以单独写一篇文章:
- 我怀疑基于合成提示词数据构建 KPI 的价值,因为这些数据只是对人们会问什么的猜测。
- 我怀疑搜索量数据的来源,小组成员是否真的理解它将被用于什么,以及因此它在多大程度上代表真实市场。
- 我怀疑那些被丢进没有历史、记忆、工具和连接器的新上下文中的提示词的价值,因为它从根本上未能模拟真实用户如何使用 AI。
正如我这些天经常说的,“现在一切都是唯一搜索。”
但情况更糟。不仅是我输入的每一段长度提示词很可能在提示词历史上都是唯一的,而且它只是我在购买旅程中可能进行的一系列提示词中的一个,并且它会受到 AI 所掌握的关于我的历史和上下文的影响。
但这重要吗?我想了解,当对话朝不同方向分支时,AI 可能给出的推荐会有多大变化,所以我做了一个实验。
实验设计:模拟一次对话
我的目标不一定是模拟真实世界对话,而是构建一个玩具模型,看看对初始条件的敏感性,以及即使在相当受控、没有搜索者历史和账户上下文的条件下,我们可能预期的分歧和概率行为。
我为每种购物目标设置了如下实验:
- 我用一句高层级的话描述目标。例如,“帮助一个中年男子为他的第一次半程马拉松挑选跑鞋”。
- Claude 然后将其扩展为一个详细人设,包含虚构背景故事、属性和人口统计信息,作为生成对话的上下文保留,但不会在研究过程中原样提供给 AI 模型。
- 一个没有其他工具或互联网访问权限的本地小型 LLM 随后获得该人设的上下文,并可以访问一个单一的公共前沿模型来做研究:在本例中,是通过 API 访问 Gemini。
- 这个本地小型 LLM 与 Gemini 来回交流,从一个简单查询开始,并根据收到的结果逐步提出进一步问题或更详细地澄清需求,直到它满意地认为已获得良好推荐。
- Claude 监督整个过程,并分析来回对话,包括小型本地模型收到的最终推荐。
conversational-flow
我对两个不同的购物旅程分别运行了步骤 3、4 和 5 各十二次。
SEO 测试对你的网站值多少?
看看 SEO 测试对你的网站可能值多少。ROI 计算器需要两个数字和一个测试节奏。计算你的 ROI →
我学到了什么
最大的收获是,最终购买推荐极度不稳定,即使每次独立运行的任务和人设都相同。
特别是,最终选择的产品往往并不是初始提示词中的最高推荐。
我看到第一轮回答中的推荐与对话结束时的推荐之间存在大量漂移。不同运行最终推荐了许多不同产品:在 12 次[跑鞋]运行中出现了四个不同的最终品牌,在 12 次[花园家具]运行中出现了九个不同品牌。一旦加入对话动态(路径依赖,加上每次 LLM 响应的概率性质),很明显我们面对的是一个比通过追踪一组稳定提示词就能建模的环境要可变得多。也许这堆学术词汇用一张图更容易可视化:
conversation-divergence
在这里查看结果可视化。
示例 1:跑鞋
Brooks 在一半运行中是第一个推荐,所以提示词追踪器会让 Brooks 轻松赢得这个查询。但六次对话中只有一次以 Brooks 结束。Saucony 在四次运行中首先被推荐,却没有在任何一次中被选中,但它是总体上最常见的最终选择(五次运行),主要来自以 Brooks 开头的对话。12 次运行中只有两次结束于开始的地方(彩色丝带)。
更多细节。
running-shoes-conversation
示例 2:花园家具
这是一个更加碎片化的品类,数据也体现了这一点:首次推荐了七个不同品牌或零售商,最终选择了九个不同品牌或零售商。Wayfair 是最常见的开场推荐(三次运行),但没有赢下任何一次。Beliani 是最常见的最终选择(三次运行),却没有出现在任何一次开场回答中。同样,12 次运行中只有两次结束于开始的地方。12 次对话中有九次还触及轮次上限,不得不被迫做出决定。一个更大、更经过考虑、约束更多的购买(露台大小、座位、组装、交货时间)需要更长时间才能解决,这也给路径留下了更多游移空间。
更多细节。
garden-furniture-conversation
那么营销人员应该怎么做?
这一切并不意味着 AI 助手对发现不重要。恰恰相反:在两个实验中,助手都在决定哪些品牌进入候选名单,并明显影响了哪一个胜出。它真正意味着,基于对固定提示词第一个回答构建的可见性分数,衡量的是错误的东西。在跑鞋示例中,它会告诉你 Brooks 正在获胜,而 Saucony 才是实际最常被选择的品牌。而且这还是在一个没有记忆、没有历史、没有其他上下文的购物者情况下。真实人们的对话很可能比这分歧更多,而不是更少。
第一,停止把提示词可见性百分比当作 KPI。充其量,它们只是一个粗略信号,表明哪些品牌进入了对话,而不是你是否赢得了对话。
第二,关注整个旅程,而不仅仅是开场回答。这就是为什么在衡量零售 AI 发现表现时,我们仍然非常关注访问和购买。
衡量网站变化的真实业务影响,正是我们构建 SearchPilot 的目的。如果你想讨论这对你的网站意味着什么,请联系我们。
