via https://ahrefs.com/blog/information-gain/
信息增益(Information Gain)是指你的页面在已有排名内容之外,额外贡献的新信息。
谷歌是否真的在算法中使用一个叫“信息增益”的评分,目前仍未得到官方证实。
但无论它是否直接影响排名,其实都无关紧要。
你应该关注信息增益,因为它是你的差异化因素。
你为创建有用、令人难忘的内容所付出的额外努力,可以转化为:积累自己的受众、构建护城河、在AI答案中获得提及,以及成为一个搜索引擎真正能识别出的品牌名称。
下面我们将深入探讨信息增益的实际含义、我们对谷歌是否使用它的已知(和未知)情况,以及最重要的一点——如何通过信息增益来改进你的内容。
SEO中的信息增益是什么?
信息增益衡量的是一个页面在搜索者已经看到的内容之外,增加了多少新信息。
这个词并非源自SEO领域——它借用于机器学习。
但当SEO从业者提到“信息增益”时,他们几乎总是指谷歌的那份专利:《链接信息增益的上下文估算》(Contextual estimation of link information gain),该专利于2018年提交,2022年获批。
该专利针对一个具体问题:搜索结果中每个页面说的内容基本雷同。
以关键词“如何提高你的信用评分”为例。
能够真正改变信用评分的因素其实就那么多。
FICO,信用评分的早期先驱之一,列出了五个核心因素:
- 还款历史
- 欠款金额
- 信用历史长度
- 新开信用账户
- 信用类型组合
换句话说,这是一个有限话题。当多个网站说同样的事情时,那……就是正确答案。
这正是信息增益变得如此重要的原因。列出那个清单上的标准,只是最低要求。
围绕这个话题写作的网站需要提供更多内容。
不幸的是,它们并没有。
在排名靠前的七个自然搜索结果中(不含广告),所有页面分享的都是完全相同的信息……
一张表格展示了7条信用评分提升建议,以及7家不同的金融出版商是否直接陈述、顺便提及或完全没提到这些建议。
而且,关键是,这些网站提供的内容仅此而已……
一张表格展示了7个顶级网站在5类信息增益上的得分。总结注释指出了未被使用的数据。
七家不同的机构,包括信用合作社、银行行业协会和大型征信局,都集中在相同的几个话题上,只是标题中的数字不同(5个技巧、7个技巧、10件事)。
这是一个错失的机会。这里其实有真正的差异化和创意空间。
一家银行可以引用自己的客户数据,说明实际提升了分数的案例;或者一位作者可以分享自己信用报告改善前后的个人经历。
这个话题迫切需要原创性,但没有人真正提供。
谷歌针对这种情况提出的解决方案就是一个评分:
“给定文档的信息增益分数,表明该文档在已呈现给用户的其他文档所含信息之外,所包含的额外信息量。”
——Victor Carbune,谷歌资深软件工程师,信息增益专利发明人
该信息增益专利揭示了谷歌意图用新颖信息丰富搜索结果页。
用我们内容营销总监Ryan Law的话说:
“信息增益是谷歌奖励那些‘与众不同’而不仅仅是‘更好’的内容。”
——Ryan Law,Ahrefs内容营销总监
信息增益如何运作——根据谷歌专利
以下是你需要了解的关于谷歌专利所描述机制的核心内容,以及每个部分对你的内容意味着什么。
1. 信息增益分数是按用户、按会话计算的
信息增益是上下文相关的。它将一个文档与特定用户已经被展示过的文档进行比较。
这意味着,同一个页面被两个不同用户访问,可能会产生完全不同的信息增益分数。
一个刚刚读完了五篇几乎一样的“如何提高信用评分”文章的人,会认为第六篇是多余的。
而第一次搜索该查询、没有任何上下文的人,会觉得同一个页面非常有用。
图示:同一页面针对两个不同用户,基于他们已读内容,信息增益评分不同。
2. 信息增益比较的是含义,而非措辞
信息增益专利中有一个模型,将每个文档读作“语义表示”——它将页面的含义转化为数字,这样即使两个页面没有任何共同词汇,也能相互衡量。
“猫不舒服”(The cat is unwell)和“这只猫科动物病了”(the feline is sick)几乎没有共同词汇,但模型会识别它们为相同信息。
一个理解含义的系统会将改写的内容视为同一观点。
所以,如果你只是改写了一篇竞争对手的文章,你并没有增加任何值得奖励的新内容。
你的改写会落在与原文相同的“语义位置”。
图示:两个不同句子映射到语义空间中的同一点。
要创造真正的信息增益,你不能只是改写搜索结果页上的内容——你需要添加新的观点。
这与Clearscope前创始人Bernard Huang对信息增益的解读一致。
在Ahrefs Evolve演讲中,他将其定义为:
“谷歌知识图谱中,关于该话题边缘地带的概念和实体。”
——Bernard Huang,Clearscope前创始人
任何话题的核心部分通常都已饱和,因为所有人都已经写过。
根据Huang的观点,增益存在于边缘:搜索结果页尚未收录的示例、数据和视角。
图示:话题由相互连接的节点表示,密集蓝色为“饱和核心”,稀疏灰色为“增益所在的边缘”。
3. 信息增益是动态的
信息增益分数在用户会话过程中实时计算。
随着用户消费更多页面,剩余未浏览的页面会根据已覆盖的内容被重新评分和重新排序。
谷歌专利称此为重排(re-ranking),它不同于每个搜索者在搜索结果页上看到的初始一次性排名。
换句话说,谷歌正在根据你已经读过的内容,重新调整你通常会看到的结果顺序,而不是决定初始顺序(排名)。
图示:会话中页面分数和顺序发生变化。初始时页面A、B、C分数较高。
信息增益:原因还是结果?
对专利的一种解读是,每个页面被单独评分,然后这些结果根据分数进行重排。但Bernard Huang有不同看法。他认为信息增益会反馈到谷歌对该话题的更广泛理解中。在Bernard看来,谷歌的流程是:
- 基于权威性和实体覆盖进行排名:权威性指品牌外链、提及和话题一致性等因素;实体覆盖指你提及正确的人、地点和事物的频率。
- 观察真实用户是否满意:基于经典的谷歌代理指标,如点击率、停留时间和跳转回搜索率。
- 在页面证明自身价值后,提取其内容:一旦你赢得信任,谷歌开始提取你的主张。
- 将其反馈到对话题的整体理解中:这反馈到知识图谱,或搜索引擎背后的任何系统中。
在这种情景下,信息增益是输出,而非输入。谷歌并非因你添加了新内容而奖励你,而是吸收你所添加的内容以便在其他地方使用——例如,作为未来AI概览的原材料、实体覆盖中的另一个数据点,或作为下次对该话题页面评分时“共识”的新基线。
4. 信息增益去重的是事实,而非仅仅是页面
早在AI概览出现之前,谷歌就已经为一种方法申请了专利:当它只有一个答案可给时,如何避免重复自己。
想象一个语音助手回答“什么导致时差?”
十个来源可能都说出同样的三件事:昼夜节律被打乱、光照会重置它、症状几天后消失。
连续把这十个回答都读出来,你会把同样的三个事实多听九遍。
该评分的设计初衷就是修剪重复,因此助手会从表述最佳的那个来源中,把每个事实各提取一次。
信息增益专利明确扩展到“聊天机器人”、“对话代理”和“个人语音助手”,这确认了它不止应用于十个蓝色链接。
以下是谷歌提出的工作方式:
重复事实如何影响信息增益评分
假设一个文档(来源1)包含事实A和B,助手向用户朗读了这些内容。系统随后找到另一个文档(来源2),包含事实B以及一些新内容(事实C)。
图示:“信息增益”流程:“候选来源”(来源1:事实A和B;来源2:事实B和C)
在确定事实B“已经传达给用户”后,助手生成的输出将“传达第三信息元素并排除第二信息元素”。来源2仅用于事实C。它的重叠部分(事实B)在用户听到任何内容之前就被删除了。
这对你的内容可能意味着什么:
- 缺乏原创性可能让你被排除在助手答案之外
在排名列表中,即使你是第四个说同样内容的网站,你仍然在搜索结果页上,仍然有机会获得点击。但在一个合成答案中,没有第四名。
要么你提供尚未被提及的信息,要么你的内容被剔除。 - 你的内容需要既有话题权威性,又有信息增益
覆盖排名页面都已经说过的东西,只是进入搜索结果页的入场券。但一旦你处理了预期的话题,你就可以通过一个其他人都没覆盖到的具体洞察,在答案中赢得一席之地。
信息增益是谷歌算法的正式组成部分吗?
谷歌官方并未确认其明确在其算法或AI搜索功能中使用“信息增益评分”。
谷歌提交并获批了一项描述信息增益评分的专利。
但我们不知道该专利中的机制是否真正落地。
谷歌提交了数百项专利,其中许多从未投入生产,它也从未确认信息增益评分是一个在线的排名或重排系统。
为什么SEO从业者怀疑谷歌会奖励信息增益
一些SEO从业者仍然认为信息增益已融入谷歌系统,原因如下:
- 谷歌的最佳实践指南鼓励信息增益
- 谷歌算法更新往往奖励原创内容
- 谷歌已经能够在会话中改变用户看到的内容
1. 谷歌的最佳实践指南鼓励信息增益
谷歌自己的实用内容指南明确要求创作者评估内容是否具有原创性,以及与其他搜索结果页面相比是否提供了实质价值。
截图:谷歌搜索中心“创建有用、可靠、以人为本的内容”页面,内容质量问题被高亮显示。
谷歌还在其垃圾政策中强化了“增加价值”的要求,确认这不仅仅是一个排名上的锦上添花。
截图:谷歌关于AI内容的指南:使用生成式AI而不增加价值可能违反垃圾政策。
而在其搜索质量评估指南——这份谷歌提供给人工评估员审查内容的实际文件,可谓关于谷歌希望搜索结果呈现什么样子的最权威来源——中,反复指出主要内容(MC)需要与网络上已有的类似页面相比增加价值。
文档“垃圾网页”部分,高亮显示:“主要内容创作几乎不费力气……”
此外,在2024年3月,谷歌表示已将“搜索结果中低质量、非原创内容减少了45%”。
原创性无疑是谷歌表示会衡量并采取行动的事项。
如此强调原创内容,一些SEO从业者合理推断,谷歌必然在其算法中有办法衡量内容的增量价值。
2. 谷歌算法更新往往奖励原创内容
像Lily Ray、Marie Haynes和Cyrus Shepard这样的SEO从业者,专门研究算法变化的影响。
他们各自都注意到,从谷歌更新中受益的网站,往往在原创内容方面表现突出。
例如,在Cyrus Shepard对2025年12月核心更新后400多个网站的分析中,他发现“专有资产”(如原始数据和工具)是预测哪些网站获得流量的第三强因素。
这表明原创性是谷歌排名系统正在积极奖励的东西。
条形图:显示与流量变化相关的网站特征。“赢家”(蓝色)在所有特征上的百分比普遍高于“输家”(灰色)。
3. 谷歌已经能够在会话中改变用户看到的内容
谷歌搜索副总裁Pandu Nayak在2023年司法部反垄断审判中宣誓作证,确认NavBoost——一个基于滚动点击数据重排页面的系统——是其最重要的排名信号之一。
其他几项谷歌专利也描述了在同一会话中,根据用户已点击的内容进行重排。
因此,谷歌已经具备了在会话中改变用户所见内容的技术能力,这与信息增益专利所描述的工作方式完全一致。
为什么信息增益现在比以往更重要
谷歌的信息增益专利于2018年提交,2022年获批。
不久之后,ChatGPT推出,同质化内容随之爆发式增长。
“信息增益”这个边缘趋势也与之同步增长,因为人们开始寻找在AI生成内容中脱颖而出的方法。
折线图:比较美国“信息增益 SEO”(橙色)和“如何使用AI进行内容创作”(蓝色)的搜索量,2023年1月至2026年6月。
现在任何人都可以在几分钟内生成一份“全面指南”,“全面性”已不再是差异化因素。
LLM(大型语言模型)预测最可能的下一个词元。
这导向了最可能的内容。
而正是那种“共识内容”被吸收到AI答案中,却得不到任何引用。
信息增益,顾名思义,正是尚未形成共识的那部分。
它不太容易受到点击量流失的影响,而且它也能让你的品牌令人难忘——受众记住的品牌,是他们会再次回来的品牌;先是为内容,然后是为产品或服务。
所以信息增益不仅仅是关于排名或在AI答案中被提及。
它是差异化、品牌建设,以及——说得稍微夸张一点——生存之道。
如何在SEO内容中添加信息增益
要为SEO优化信息增益,你需要研究排名靠前的页面没说什么,然后用原始数据、亲身经验或它们缺失的独特视角来填补这些空白。
这将帮助你更好地吸引读者,提升他们对品牌的整体体验。
但要记住,优质内容的基石是理解并满足核心搜索意图。
信息增益只有在这个基础之上才能发挥作用。
研究搜索意图,发现未被充分服务的主题角度
搜索意图是关于找出搜索者真正在寻找什么信息。
首先调出目标关键词的搜索结果页,把自己当作搜索者(而非作者) 来阅读每个结果。
大多数页面会回答问题的明显版本,但你需要寻找它们都跳过的那个问题。
为了节省时间,你也可以使用Ahrefs SERP Overview中的Identify Intents报告,快速了解整体搜索意图。
截图:Ahrefs中“html5”的SERP概览,左侧是搜索结果,右侧是搜索意图细分(定义77%、教程15%、新功能7%)。
我们的AI将排名页面按搜索者实际需求进行聚类,并显示每种意图大致占据多少流量份额。
大多数搜索结果页同时服务于几种意图,但比例不均。
如果一种意图已经占据了80%的排名内容,那它代表的就是共识。
这并不意味着你不该覆盖它——你绝对应该。
但信息增益的机会,就在于那些未被充分服务的意图群体,甚至可能是一个在搜索结果页上还不存在的群体。
对排名靠前的竞争对手进行全面内容差距分析
你无法添加搜索结果页缺失的信息,除非你知道搜索结果页已经说了什么。
内容差距分析为你提供了一张排名靠前页面所有覆盖内容的图谱,让你能准确看到哪些领域尚未被占领。
Ahrefs AI Content Helper会实时根据当前为你的关键词排名的页面,对你草稿的话题覆盖率进行评分。
输入关键词,它会提取排名靠前页面所覆盖的话题,然后对你的草稿进行评分——总体评分和逐项话题评分——让你发现差距并丰富薄弱内容。
截图:Ahrefs AI Content Helper显示“SEO Basics”文章草稿,内容评分79,显示词数、话题和相关术语。
“Competitor”内容面板显示每个竞争页面的完整内容正文,以及其域名评分、词数和引用域名,让你能精确读到竞争对手对特定话题写了什么,并决定你要添加什么。
截图:Ahrefs AI Content Helper显示“SEO Basics”文章,含“Key Takeaways”和内容评分79。
为优化信息增益,从得分最低的话题开始,逐一打开竞争对手的内容,然后问自己:“在这里我能说什么,是这些页面都没提到的?”
如果你卡住了,AI聊天功能可以帮忙。把薄弱部分粘贴进去,询问排名页面缺失了哪些角度。
记住:添加与竞争对手所说的内容相匹配的内容,会提高你的内容评分——意味着你正在弥合覆盖范围的差距。
但添加竞争对手没有的内容,则创造了信息增益。
所以,首先要尽量提高你的评分,以建立那种能让你获得排名所需的权威性和实体覆盖;然后再添加真正新颖的信息,以驱动真实的用户满意度和参与度。
用未解答的问题填补空白
那些反复被搜索、反复出现在“People Also Ask”框中、反复在论坛中出现——但在首页上无人回答的问题,是未被满足意图的强烈信号,也是增加信息增益的真正机会。
以下是几种找到它们的方法。
使用Ahrefs “Questions”报告发现趋势性问题
Ahrefs Keywords Explorer会显示与你输入的核心关键词相关的疑问型关键词(what, how, why, does, can, should)。
只需输入目标关键词,打开Matching terms,然后切换到Questions。
截图:Ahrefs Keywords Explorer显示“seo”的“Matching terms”,Questions筛选器已激活。
然后按3/6/12个月增长排序,找出那些可能尚未有确定性答案的问题……
截图:Ahrefs关键词研究显示“seo”的“Matching terms”,按“Questions”和“Terms match”筛选,显示关键词及其6个月增长百分比。
你甚至可以通过以下筛选器,查看首页竞争对手未能回答的问题:
“Target > Show keywords target doesn’t rank for in top 10”
例如,Digital Marketing Institute在核心词“SEO”上排名第二,但尚未充分覆盖“每周SEO指标”或“AI SEO”等趋势话题,因此未能占据首页位置。
截图:Ahrefs显示“seo”的匹配关键词,包含搜索量、增长和关键词难度等指标。
显然,这一切都是在平衡。
你需要添加足够多的新颖信息,以在当前的搜索结果页中脱颖而出,但又不能偏离太远以致失去核心搜索意图。
我的建议是:观察你的排名变化,并把信息增益优化作为一个持续测试。
发现并拦截Reddit上正在回答的问题
当Reddit在首页排名显著时,这通常是一个信号,表明搜索结果页中的其他网站并未完全满足搜索意图。
Reddit是搜索者用他们自己的话,说出当前搜索结果页内容没告诉他们什么的地方。
这里有一个简单的方法来发现和拦截Reddit当前正在处理的相关问题:
- 进入Keywords Explorer,添加一个词根关键词,或……
- 添加与你想要撰写的话题相关的分类筛选器
- 点击“Question”筛选器以过滤出疑问型关键词
- 将reddit.com放入Target筛选器,并选择“Show keywords target ranks for in top 10”
- 最后按3/6/12个月增长排序,找出Reddit当前正在回答的未被开发的问题
截图:Ahrefs Keyword Explorer显示与SEO/营销相关的what/who/where/why关键词筛选列表。
包含独特数据
在所有你能添加到页面上的东西中,原始数据是最具防御性的信息增益形式之一。
事实上,有早期证据表明,它是原创性最强的单一相关因素。
On-page.ai对150个排名前三的页面进行研究发现,独特数据点的数量与信息增益的相关性甚至比排名位置本身更强。
虽然原创性在排名前三的位置上差异不大,信息增益分数*平均在50-55之间,无论排名如何……
| 位置 | 平均分 | 中位数 | 大多为共享内容 |
|---|---|---|---|
| 1-3名 | 51.4 | 52 | 24% |
| 第4名 | 46.5 | 47 | 40% |
| 第7名 | 49.3 | 50.5 | 37% |
| 第10名 | 44.5 | 48 | 38% |
……但拥有15个或更多独特数据点的页面,平均得分为62,而只有0-1个独特数据点的页面仅为40,这使得原始数据成为该研究中最强的单一预测因素。
水平条形图:显示平均信息增益分数与独特数据点数量的关系,从40.2(0-1个点)到62.2(15个以上)。
附注:On-page.ai将其信息增益分数定义为“一个0-100的衡量标准,衡量一个页面在其关键词的实时排名群组之外增加了多少内容,通过含义而非精确措辞进行比较。”
正如On-page.ai的Eric Lancheres所承认的,这些结果并不证明可以随意堆砌数据。
用无意义的数字来填充页面,只是增加了数字,而不是实际信息。
试图以这种方式玩弄评分是行不通的,因为它是基于含义来衡量的。
如果你想产出自己独特的统计数据,你不必进行百万数据点的调查。
一个面向200位SEO从业者的LinkedIn投票、对你自己客户的调查,甚至是对你Ahrefs数据的分析,都可以产生其他任何地方都不存在的数据。
以我们的客户Visibility Labs为例。他们利用在Ahrefs Keywords Explorer中已有的AI概览数据,创建了一项非常有趣的研究,分析了2090万个购物类搜索结果页。
LinkedIn帖子:Jeff Oxford讨论购物查询中的AI概览,附两张显示Walmart和Target增长趋势的折线图。
保持内容新鲜
信息增益有一个时间维度:什么算“新”总是相对于已经说过的内容而言;一个事实流传得越久,就越彻底地被吸收为共识。
新鲜信息,几乎按定义来说,就是搜索结果页其他部分还没有的信息。
我们亲身经历过刷新内容带来的影响。
我们的《什么是SERP》博客文章发布于2020年,到2025年中几乎失去了所有流量,但在2026年12月重写并重新发布后,流量恢复了50倍。
效果图:显示自然流量从33(2025年12月)增长到1,695(2026年8月),标注为“50倍流量增长”。
谷歌运行一个名为“查询值得新鲜度”的排名系统,优先展示最近发布或更新的内容——尤其是对时间敏感的查询。
更新也会影响用户信号:过时的标题获得的点击更少,而点击行为会影响谷歌如何重排内容。
在Ahrefs中找到性价比最高的更新候选内容:
- 进入Ahrefs Site Explorer的Top Pages报告。
- 输入你的网站——可以是整个域名或特定子文件夹。下面我以Ahrefs博客为例。
- 设置流量筛选器,选择“declining”(下降)。选择一个通常反映你最好、最有可见度页面的月度流量数值。
- 设置一个低KD筛选器(例如不超过40)。内容不总是你的文章停止排名的原因。当其他页面建立了更好的“链接权威性”时,排名也会下降。设置低关键词难度分数会向你展示竞争不那么激烈的SERP中的更新机会。
- 选择你想要监控下降趋势的日期范围。对我来说,是一年。
- 按负流量变化排序。这样你基本上就聚焦在你网站上最近掉出排名的顶级页面上。
- 查看Content Changes。这会显示哪些页面在你的日期范围内已经更新过,这样你就能只关注过时内容。
截图:Ahrefs Site Explorer Top Pages报告,针对ahrefs.com/blog,带编号橙色圆圈突出显示工作流程。
然后,剩下的就是:覆盖用户期望读到的信息,找出搜索结果页还没说什么,并成为说出它的那个页面。
最后思考
一些SEO从业者相信,谷歌能够识别并奖励为搜索结果带来新信息的内容。
但事实真的如此吗?简短的回答是:其实并不重要。
谷歌的核心业务是用户体验。信息增益就是用户体验。
如果谷歌还没有直接奖励它,它也会奖励信息增益所产出的东西:人们真正想读的内容。
所以,在你发布之前,问问自己:你的页面包含哪些该话题其他页面都没有的内容?
如果你无法清晰地回答这个问题,那就没必要发布。
