← 返回 PaperDaily 前沿研究

最新行业共识:95%的短期实验不用等长期,方向竟然不会反?

产品改动上线一周,数据一片大好,结果三个月后用户却跑光了——这是所有在线平台最怕的“短期好看、长期翻车”。这篇由Pinterest、Netflix、Meta等15家平台26位专家联名总结的行业共识,把短期实验推断长期效果的坑和招一次讲透,值得每个做增长、做策略的人收藏。

最新行业共识:95%的短期实验不用等长期,方向竟然不会反?
原论文信息如下:
论文标题: Evaluating for the Long Term: Learnings from Industry
发表日期: 2026年8月
发表单位: 多家企业与高校联合(Pinterest、Netflix、Meta、Uber、Airbnb、Google、MIT、UC Berkeley等)

行业如何用短期实验预测长期效果?

想象一个非常典型的互联网增长场景:算法团队改了一版推荐排序,A/B测试跑了一周,点击率涨了8%,点赞评论也全线飘红。团队欢天喜地准备全量上线,结果三个月后一看,DAU反而掉了。这种“短期数据漂亮、长期指标受伤”的案例,几乎每一家大型平台都遇到过。
原因说起来也不复杂:在线平台真正在乎的是月度活跃用户、季度留存、年度收入这类长期业务指标,可绝大多数实验只能跑几天到几个星期。以“一周点击”去推断“半年DAU”,中间隔着用户习惯、新鲜感消退、内容生态变化等一大堆变量,稍不留神就把方向搞反了。
这篇论文要解决的,正是这样一个非常实际的问题:如何用短期实验的结果,去对长期业务效果做更靠谱的推断?论文由Pinterest、Netflix、Meta、Uber、Airbnb、Google、Booking.com、Lyft等15家互联网平台,以及MIT、UC Berkeley等4所高校的26位专家联合完成。严格来说,这不是一篇提出新算法的论文,而是一份极其难得的行业共识白皮书:把一线大厂在“短期实验推断长期效果”这件事上踩过的坑、验证过的方法、达成的共识,一条一条整理成了可复用的命题。
在展开具体内容之前,先看一组行业数据:月活超过1000万的平台,每年要跑1万到10万个实验。Booking.com每年超过2.5万个测试,Microsoft每年约10万个A/B测试,Meta一年要跑“几十万个实验”。但典型实验的时长只有3天到3个月,社交平台可能一周就能看出用户行为变化,旅行预订平台却往往要等更久。
表:行业典型实验实践数据
行业典型实验实践数据
这些数字背后有一个共同的结构性矛盾:实验系统追求的是快速反馈、快速迭代,而业务目标天然是慢变量。实验跑得太短,可能看不到用户习惯的长期改变;实验跑得太长,又会让产品迭代速度被拖垮。如何在“快”与“准”之间取得平衡,正是这篇论文试图回答的核心问题。
论文的讨论框架非常清晰,围绕三个层次展开:第一,短期效应与长期效应在方向和幅度上到底有多大差异?第二,如果差异存在,能否用替代指标来弥补?第三,替代指标本身应该如何构建和验证?这三个问题层层递进,构成了一个完整的决策链条。接下来我们逐一展开。

26位专家8小时研讨:行业共识如何形成?

这份共识是怎么来的?论文作者先根据公开论文和内部经验起草了一份初步命题清单,然后组织26位专家进行了一整天的闭门研讨会,用8小时逐条讨论、反驳、修订这些命题。会后,作者团队又与参与者反复确认,确保每一条都能代表当前行业的最新认知。每一条命题都尽量附上公开证据,或者至少标注“参与者普遍认同”。
表:典型实验时长与证据
表:典型实验时长与证据
参加研讨的包括Pinterest、Netflix、Meta、Uber、Airbnb、Google、Microsoft、Booking.com、Lyft等平台的数据科学团队,以及MIT、UC Berkeley、哈佛商学院、芝加哥大学Booth商学院等机构的学者。这个阵容可以说同时覆盖了“做实验的人”和“研究实验方法的人”两个群体,保证了结论既有理论严谨性,又不会脱离一线工程实际。
这里有一个值得注意的背景:大厂之间的实验经验通常是高度保密的,能凑到一起把各自的“踩坑记录”摊开来讲,本身就很罕见。所以这篇论文的价值不在于某个公式有多精巧,而在于它把散落在各家公司内部的隐性知识,变成了可被讨论、可被引用、可被后来者复用的显性知识。
研讨过程本身也很有意思。作者团队在会前准备了大约40条候选命题,但经过一整天的讨论,最终只保留了不到30条。有些命题被合并,有些被拆分,还有一些因为争议太大而直接被删除。比如关于“短期效应方向是否可以作为长期效应的代理”这一条,Google和Netflix的经验支持,但Pandora和Facebook的案例又提出了反例,最终经过反复权衡才形成了现在“方向通常一致但幅度可能漂移”的折中表述。这种严谨的共识形成过程,保证了每一条结论都经得起推敲。

短期效应与长期效应:符号反转真的罕见吗?

先解释一个概念:所谓“符号反转”,指的是同一个改动在短期实验中显示出正效应,放到更长的时间维度上却变成负效应。比如某个功能上线后一周内用户活跃度上升,但三个月后用户流失反而加剧。如果这种情况很常见,那用短期实验做决策几乎等于赌博。
论文给出的核心结论让很多人意外:符号反转并没有大家想象的那么常见。Google发现短期效应通常在方向上可以作为长期效应的合理代理;Netflix对200个A/B测试做了元分析,按照两周实验做出的上线/不上线决策,与按两个月实验做出的决策有95%的一致性;Microsoft甚至表示,没有找到一个统计显著的效应从正变成负的案例。
但“罕见”不等于“没有”。论文特别点名了三种更容易出现符号反转的场景:内容质量或相关性信号的变化、游戏平台上的“过度商业化”设计、以及存在“领先日偏差”的定价实验。
公开案例也很有意思。Facebook把通知过滤到只保留相关内容后,用户时间消耗刚开始下降了,但一年后反而比对照组高。YouTube降低“低质内容”的排名,三周内观看时长下降了0.5%,但三个月后观看时长不仅恢复,还反超了对照组。Bing故意降低搜索结果相关性,发现用户短期内会花更多精力去改查询词完成任务,但逐渐失去信心后回访频率就下降了。
表:长期实验案例与效应轨迹
表:长期实验案例与效应轨迹
更隐蔽的问题是“幅度漂移”:即使方向不变,效应大小也可能在几个月内大幅变化。比如社交平台的内容排序改动对DAU的影响存在“半衰期”,大约一个月才能达到长期效应的一半;Pandora的广告负载实验显示,一年后的效应可能是两个月时的两倍以上。所以方向没反不等于可以高枕无忧,短期实验的效应幅度可能严重低估长期影响。
为什么会出现这种幅度漂移?论文给出了一个非常直观的解释框架:用户行为的变化往往不是即时完成的,而是需要经历“认知—尝试—习惯—固化”的过程。短期实验只能捕捉到前两个阶段的变化,而后两个阶段的变化需要更长时间才能显现。比如一个推荐算法的改动,用户第一周可能只是多点了几个推荐内容,但一个月后可能已经形成了新的浏览习惯,这种习惯层面的改变才是长期DAU的真正驱动因素。因此,短期实验看到的效应往往只是“冰山一角”。

替代指标:简单自动替代为何难以被超越?

既然直接测量长期效果不现实,行业通用的思路是找“替代指标”,英文叫proxy metric,也就是用短期可测的指标(比如7日点击、点赞、评论、回访)去推测长期结果(比如6个月DAU)。更进一步,如果把这些短期指标组合成一个对长期结果的预测,就是替代指标模型,英文叫surrogate index。
这里有一个最容易让人误入歧途的地方:既然短期指标不够用,那是不是构建一个越复杂、越精细的替代指标模型就越好?论文的答案是:未必。行业共识是,一个简单到几乎“没有技术含量”的自动替代(autosurrogate)——也就是直接把短期版本的目标指标当作长期效果的估计,最多乘一个换算系数——反而常常是最难被击败的基线。
为什么复杂模型会打不过简单模型?论文给出了三个非常现实的解释:
第一,决策一致性比预测无偏性更重要。业务方真正需要的不是对长期指标的无偏估计,而是一个能帮自己做出正确上线/不上线决策的信号。一个即使有偏但方向稳定的简单指标,在决策层面可能比一个理论上无偏但行为不可解释的复杂模型更有用。
第二,可解释性是一种硬需求。多位参与者提到,业务负责人必须能向团队解释“这次替代指标为什么涨了”,以及“每个代理指标各自贡献了多少”。一个包含几十个变量的黑箱模型即使拟合精度再高,讲不清楚原理就难以被采纳,最后只能躺在实验室里吃灰。
第三,基于观测数据学习的复杂替代模型,假设条件极其苛刻。要保证模型有效,需要满足无未观测混杂、代理指标完全中介处理效应、样本可迁移等一系列因果推断假设。这些假设在真实平台数据上几乎不可能同时成立。Pandora在长达21个月的广告负载实验中对比了多种观测学习方法,结果是这些方法经常给出有偏的估计,有时甚至连符号都是错的。
表:复杂替代指标与有效性讨论
表:复杂替代指标与有效性讨论
当然,自动替代也不是万能的。论文指出两类典型失效场景:一是目标长期结果本身没有清晰的短期版本,比如“月活用户占比”这类至少需要一个月才能定义的指标;二是目标事件是低频一次性行为,比如旅行预订,用户可能一年才订一两次,单纯看短期行为很难推断长期意图。这些场景必须引入更复杂的替代指标。
论文还特别提醒了一个容易被忽视的细节:自动替代虽然简单,但“简单”不等于“随便选一个短期指标就行”。自动替代的有效性高度依赖于所选短期指标与长期目标之间的“对齐程度”。比如用7日活跃度去替代半年DAU,前提是7日活跃度确实能捕捉到用户回访行为的大部分信息。如果选错了短期指标,自动替代同样会失效。因此,即使是使用最简单的自动替代,也需要先做一轮“指标对齐度”的定性评估。

观测vs实验:哪种替代指标学习方式更可靠?

构建替代指标的另一种关键分歧,在于“用什么数据来学”。观测学习指的是用历史观测数据建模,把长期结果对短期代理指标做回归;实验学习则是利用已有的长期实验结果,在多个实验之间回归长期治疗效果对短期代理治疗效果。
观测学习听起来数据容易获取,但最大的问题在于混杂偏差。一个用户短期活跃度高,很可能本身就是那种长期留存也高的用户,这与实验处理无关。如果不消除这种天然相关性,学出来的“短期→长期”映射就会混入用户特质的影响。更麻烦的是,这种偏差往往不像统计噪声那样随样本量增大而消失,而是稳定的系统性偏差。
观测学习还有一个容易被忽视的副作用:置信区间“虚假过窄”。用代理指标去预测长期结果时,由于预测模型的残差方差较小,治疗效应的标准误看起来会很小。但这个窄区间只反映了“已知的未知”,并没有包含“未知的未知”——也就是那些完全没有被代理指标捕捉到的混杂因素。结果是统计上看似极其显著,真实偏差却可能很大。这种“看着精确、实际失准”的双刃剑效应,一旦被后续长期实验推翻,会严重侵蚀团队对实验体系的信任。
表:观测学习与实验学习的对比
表:观测学习与实验学习的对比
相比之下,实验学习直接使用随机实验产生的变化来估计短期代理与长期结果之间的关系,因果逻辑更干净。但实验学习也有硬门槛:需要足够多的、有代表性的、同类别的长期实验。论文给出了一个很实际的约束:如果替代指标包含K个组件,通常至少需要K个以上的长期实验才能估计,而且这些实验最好属于同一类——用通知类实验学到的替代指标去做排序类实验,结果可能非常离谱。
更隐蔽的问题是“弱工具变量偏差”:如果短期代理上的治疗效果很弱,实验之间的噪声就会主导回归结果,带来渐进偏差。论文提出了几种补救思路,包括增大实验样本量、只使用高信噪比的代理指标、只挑效果最强的实验做回归、显式估计并修正测量误差,以及一种叫“实验切分”的技巧——把每个实验随机分成两半,一半做特征、一半做标签,从而消除相关测量误差的影响。
最终共识很明确:只要条件允许,实验学习优先于观测学习。但现实是,大多数平台手里并没有足够多的“同类长期实验”来支撑实验学习,这就造成了理想与实操之间的巨大张力。
论文对这种张力给出了一个非常务实的建议:与其纠结于“用哪种学习方式”,不如先盘点一下自己手里有多少长期实验。如果长期实验数量极少,那么无论观测学习还是实验学习都很难可靠,这时候最理性的做法是老老实实跑几个长期实验,先把“锚点”建立起来。如果长期实验数量足够,那么实验学习显然是更好的选择。如果介于两者之间,可以考虑用实验学习为主、观测学习为辅的混合策略。

长期实验:不可替代的黄金标准与开放挑战

绕了一圈,论文给出了一个看似“倒退回原点”的结论:没有任何替代指标能够完全替代一个设计良好的长期实验。无论是学习替代指标还是验证替代指标,长期实验都是不可绕过的锚点。哪怕只有少数几个长期实验,也能为验证现有替代指标提供巨大价值。
Google Search曾经做过持续数年的广告相关长期实验,Facebook有一个超过一年的通知实验,Pinterest的徽章实验也跑了超过一年,Airbnb的定价算法实验通常持续四个月。这些长期实验的投入很大,工程维护成本高,还要承担让一部分用户体验“次优方案”的机会成本。但参与研讨的专家一致认为,这种投入是值得的,因为只有长期实验才能回答“替代指标到底准不准”这个元问题。
表:长期实验的挑战与开放问题
表:长期实验的挑战与开放问题
长期实验并不是没有问题。论文特别指出了三个容易被忽略的挑战:
第一个是实验堆叠。很多所谓的“长期实验”,实际上是多个治疗叠加在一起持续演进的结果。新功能不断加入,旧配置不断调整,到最后很难说清长期效应到底来自哪个具体改动。这会严重干扰替代指标的归因。
第二个是选择偏差。团队通常会让影响最大的改动去跑长期实验,普通的小改动跑几天就停了。这导致长期实验库并不能代表所有实验,用它学出来的替代指标可能只对特定量级或特定类型的改动有效。
第三个是机制漂移。用户的习惯在变,产品形态在变,外部环境也在变。一个三年前学到的替代指标,在今天可能已经不适用了。论文特别提到了“指标博弈”现象:团队可能会找到某个与长期留存高度相关的短期指标,然后用各种手段去刷高它,结果破坏了历史数据中建立起来的因果关系。
所以论文的落点非常清醒:没有灵丹妙药,只有持续投入高质量长期实验这一条笨路。替代指标可以帮你缩小不确定性,但永远无法完全消除它。
论文还提出了一个非常有意思的开放问题:如何设计“可叠加”的长期实验?也就是说,让长期实验本身能够容纳后续的改动,同时还能保持因果推断的有效性。目前还没有一个完美的答案,但论文给出了一些探索方向,比如模块化实验设计、动态治疗分配等。这些方向虽然还不成熟,但为后续研究提供了明确的切入点。

龙迷三问

下面是龙哥对于大家可能的一些问题的解答:
这篇论文到底在解决什么问题?本文基于15家在线平台与4所高校共26位专家的行业研讨,系统总结了如何用短期A/B实验推断长期业务效果的共识与争议,覆盖效应符号反转规律、替代指标设计偏好、观测与实验学习路线对比,以及长期实验的不可替代性。
这篇工作最值得看的点是什么?不适用(本文为行业经验总结性论文,无实验数据)
这篇工作的边界或风险在哪里?优点:本文汇集了来自15家在线平台和4所大学的26位专家的行业知识,具有高度的实践相关性和权威性;以命题形式系统化地总结了行业共识,结构清晰;涵盖了从典型实践、效应轨迹、替代指标到开放挑战的完整框架;提供了丰富的公共证据支持各命题。缺点:作为行业经验总结,缺乏严格的数学推导和系统性实证验证;各命题的结论高度依赖具体平台和情境,普适性有限;部分命题的证据基础较为薄弱,主要依赖参与者主观意见;未提供可复现的实验代码或数据。
如果你还有哪些想要了解的,欢迎在评论区留言或者讨论~

龙哥点评

论文创新性分数:★★★★☆

通过组织行业专家研讨会,系统收集和整合在线平台在利用短期实验评估长期业务成果方面的行业知识与实践经验,形成一系列反映当前行业共识的命题。

实验合理度:★★★☆☆

现有材料未完整覆盖数据划分、基线公平性和统计显著性,因此按中性评价处理。

学术研究价值:★★★★☆

通过组织行业专家研讨会,系统收集和整合在线平台在利用短期实验评估长期业务成果方面的行业知识与实践经验,形成一系列反映当前行业共识的命题;更关键的是问题定义是否可复用到同类任务。

稳定性:★★★☆☆

现有材料未提供充分的极端条件、重复运行或扰动测试,稳定性暂按中性评价。

适应性以及泛化能力:★★★☆☆

现有材料未完整展示跨数据集、跨场景或分布外实验,泛化能力仍需进一步验证。

硬件需求及成本:★★★☆☆

现有材料缺少完整训练资源、参数量、显存和推理时延信息,成本暂按中性评价。

复现难度:★★★☆☆

现有材料未确认完整代码、配置、数据处理脚本和权重是否齐备,复现难度暂按中性评价。

产品化成熟度:★★★☆☆

论文验证以研究实验为主,真实部署中的时延、成本、维护和异常场景仍需补充验证。

可能的问题:作为行业经验总结,缺乏严格的数学推导和系统性实证验证;各命题的结论高度依赖具体平台和情境,普适性有限;

主要参考文献

[1] Sigerson, L. et al. Evaluating for the Long Term: Learnings from Industry. arXiv:2608.08043, 2026.
[2] Kohavi, R., & Thomke, S. The Surprising Power of Online Experiments. Harvard Business Review, 2017.
[3] Athey, S. et al. Surrogate Index. arXiv, 2026.
[4] Bibaut, A. et al. Estimating Treatment Effects Using Proxies: The Role of Weak Instruments. 2024.
[5] Goli, A. et al. Long-term Ad Load Experiment at Pandora. 2025.
[6] Cunningham, T. et al. Content Quality Signals and Long-term Retention. 2025.

*本文仅代表个人理解及观点,不构成任何论文审核或者项目落地推荐意见,具体以相关组织评审结果为准。欢迎就论文内容交流探讨,理性发言哦~ 想了解更多原文细节的小伙伴,可以点击"阅读原文",查看更多原论文细节哦!       

end
短期看数据,长期看价值;实验一时爽,翻车两行泪。想系统学习在线实验与因果推断的一线实战经验?欢迎加入龙哥读论文粉丝群,扫描下方二维码或者添加龙哥助手微信号加群:kangjinlonghelper。一定要备注:研究方向+地点+学校/公司+昵称(如 因果推断+北京+Meta+阿凯),根据格式备注,可更快被通过且邀请进群。
wechat_helper dianzan

转发文章 微博 X LinkedIn Facebook
龙哥读论文 · PaperDaily

本文基于龙哥读论文 PaperDaily 数据库整理,结合论文原文与工程视角进行解读。