论文基本信息
原文标题:Micro-video recommendation based on multi-dimensional sequence features in content e-commerce platform
主要署名单位:浙江工商大学
期刊:《复杂与智能系统》
首次公开:2026年9月13日(Article in Press)
原文:https://link.springer.com/article/10.1007/s40747-026-02489-9
龙哥导读
一条短视频看完,下一条究竟该按“刚才看了什么”推荐,还是按“喜欢哪类内容、偏爱哪位创作者”推荐?这篇工作没有把三种信号揉成一团,而是分别建图、分别传播,再按当前会话动态融合。真正值得看的,不只是榜单上多了几个百分点,而是它把短视频兴趣拆成了三条可解释的路径。
刷短视频时,用户的兴趣变化快得有点“不讲武德”:上一秒还在看露营装备,下一秒可能被同一创作者的宠物视频吸引,再下一秒又顺着“户外”类别继续看。平台若只记住视频编号,就会错过类别的延续;若只记住类别,又会错过创作者风格带来的黏性。
浙江工商大学这篇论文提出多维序列与图神经网络推荐模型(MSAGNN),把一次会话同步改写成物品图、类别图和作者图。三张图各自学习转移关系,随后融合为视频表示,再结合位置与注意力得到会话兴趣,最终给候选视频排序。
一、短视频推荐难在哪:兴趣不是一条线
传统个性化推荐常把较长历史压成稳定画像,但短视频信息流几秒就刷新一次。用户利用通勤、排队等碎片时间连续滑动,平台要回答的是“下一条”,而不是“这个月大概喜欢什么”。因此,会话推荐更关注短时间内按时间排列的行为。
问题在于,多数会话图方法把视频当作唯一节点:A视频之后看B视频,就连一条边。这样能学习物品之间的跳转,却很难区分两种表面相似、实则不同的原因:用户是继续看同一主题,还是认准了某位创作者?在内容电商里,这个差别会影响候选召回、内容多样性,也会影响商品内容与用户当下意图的匹配。
论文把任务定义得很具体:给定当前会话中的视频序列,同时取得每条视频对应的类别与作者序列,预测用户下一条偏好的视频。它不直接分析画面、文字或商品语义,而是利用平台已有的结构化标识与观看行为。换句话说,这是一项会话级排序模型,不是多模态内容理解模型。
二、总览:三张图怎样汇成一次推荐
先看论文的总框架。左侧是同一会话派生出的三条序列;中间分别建图并经过门控图神经网络传播;随后三路表示进入融合层;右侧加入位置、用注意力形成会话向量,并与候选视频表示计算分数。
图1:左上三路分别是物品、作者和类别序列及其有向图;中部三个门控图神经网络分支负责消息传播;多层感知机融合多维表示;位置向量与注意力网络生成会话兴趣;预测层输出候选视频分数。下半部分展开了各类嵌入与消息传递方式。
这张图最关键的不是“用了三个模块”,而是三种关系先独立学习。若一开始把作者和类别仅作为视频的附属字段拼接,模型容易让高频物品信号淹没其他维度;分支建图则给每种转移关系单独的参数空间,最后再决定当前场景更该信哪一路。
三、方法链拆解:从三张有向图到门控传播
第一步,建立物品图。会话按观看时间排列,视频是节点,相邻观看形成有向边。重复出现的视频只保留一个节点,但不同转移次数会进入边权;入边与出边分别归一化,让模型区分“从哪里来”和“往哪里去”。这比简单列表多了一层局部拓扑:不只知道顺序,还知道节点在会话转移中的位置。
第二步,建立类别图。把每条视频替换成类别标识,再按相同时间顺序连接。连续几个不同视频可能都属于“美食”,类别图会把这种主题惯性压缩得很明显;若用户从美妆跳到穿搭,再回到美妆,图结构也会保留这种往返。
第三步,建立作者图。同理,把视频替换成创作者标识。用户可能不在意某条具体视频,却持续认可同一创作者的拍摄节奏、讲解方式或选品风格。作者图把这种“风格黏性”从物品跳转中剥离出来。
每张图随后进入门控图神经网络。对任一节点,模型先汇总归一化的入邻居与出邻居消息,再通过更新门、重置门和候选状态更新节点表示。直觉上,它像一个有选择的记忆器:更新门决定新邻居信息写入多少,重置门决定旧状态保留多少,避免每次传播都把原表示彻底覆盖。
传播层数也不能无限堆。层数太少,只看到一步邻居;层数太多,节点表示会越来越相似,出现图网络常见的过平滑。论文在1到4层之间比较,最终两层最好:大矩阵上的前10平均倒数排名为11.62、前20命中率为20.40;增加到4层后分别降到10.64和18.74。
把论文公式翻成白话,节点更新大致分四拍。第一拍,入边矩阵和出边矩阵分别乘以上一层节点状态,得到“别人流向我”和“我流向别人”的两组消息;第二拍,把两组消息拼接并做线性映射;第三拍,更新门与重置门根据当前消息决定读写比例;第四拍,用门控后的旧状态和候选新状态做加权混合。这里的参数不是为每个视频单独训练一套,而是在同一分支内共享,因此它学习的是普遍的转移模式。
三路图的节点数也不同。物品图可能有很多具体视频节点,类别图最多只覆盖该会话出现的少量主题,作者图则介于两者之间。这意味着三路分支看到的是不同粒度:物品图细但稀,类别图粗但稳,作者图抓住内容风格的中间层。模型不是要求三张图长得一样,而是要求它们最终输出同维度向量,方便后续融合。
四、三路融合:不是拼在一起就结束
三张图得到三组表示后,模型要把它们重新绑定到每个视频位置。论文比较了直接拼接、求和池化和多层感知机三种办法。直接拼接只是把特征排成一长条;求和默认三路处在可直接相加的同一空间;多层感知机则能学习非线性组合,最终取得最好结果。
以稠密的小矩阵为例,拼接的前10平均倒数排名为3.64,求和池化为4.22,多层感知机达到4.31;前20命中率分别为17.57、17.88和18.00。差距并不夸张,但方向稳定,说明“哪一维如何组合”确实需要学习,而不是手工设成平均权重。
融合后的每个序列位置还要加上可学习的位置编码。图结构擅长表达转移,却可能弱化原始序列中“离当前时刻有多远”。位置向量把第1条、第2条直到最近一条重新区分开,让模型知道相同视频或相同类别出现在会话前端和末端,意义并不一样。
随后,模型把最近一次交互表示为当前兴趣,再用加性注意力对整段序列加权,得到全局会话兴趣。最近一次点击回答“眼下想看什么”,全局表示回答“这一轮总体在追什么”。两者拼接并线性变换,成为最终会话向量。
注意力权重的计算同时参考三个对象:某个位置的融合表示、最后一个位置代表的当前兴趣,以及整个会话的平均概貌。一个位置若与当前兴趣一致、又能代表会话主线,就会获得更高权重。这样做比只取最后一条稳健,也比简单平均更灵活:最后一条可能是误触,平均又可能把突然转向的新兴趣冲淡。
论文把局部兴趣与全局兴趣拼接后投影到统一空间。这里的“全局”只指当前会话内部,不是用户跨天、跨月的长期画像。它适合处理正在发生的短期意图,却不能替代长期偏好、用户生命周期或冷启动模块。实际系统更合理的方式,是让它与长期塔、上下文特征和业务约束协作。
最后一步很朴素:会话向量与每个候选视频的嵌入做点积,分数越高,排序越靠前;训练时用交叉熵拉高真实下一条视频的概率。也就是说,复杂设计集中在“如何把一次会话表示好”,打分层本身没有另造一套重型机制。
五、快手公开微视频推荐数据实验:稀疏与稠密两种世界
实验使用快手公开微视频推荐数据的两个互不交叉子集。大矩阵包含7176名用户、10729个视频、31个类别、8369位创作者和1253万次交互,密度13.4%;小矩阵包含1411名用户、3327个视频、31个类别、2267位创作者和467万次交互,密度99.6%。前者更接近稀疏长尾环境,后者近乎全量观察。
论文把观看完成率大于0.8的记录视为正反馈;同一用户相邻交互间隔小于25分钟时归入同一会话;长度为1的会话、出现少于5次的物品被过滤,会话最长保留32条。按时间把前75%的会话用于训练与验证,最新25%作为测试,训练与验证再按9:1划分。
预处理后的大矩阵有2317850个会话,平均长度10;小矩阵有789569个会话,平均长度7。两个子集都含31个类别,但用户、视频和作者规模差异很大。这个设计让论文可以观察同一模型在“关系稀疏”和“关系几乎完整”时的表现,而不是只报一个平均数字掩盖数据条件。
实现上,论文使用PyTorch和Adam优化器,学习率0.001,批量大小50,物品、类别、作者及位置嵌入均设为50维,并按验证集表现采用耐心值为10的早停。基线使用其原论文推荐超参数,模型固定随机种子。论文给出了这些关键设定,但没有公布完整代码环境与训练日志,因此仍不足以完成严格的外部复现。
比较对象包括一个流行度参考,以及八个学习型基线。早期路线先放入个性化马尔可夫链分解模型(FPMC)和门控循环推荐网络(GRU4Rec)。
随后比较神经注意力推荐模型(NARM)与短期注意力优先模型(STAMP),观察不使用图结构时,长短期兴趣聚合可以走到哪一步。
图模型组先比较会话图神经网络(SR-GNN)和图上下文自注意力网络(GC-SAN)。
另外两项是类别序列增强推荐模型(CaSe4SR)与间隔增强图变换器模型(IGT)。这样的比较不只问“三路图比单一路图强不强”,还问它能否超过不同代际的序列建模方法。
指标有两个。平均倒数排名指标关心真实下一条视频排得有多靠前:排第1得1分,排第2得1/2分,超过截断位置记0;命中率指标只关心真实视频是否出现在前若干项。前者更苛刻地惩罚靠后,后者更像“推荐列表里有没有”。
六、主结果:优势真实,但要看密度
主结果表里,MSAGNN在两个子集、四个指标上都排第一。大矩阵的前10与前20平均倒数排名分别为11.62和11.93,前10与前20命中率为15.91和20.40;小矩阵四项依次为4.31、4.51、11.41和18.00。
图2:主结果表。每个数据集都报告两种截断位置下的平均倒数排名和命中率。MSAGNN在最下行,IGT是最强基线;右侧小矩阵的相对提升整体高于左侧大矩阵。
相对最强基线IGT,大矩阵四项提升为1.84%、2.14%、1.99%和2.31%;小矩阵提升为11.37%、9.47%、7.24%和3.93%。论文对两种模型做配对t检验,两个子集上的p值均小于0.05,说明按作者报告,这些差异达到统计显著。
从基线梯队也能看出技术演进。流行度方法在大矩阵的前20命中率只有2.28,马尔可夫链模型升到6.31;循环网络为7.33;加入注意力后,两种代表模型来到19左右。
图模型SR-GNN、GC-SAN与CaSe4SR继续逼近19.5;时间间隔增强模型达到19.94,本文模型最终为20.40。真正有竞争力的对手已不是传统方法,而是同样利用图与注意力的强模型。
统计显著也不等于业务显著。p值会受到样本量影响,快手公开微视频推荐数据包含大量会话,小幅差异也可能稳定通过检验。产品决策还要看绝对提升、计算成本、线上流量波动和收益指标。论文没有给出精确p值、置信区间或多随机种子方差,因此我们能确认作者报告了显著性,却不能进一步判断结果分布有多宽。
这里有个很重要的读法:密集数据上的收益明显更大。三路图需要足够多的连续行为才能稳定学习类别与作者转移;在稀疏大矩阵上,它仍然赢,但只领先约2%。所以它不是“数据越稀疏越神”,更像是当平台元数据完整、会话足够连续时,多维兴趣能充分释放。
七、消融:三张图、注意力、位置各贡献多少
先看三种维度。只用物品图时,大矩阵的前10平均倒数排名为11.41;加类别图升到11.59,加作者图则为11.42,三路一起达到11.62。小矩阵更明显:只用物品为3.80,物品加类别为3.88,物品加作者为3.92,完整模型为4.31。
图3:维度消融。四行依次表示仅物品、物品加类别、物品加作者和三路完整模型。各辅助维度并非在每个单项上都带来同样幅度,但完整组合的总体结果最好。
这个结果也提醒我们别把作者维度神化。在大矩阵上,单加作者对平均倒数排名提升很小;它与类别、物品共同融合后才稳定获益。论文能支持的是“三种信号互补”,不是“作者关系单独决定推荐”。
注意力消融更有力度。去掉加性注意力、改为平均池化后,大矩阵的前20命中率从20.40降到18.62,前10平均倒数排名从11.62降到10.52;小矩阵的前20命中率从18.00降到16.05。说明当前浏览语境下,不同位置、不同维度不能一视同仁。
位置编码的贡献较温和但一致。移除后,大矩阵的前20命中率下降0.43个百分点,小矩阵下降0.50个百分点;前10平均倒数排名分别下降0.27和0.12个百分点。图传播已经吸收了较多顺序关系,位置编码更像补充校准,而非主发动机。
图4:上部比较拼接、求和池化与多层感知机,中部比较1至4层门控图神经网络,下部比较有无注意力。阅读时重点看每组同一列:多层感知机、两层传播和保留注意力分别取得最好结果。
八、参数敏感性:阈值、维度与前若干项推荐
观看完成率阈值从0.5提高到0.9时,四项指标总体上升,因为更严格的阈值滤掉浅层浏览,留下更可靠的偏好。但论文仍选择0.8作为主设定:0.9会删除大量中等观看时长记录,加剧稀疏,也偏离快手公开微视频推荐数据常用预处理口径。这个取舍很工程化——标签更纯,不等于训练数据更好。
嵌入维度在12、25、50、100、150、200、250之间变化时,50维最好。维度太低,表达能力不足;升到250后,参数量增加而会话样本不足以约束,性能反而下降。图中的四个子图分别对应两个数据集上的前10平均倒数排名、前10命中率、前20平均倒数排名和前20命中率,曲线都在50附近形成高点。
图5:横轴是嵌入维度,纵轴分别是平均倒数排名或命中率。大矩阵与小矩阵各一条曲线。50维附近最好,继续增大没有带来单调收益,250维下降更明显。
当推荐列表从10项扩到50项时,命中率明显上升,因为候选位更多,真实视频更容易被包含;平均倒数排名变化较小,因为它更在意首个正确结果的具体名次。这个现象不是模型突然变聪明,而是两个指标回答的问题不同:一个看“有没有”,一个看“排多前”。
九、复杂度与落地:多两张图,代价是多少
论文把本文模型的核心复杂度写为三条并行图分支,大致是3倍的门控图传播,再加最长32步的位置与会话处理。表中的归一化相对计算成本为6.5,高于单图会话模型的3.0和图加自注意力模型的4.2,也高于类别双图模型的5.0,但低于时间图Transformer的8.5。它不是最轻模型,也不是最重模型。
对线上系统来说,三路图可以并行,这是好消息;但作者、类别查表、三套邻接结构、融合与注意力仍会增加内存访问和服务链路。论文没有报告训练时长、单请求延迟、吞吐、显存或线上A/B,因此“相对复杂度可接受”仍是分析层面的判断,不能直接换算成某个平台的毫秒级承诺。
真正适合优先尝试的团队,是已经有稳定会话切分、视频—类别—作者映射完整,并且能在召回或粗排阶段承受额外图编码的内容平台。若作者标识混乱、类别频繁漂移,或者新用户只有一两次交互,三路结构可能得不到论文数据中的互补收益。
若要做最小工程验证,可以先不重建整套线上服务,而是在现有会话样本上做三组离线对照:物品单路、物品加类别、三路完整模型;同时记录平均倒数排名、命中率、训练耗时、峰值显存和单批推理时延。再按新老用户、长短会话、头部长尾作者分桶,确认提升是不是只集中在少数高活跃用户。这样的验证比直接追求论文总分更能决定是否值得上线。
十、与相似路线相比,它补上了哪一环
会话图神经网络把单次会话转成物品图,用门控传播学习非线性转移;全局上下文增强图神经网络(GCE-GNN)进一步把当前会话图与全局会话图结合,补充跨会话共现。
类别序列增强模型显式引入类别序列,让类别不再只是物品上的一个静态标签;时间间隔增强模型则把间隔放进图变换器,强化“多久之后发生下一次交互”。
MSAGNN沿着这条演进链多走了一步:在物品与类别之外,给创作者单独建图,并把三路表示放到统一的会话注意力中。它的亮点不是发明了全新的图算子,而是针对短视频场景重新划分信息维度。这个思路很值得产品团队借鉴:模型结构创新有时来自“把被当作属性的变量,升级为独立行为序列”。
但它也没有覆盖所有关系。目前三张图是各自同质的:视频连视频、类别连类别、作者连作者,没有显式建立视频—作者、视频—类别的跨类型边,也没有把画面、文本、音频、商品和价格信号纳入图中。下一步若继续加维度,关键不再是“图越多越好”,而是怎样控制冗余、时延和噪声。
十一、龙哥点评:这篇论文最值钱的是拆问题的方法
龙哥觉得,这项工作的真实价值不在于“又一个图网络赢了榜单”,而在于它把短视频推荐中的三种偏好来源拆开:物品回答具体内容,类别回答主题惯性,作者回答风格与信任。拆开以后,收益来自哪里、哪条信号失效,都更容易诊断。
漂亮结果也要冷静看。小矩阵近乎稠密,三路关系容易被充分观察,所以提升达到两位数;大矩阵更稀疏,优势缩到约2%。这恰恰说明,模型价值和数据条件绑得很紧。部署前最该做的不是先复刻所有模块,而是统计本平台会话长度、作者复看率、类别连续率和元数据缺失率。
还要注意评价只发生在离线下一条推荐。平均倒数排名与命中率能回答排序是否更准,却回答不了用户是否看得更久、商品转化是否提高、内容生态是否更健康,也不能保证不会强化对少数创作者的重复曝光。推荐系统最后服务的是用户与平台目标,不是一张表里的粗体数字。
数据本身也留下三个限制。第一,正反馈由观看完成率阈值构造,短视频天然更容易获得高完成率,时长偏差需要额外处理;第二,25分钟会话切分是人为规则,不同内容场景可能需要不同窗口;第三,数据来自单个平台,作者关系、类别体系和用户行为能否迁移到其他内容电商平台,尚未被实验回答。
此外,论文的数据声明是按请求提供,没有论文专属代码或项目页可供直接核验。方法公式、表格和消融足以支持机制解读,但复现者仍需自行完成图构建、负样本、批处理和评测细节。对于准备采用这条路线的团队,复现成本不只在模型,还在数据管线是否能稳定产出三条同步序列。
一句话总结:当用户兴趣同时沿着内容、主题和创作者三条路径流动时,只建一张物品图确实不够;MSAGNN证明了分路建模再动态融合是条有效路线,但它的上线价值仍需延迟、跨平台和真实业务指标来补完。
十二、龙迷三问
第一,作者偏好是稳定兴趣,还是平台重复曝光造成的结果? 离线序列很难完全区分二者。更强的验证应加入曝光日志、去偏估计或在线随机实验。
第二,三路独立图能否扩展到商品、品牌、音乐与话题? 技术上可以,但每加一路都会增加参数、计算与噪声。应先证明该维度拥有独立且稳定的转移信息。
第三,怎样避免推荐越来越同质? 准确率提升不自动等于多样性提升。上线时应同时观察创作者覆盖、类别覆盖、新颖性、长尾曝光和用户负反馈,必要时在排序后增加多样性约束。
参考资料
论文主页
https://link.springer.com/article/10.1007/s40747-026-02489-9
CaSe4SR
https://doi.org/10.1016/j.knosys.2020.106558
IGT
https://doi.org/10.1016/j.eswa.2022.118970
GCE-GNN
https://doi.org/10.1145/3397271.3401142
本文基于龙哥读论文数据库与论文检索资料进行汇总整理。
本文仅作论文解读与技术讨论,不构成产品效果承诺。实验数字与方法细节以原论文为准。