← 返回 PaperDaily
视觉与图像
杜比实验室新作:AI边看边猜观众哭不哭,1%标注媲美全量SOTA
电影放映前 ,最让人紧张的变量不是画面清不清晰、声音大不大,而是观众看到第 17 分钟会不会笑、第 42 分钟会不会哭、结尾字幕亮起来时会不会觉得这钱花得冤枉。
龙哥读论文
发布于 2026-09-12 16:54:33
阅读 1
查看原文
原论文信息如下:
电影放映前 ,最让人紧张的变量不是画面清不清晰、声音大不大,而是观众看到第 17 分钟会不会笑、第 42 分钟会不会哭、结尾字幕亮起来时会不会觉得这钱花得冤枉。内容方做梦都想要一种“观众反应预判器”:片子还没大规模上映,就能知道哪些片段能点燃情绪、哪些片段让人中途刷手机。可现实是,传统试映要花钱请真人、搬设备、发问卷,样本还经常只有几十个人,跟真实观众顶着弹幕和评论区放飞自我的状态差得不是一星半点。
这个领域叫 induced emotion ,也就是诱导情绪:模型要预测的不是“角色此刻演得多悲伤”,而是“观众此刻心里真的有多悲伤”。情绪是主观的,有人看到悲剧会哭,有人因为主角演技浮夸而笑场;情绪也是动态的,十年前观众觉得浪漫的桥段,放到今天可能会被群嘲“爹味十足”。这种高歧义、高飘移的属性,让它在情感计算里长期是个硬骨头。
过去的研究大多走两条路:要么组织志愿者看片并采集自报告或生理信号,要么找专家给视频打情感标签。两条路都贵、都慢、样本都小,而且往往标的是感知情绪(perceived emotion),跟观众真实被勾起来的反应隔着一层。更麻烦的是,情绪分布会随时代审美变化,固定日期采集一次的数据集,过几年就过期了。
来自马萨诸塞大学阿默斯特分校(UMass Amherst)与杜比实验室(Dolby Laboratories)等机构的研究者,在这篇论文里给出一个相当“野生”的解法:与其把人请进实验室,不如去 YouTube 评论区捡观众真实反应 。电影短片下面常年蹲着大量吐槽、泪奔、夸演技、骂编剧的观众,这些评论就是免费的、规模庞大的“情绪传感器”。研究团队在此基础上构建了多模态数据集 Video2Reaction,用近百万条观众评论反推出电影片段会引起怎样的情绪分布,再拿去微调视觉语言模型,让模型学会“看视频预判观众反应”。
观众反应预测:为何重要且困难重重
如果真能让 AI 在发行前“预判观众情绪”,收益立竿见影:片方可以做针对性重剪,平台能在推荐流里优先放大催泪或爆笑的镜头,广告主也能提前避开容易引发反感的片段。这比事后看舆情要主动得多。可要训练这样的模型,第一道坎是数据。
现有视频情感数据集,大多靠研究者招募被试观看并打分,标注量常停留在几千条;而诱导情绪本质上是一种标签分布学习 (Label Distribution Learning, LDL)问题——同一段画面对不同观众引起的情绪不是一个确定的词,而是多个情绪按比例混合的分布。有人被吓到尖叫,有人却因为特效太假笑出声,模型只有学到这种分布,才不会把“一个人笑”当成“全场笑”。
可要大规模收集分布级标签,用传统众包几乎不可能:你得让同一段视频被几百个不同背景的人分别标注,钱和时间的消耗都是指数级。Video2Reaction 的突破口,是把 YouTube 评论当成现成的“群体标注数据”。一段电影片段在平台上放了好几年,评论区汇聚了不同时期、不同文化背景的观众真实留言,恰好是天然的情绪分布采样。
Video2Reaction:从社交媒体评论中挖掘观众情绪
视频素材来自 CondensedMovies 数据集,里面的片段出自 Movieclips(一个专门上传电影片段且拥有合法授权的 YouTube 频道),用正版授权内容的最大好处是:片子不容易突然被平台下架,数据集能活得更久。为了保证评论区真的“聊得起来”,研究者只保留播放量超过 1 万且评论数不少于 10 条的片段。片段上传时间横跨 2011 到 2019 年,评论却一直积累到 2025 年,相当于每条片段都沉淀了至少六年的观众反馈。
最终版 Video2Reaction 包含来自 1545 部电影的 10348 个片段(训练/验证/测试划分为 7243 / 1035 / 2070),总时长达到 390 小时,关联了近百万条 YouTube 评论。这样的规模,是传统实验室采集手段几乎不可能达到的。有关视频与评论数据的更细致统计如表 8 所示。
情绪标签体系没有从头发明,而是借用谷歌开源的细粒度情绪数据集 GoEmotions 中 28 个类别,再根据本数据里的实际分布剔除 7 个长期占比不到 0.01% 的冷门反应,保留 21 个细粒度反应类别,并按情感倾向分成正向、负向和模糊三组(见表 1)。
很多人会下意识地把“观众反应”压缩成单一情绪标签,比如“这片子是喜剧”或“观众很悲伤”。Video2Reaction 的统计图(图 2)揭示了这种做法的问题:数据集中每个视频的主导情绪概率中位数只有 0.4 左右,也就是说,绝大多数片段里最强的情绪也占不到一半;有的片段里开心、尴尬、惊讶三种情绪几乎势均力敌。与此同时,类别不平衡因子 γ 高达 28.36,说明若只用最大概率类别做硬标签,模型会天然偏向热门情绪,彻底忽略少量但真实存在的负向或微妙反应。
因此,Video2Reaction 把每个视频片段标注成一个 21 维的情绪概率分布,而不只是一个标签。这个设计贯穿了后续全部建模,也让数据集能承载不同观众“笑中带泪”“尴尬又好笑”的复杂反应。没有这种分布意识,后续微调出来的模型充其量只会做“平均情绪判断”,而无法还原真实舆论场的分裂。
两阶段多智能体LLM标注流水线
评论是“野生”的,不代表能直接当标注用。“这个演员居然没拿奥斯卡,太失望了”看起来在表达失望,实际意思却是“这演员演得也太神了”。若程序按关键词命中“disappointed(失望)”,就会把一条本来在表达崇敬与认可的评论错误地归到负向情绪里。
为此,论文设计了两阶段多智能体 LLM 标注流水线,整体流程见图 1。第一阶段先让大语言模型(LLM)把评论“改写”成对视频片段反应更明确的语句,同时过滤掉没有明确可泛化情绪的“跑题”评论。一些评论看似在聊电影,实际只是玩梗或认出了某个演员,例如把地铁场景与本地新闻对比,这类内容没有跨场景的可迁移信息,会被直接剔除。第二阶段再从改写后的句子里提取观众反应类别。
为了让标注结果更稳定,团队没有用单个大模型“一言堂”,而是启用三个中等规模的指令微调语言模型——LLaMA-3.1-8B-Instruct、Qwen2.5-14B-Instruct 和 DeepSeek-R1-Distill-Qwen-7B——对同一评论独立标注,再对结果做多数投票,投票后仍不一致的模糊样本直接丢弃。之所以选三个“实力相当”的中等模型,是因为此前多项研究(如文献 [16])发现:多数投票的集成方法在各成员模型能力相近时效果最好。三个模型还可以并行推理,比“生成器+评审器”这类必须串行交互的架构更快。
自动标注的质量能不能打?论文做了两轮评估。第一轮把 LLM 标注与人类标注做相关度对比,29 名参与者对 233 对“视频-评论”样本独立标注,取每位情绪上的斯皮尔曼相关系数平均值作为参照。结果显示人类之间的平均相关系数是 0.428(标准差 0.233),而 LLM 与人类之间的平均相关系数是 0.402(标准差 0.243)。换句话说,LLM 的标注一致性与人类自己的一致性处在同一水平 ——诱导情绪本身就主观,人类评委之间也常常“吵成一团”,LLM 并没有明显更不靠谱。分情绪的细粒度对比如表 4 所示。
第二轮是双盲人工核验。从所有类型的影片里随机抽 100 个片段,每个片段抽 10 条评论,共 1000 条,由两位标注员独立复核、第三人裁决分歧。结果如图表 5 所示:86% 的 LLM 标签被判正确,7.8% 错误,6.2% 难以界定。作为对照,随机生成标签的正确率只有 0.2%,排除了“标注员无脑放水”的可能。分电影类型拆开看(表 6),所有类型的正确率都在 70% 以上;喜剧和剧情片相对更难,因为这类内容经常依赖流行文化梗和潜台词,而恐怖片、动作片的情绪指向更明确。
从单情绪维度看(表 7),像“愤怒”“恐惧”这类强情绪更容易被识别,而“尴尬”“紧张”这类微妙反应则更容易被混淆。这提醒使用者:自动标注擅长抓大情绪,遇到藏在潜台词里的含蓄表达,还做不到万无一失。
视觉语言模型微调与跨域迁移实验
数据建好了,接下来要解决“怎么让模型把视频映射成情绪分布”。本文没有给视频单独训练一个专用分类头,而是直接微调视觉语言模型(Vision-Language Model, VLM)。VLM 本来就会“边看画面边说话”,研究团队只需要把任务包装成一个带提示词的问题:给定电影片段和剧情描述,请模型判断观众最可能产生的情绪。
这里有个关键设计:模型不是直接生成“我觉得观众会感到惊喜和一点恐惧”这样的自由文本,而是利用自回归模型对候选词首 token 的预测概率来构造完整情绪分布。为了让每种情绪在概率提取时“首字母不撞车”,论文设计了两种提示策略。第一种叫做 Label-option,给 21 个情绪各分配一个唯一的字母标签(如 A/B/C),让模型只输出字母;第二种叫做 Word-option,把首 token 冲突的情绪词改写掉,例如把 disgust(厌恶)改成 grossed,把 disapproval(不赞成)改成 opposed,把 disappointment(失望)改成 deflated,这样模型既能直接看到语义丰富的情绪词本身,又能在输出第一步就区分是哪种情绪。
为了让模型输出的预测分布尽量接近真实观众反应分布,训练目标采用 KL 散度。若一段视频对应的真实第 m 类情绪占比是 dxm,模型预测为 d̂xm,则损失函数大体为:
DKL(dx ‖ d̂x) = Σm=1M dxm · log( dxm / d̂xm )
微调采用 LoRA(Low-Rank Adaptation,低秩适配),秩设为 8,只作用于注意力层,约 6% 的参数参与训练。实验选了 LLaVA-NeXT-Video-7B 和 Qwen2.5-VL-7B-Instruct 两个 7B 规模的视觉语言模型。
在 Video2Reaction 自带的测试集上,论文比较了多个基线:经典标签分布学习模型 LDSVR(基于支持向量回归的标签分布学习)和 SA-BFGS(基于 BFGS 优化的标签分布学习),从头训练;还有直接做零样本推理的商业闭源大模型 Gemini 2.5 Flash,以及没有微调、仅做温度缩放的 VLM。结果见表 2。
表 2 中 TPE 是“Top-1 概率误差”,值越低越好;MRR 用于衡量主导情绪排序质量;F11 和 F13 分别是类加权的 Top-1 / Top-3 的 F1,越高越好。零样本的 VLM 和 Gemini 表现都不理想,说明“预测观众反应”很难靠通用模型凭空完成;但经 LoRA 微调后,两个 VLM 在多数指标上都反超了 LDSVR 与 SA-BFGS。另一个重要观察是:Word-option 稳定优于 Label-option。让模型直接对着有语义的情绪词思考,比对着抽象字母更有效——预训练阶段积累的语言知识没有被浪费。
更值得关注的实验,是把模型“转校”到另一个诱导情绪数据集 VCE 上。所谓 VCE,指论文《How Would the Viewer Feel? Estimating Wellbeing from Video Scenarios》发布的大规模视频情绪数据集,同样用短视频场景诱发观众情绪,但视频来源为社交媒体、情绪分类体系和标注方式都与 Video2Reaction 不同。Video2Reaction 的模型先在目标域的小量子集上做二次适配(零样本、500、1000、5000 条样本),再与从零开始在同样子集上微调的模型对比。
在不接触任何 VCE 训练数据的零样本设置下,预微调过 Video2Reaction 的 LLaVA-NeXT-Video-7B,Top-3 准确率从 0.232 提升到 0.347;Qwen2.5-VL 也从 0.083 提升到 0.352。这说明 V2R 中学到的不是死记硬背,而是可迁移的“观众情绪常识”。
最亮眼的数字出现在 500 条样本(只占 VCE 全量训练集的 1%)设置下:LLaVA-NeXT-Video-7B + V2R 拿到 0.682 的 Top-3 准确率,不仅远超同条件下从零训练的 0.653,还逼近了业界此前用全部 5 万条样本训练出来的水平(0.689)。换句话说,在 Video2Reaction 上先学一遍,目标域的标注量可以省掉约一个数量级。这个结论对上万样本级的情感数据标注工业化有很大诱惑力。
结果分析与未来展望
Video2Reaction 能work,核心在于它把“找人试映”变成“爬评论”。真实观众在评论区不装、不表演,表达的情绪丰富且贴地;再加上 LLM 自动标注流水线可以把零散文本批量转成结构化分布,数据量才能做到过去实验室手段无法企及的规模。
从实验看,模型在 VCE 上的表现有两点值得肯定:一是零样本迁移显著提升,说明 V2R 上的预微调让模型真正理解了“观众反应”这个抽象任务;二是只需 1% 目标域标注就能接近全量 SOTA,说明这种迁移能降低冷启动成本。但同时也要看到边界——表 3 中的提升并不是在所有子集尺寸都压倒性巨大,5000 条样本时两个模型的增益已经变小;0.682 对比 0.689 只能算“追平量级”,并非全面碾压。跨数据集的迁移还存在标注体系、人群偏差和视频域差异等变量,需要更多统计学验证才能下更硬的结论。
另一个不能回避的问题,是评论区的“幸存者偏差”。愿意在 YouTube 评论里打下长段文字的观众,通常比普通观众的参与意愿更强、表达风格更外放;评论区比例并不完全等于全体观众的真实情绪比例。好在这不影响 Video2Reaction 作为“社交媒体情绪代理”的价值,但如果要把它直接用于院线电影票房预测这类高风险场景,仍需谨慎校准。
针对后续工作,论文给出两个方向:其一是“用模型标注模型”,即用 V2R 预微调后的 VLM 给 VCE 全部 5 万条样本自动打标,再训练 VideoMAE,并与人类标注版对照,验证自动标注能否低成本替代人工;其二是探讨模型规模对迁移效果的影响——V2R 带来的收益会不会随着 VLM 参数量继续增长而放大,还是会出现边际递减,这直接关系到该技术路线的性价比上限。
对内容产业而言,这个数据集最现实的意义,是把“预判观众反应”从昂贵的定制实验变成了可迭代的数据工程问题:数据会自动更新,模型可以持续重训,短视频平台、流媒体甚至广告投放都有机会从中受益。数据集已经在 Hugging Face 上公开,感兴趣的同学可以直接下载做实验。
龙迷三问
这篇论文到底在解决什么问题? 论文构建了Video2Reaction数据集:约100万条YouTube评论对应约1万个电影片段,自动生成观众情绪分布;并验证LoRA微调的视觉语言模型能有效预测观众反应,仅用1%目标域标注即追平全量训练的SOTA。
这篇工作最值得看的点是什么? 在域内测试中,微调后的VLM显著优于LDL基线和零样本VLM;在跨域迁移中,Video2Reaction预微调的LLaVA-NeXT-Video-7B仅用500个VCE样本(1%)即达到0.682的Top-3准确率,与全量训练的VideoMAE(0.689)相当。
这篇工作的边界或风险在哪里? 优点:(1) 提出大规模、可扩展的诱导情绪数据集,利用社交媒体评论作为真实观众反应的代理;(2) 设计两阶段多智能体LLM标注流水线,支持频繁更新;(3) 验证了VLM在诱导情绪预测上的有效性及跨域迁移能力。缺点:(1) 标注质量依赖LLM能力,部分情绪类别(如nervousness、embarrassment)标注准确率低;(2) 仅使用7B规模模型,未探索更大规模模型的效果;(3) 数据集存在类别不平衡问题(不平衡因子28.36)。
如果你还有哪些想要了解的,欢迎在评论区留言或者讨论~
龙哥点评
论文创新性分数: ★★★★☆
把“网络评论 + LLM 自动标注”的组合用于大规模诱导情绪数据集构建,并用全分布标签替代传统单标签,思路有新意,属于工程范式上的有效创新。
实验合理度: ★★★★☆
域内与跨域两套评测层层递进,能清晰看到预微调的增益;但部分结论只报告有限种子上的单次结果,缺少更细的显著性分析。
学术研究价值: ★★★★☆
它在“如何低成本为视频情感任务构建可控更新的训练数据”这个长期痛点上给出了可复现的参考答案,后续研究者可在此基础上扩展语言、文化和平台类型。
稳定性: ★★★☆☆
LLM 自动标注整体质量接近人类,但对喜剧与剧情片的梗和潜台词识别仍会抖动;评论人群的世代变化也可能让情绪分布随时间漂移,稳定性还谈不上完美。
适应性以及泛化能力: ★★★☆☆
跨域迁移到 VCE 提升明显,但实验集中在 7B 尺度与英语电影/短视频场景;面对非英语文化圈、不同视频品类和多语言评论,泛化边界仍需验证。
硬件需求及成本: ★★★☆☆
LoRA 微调 7B VLM 的单卡成本可控,但构建数据时要跑三个中等 LLM 的标注流水线,整体算力开销和云端 API 费用并不低;若频繁更新标注,成本会持续累积。
复现难度: ★★★★☆
数据集已在 Hugging Face 公开,微调代码基于常见 VLM 与 LoRA 框架,标注提示词在论文中也有完整描述;复现门槛主要在于跑完整 LLM 标注流水线的算力准备。
产品化成熟度: ★★☆☆☆
目前更适合做内容预筛选、舆情辅助判断等低风险场景;直接作为票房预测或重点内容决策的唯一依据还不够成熟,需要与业务指标做持续 A/B 验证。
可能的问题: 评论区群体的表达意愿与真实观众分布存在系统性偏差,跨域实验目前还缺少不同平台、不同语言的对齐验证;另外自动标签受 LLM 先验影响,遇上反讽、双关和圈层梗时仍不够可靠,需要在落地前明确划定适用边界。
主要参考文献
[1] Sidong Zhang, Shiv Shankar, Deepak Chandran, Trang Nguyen, Madalina Fiterau, Gauri Jagatap, Andrea Fanelli. Video2Reaction: Training Foundation Video Models to Predict Audience Reaction. arXiv:2609.01816.
[2] Dorottya Demszky, Dana Movshovitz-Attias, Jeongwoo Ko, Alan Cowen, Gaurav Nemade, Sujith Ravi. GoEmotions: A Dataset of Fine-Grained Emotions. arXiv:2005.00547, 2020.
[3] Mantas Mazeika, Eric Tang, Andy Zou, Steven Basart, Jun Shern Chan, Dawn Song, David Forsyth, Jacob Steinhardt, Dan Hendrycks. How Would the Viewer Feel? Estimating Wellbeing from Video Scenarios. NeurIPS, 2022.
[4] Max Bain, Arsha Nagrani, Andrew Brown, Andrew Zisserman. Condensed Movies: Story Based Retrieval with Contextual Embeddings. arXiv:2005.04208, 2020.
[5] Yuanhan Zhang, Bo Li, Haotian Liu, et al. LLaVA-NeXT: A Strong Zero-shot Video Understanding Model. 2024.
[6] Video2Reaction 数据集: https://huggingface.co/datasets/infofusionlab/Video2Reaction
*本文仅代表个人理解及观点,不构成任何论文审核或者项目落地推荐意见,具体以相关组织评审结果为准。欢迎就论文内容交流探讨,理性发言哦~ 想了解更多原文细节的小伙伴,可以点击 "阅读原文", 查看更多原论文细节哦!