← 返回 PaperDaily 视觉与图像

首次把DPO用到视频配音,CLIP分数冲到13.65

视频配音总是慢半拍?清华联手上海AI Lab把RLHF里的偏好优化搬进了视频配音任务,音画同步和听感双双拉满,还顺手解决了重建损失"听着对、感觉不对"的老毛病。

首次把DPO用到视频配音,CLIP分数冲到13.65
原论文信息如下:
论文标题:
HarmoniDPO: Video-guided Audio Generation via Preference-Optimized Diffusion
发表日期:
2026年8月
发表单位:
清华大学电子工程系、上海人工智能实验室(OpenGVLab)
原文链接:
https://arxiv.org/pdf/2608.11913v1.pdf

被"重建损失"坑了这么久,视频配音该换个活法了

先问一个问题:给一段无声视频配上声音,这事儿现在到底难在哪?

你要是只看表面,可能会说"不就是根据画面预测声音吗",但真做起来,里头全是坑。画面里一个人拿起杯子喝水,声音该是杯子碰撞桌面的脆响,还是喝水时喉咙吞咽的咕噜声?画面里一辆车开过,是引擎的低吼还是轮胎摩擦路面的沙沙声?视频到音频的映射天生就是一对多,同一个画面可以配上多种合理的声音,而人耳对这些声音的喜好,又带着强烈的主观色彩。

更麻烦的是,过去的主流做法——不管是基于重建的Transformer还是扩散模型,训练目标基本都是L1或者L2重建损失,拿生成结果和视频里原本的那条"标准答案"音频硬对齐。可问题在于,所谓"标准答案"往往只是众多合理声音中的一种,而且它本身也可能带着环境噪声、录制瑕疵。让模型去死磕这样一个参考目标,最后得到的音频往往是"技术上对齐了,听感上却不对味"。

这就好比让一个学做饭的人照着菜谱一比一复刻——菜谱上写着"盐少许",可每个人口味能一样吗?你照着菜谱烧出来的菜,师傅吃了可能只想摇头。

方法概述:双路视频表征+在线DPO,给视频配音装上"品味系统"

清华和上海AI Lab这次提出的HarmoniDPO,干了一件此前没人干过的事:把大语言模型里那套RLHF思路,搬到了视频配音任务上。整个框架分两阶段走,看图说话。

HarmoniDPO框架总览

图1 HarmoniDPO框架总览。(a) 阶段一:扩散模型处理双路视频输入(全局上下文特征+逐帧局部特征),可选文本条件,生成初始音频。(b) 阶段二:在线直接偏好优化(Online-DPO)利用成对音频比较微调模型,使输出与人类偏好对齐。

阶段一,先训练一个能用的视频配音扩散模型。这里有个关键设计——双路视频表征。以往的方法图省事,把视频所有帧丢进CLIP编码器,取个平均特征就完事。平均特征一出来,时间动态信息基本糊成一团:一个人从走到跑的动作,平均完可能看起来都差不多;一段鼓点密集的打击乐,平均完节奏信息全没了。

HarmoniDPO的做法是两条腿走路:一条腿用InternVid的视频编码器提取全局视频特征,负责把"这段视频整体在讲什么"的语义抓出来;另一条腿用CLIP图像编码器对均匀采样的250帧逐帧提取特征,负责保留"哪一秒发生了什么"的时间细节。两条特征投影到同一维度后拼在一起,再经过带旋转位置编码的自注意力层做融合——相当于把"大局观"和"细节控"绑在一块儿干活。

阶段二,也就是这次的重头戏——在线DPO对齐。既然重建损失不好使,那就干脆别用重建损失了,改用"偏好"来训练。具体操作是:让当前模型针对同一段视频生成N个候选音频,用一个由三个自动评估器组成的奖励函数给这些候选打分——CAV-MAE负责衡量音画对应关系,CLAP负责衡量音频与文本描述的一致性,Meta的Audiobox-Aesthetics预测器负责评估音频本身的质感。打分之后,最好的那个当"正样本",最差的那个当"负样本",喂给DPO损失做优化。

这里头还有个进阶设计叫Value-Aware DPO。普通DPO只关心"谁比谁好"这个排序关系,不关心好多少;Value-Aware DPO把正负样本的奖励差值也塞进损失函数里,让模型不光知道"这个更好",还知道"好了一大截"还是"只好了那么一丢丢",训练效率自然更高。

推理阶段还配套了一个测试时缩放策略Dual-scale Diffusion Search,用一大一小两种步长在潜空间里做探索,配合CLIP/CLAP打分做引导,进一步把输出往"人类爱听"的方向推一推。

HarmoniDPO模型结构图

图2 HarmoniDPO模型结构图。双特征表示框架:全局视频特征(InternVid编码器)与细粒度逐帧特征(CLIP图像编码器)互补,经投影融合后通过交叉注意力注入扩散模型的U-Net解码过程。

核心原理推导:从RLHF到在线DPO,偏好优化是怎么一步步挪到视频配音上的

要搞清楚HarmoniDPO的数学原理,得先回到RLHF的起点。传统RLHF要训练一个独立的奖励模型,再用强化学习(比如PPO)让生成策略去最大化奖励。这套流程在语言模型上效果很好,但工程实现极其繁琐——奖励模型要单独训,强化学习阶段要采样、要更新策略、还要防崩溃,一套组合拳下来,普通团队很难复现。

DPO的精妙之处在于,它证明了没必要绕这么大一圈:给定一个参考策略π_ref和一个最优策略π*,两者之间的比值可以直接表达奖励函数,即公式(16)——奖励被"重新参数化"成了策略比值的对数。这样一来,偏好优化问题就从"训练奖励模型+强化学习"两步走,简化成了"直接优化策略"一步到位。把公式(16)代入Bradley-Terry偏好模型,就得到了DPO的核心目标函数,如公式(18)所示——一个标准的二元分类损失,只不过分类对象是"哪个输出更受偏好"。

Online-DPO流程

图4 一次在线DPO训练流程示意。从VGGSound中采样视频子集,当前策略生成多个候选音频,经奖励函数自动打分后构造偏好对,用于微调整个模型。

标准DPO有个隐患——它是离线的。偏好数据提前收集好,训练过程中策略在变,但偏好数据不变,这就造成分布偏移:模型越训越好,生成的样本和旧偏好数据里的样本差距越来越大,优化信号逐渐失灵。

HarmoniDPO的解法是"在线"——不预设静态偏好数据集,而是在每轮训练迭代中,让当前策略实时生成候选音频,用自动奖励函数打分,当场构造偏好对。奖励函数是个加权的三维组合,如公式(19):音画对应分数、音频文本一致性分数、内在音质分数,三项归一化后加权求和。为了让模型对偏好幅度更敏感,HarmoniDPO进一步改造了DPO损失,在sigmoid内部额外减掉一项正负样本的奖励差值乘以系数λ,见公式(21)的VA-DPO损失,相当于把"偏好强度"这个连续信息也利用了起来。

视频条件音频生成流程

图3 视频条件音频生成流程。带噪潜变量z_T经过U-Net架构逐步去噪,融合后的视觉表征F_fused通过交叉注意力层注入去噪过程,最终由VAE解码器输出目标音频。文本条件通过FLAN-T5编码器提取,同样经交叉注意力注入。

数据准备及实验设计:VGGSound微调,AVSync15验证,四个维度全面评测

实验数据方面,训练用的是VGGSound数据集的标准划分。VGGSound含超过20万条视频片段、覆盖310个音频类别,是音视频学习领域的常用基准。微调阶段从VGGSound里独立同分布地采样了4500条视频用于在线DPO对齐,推理评测则同时覆盖VGGSound测试集和AVSync15数据集。AVSync15是专门用来刁难"音画同步"的测试集,里面的样本都是从VGGSound里挑出来最考验时间对齐能力的片段,一共150条,拿来验证同步能力再合适不过。

基础模型方面,HarmoniDPO没有从零开始训练扩散模型,而是直接用了预训练的文生音频模型Tango-2作为底座并保持冻结。视觉编码器用OpenCLIP ViT-H/14提取帧级特征,用InternVid上预训练的ViCLIP-L-14提取视频级特征。训练分两个阶段:阶段一只微调新加入的投影层和交叉注意力层,把文生音频模型改造成视频配音模型;阶段二用在线DPO对整个模型做端到端微调。训练用了64块H800 GPU,AdamW优化器,学习率恒定1×10⁻⁴,批大小128。

评测指标一共六个:MKL衡量生成音频与真实音频的分布相似度,CLIP相似度衡量音画语义一致性,FID和FAD衡量生成音频的整体保真度与分布质量,CLAP相似度衡量音频与文本的对齐程度,Onset Acc和Onset AP专门用来评测音画时间同步的准确性。对比的基线方法包括SpecVQGAN、Diff-Foley、V2A-Mapper、Seeing-and-hearing和FoleyCrafter,都是近年视频配音领域有代表性的方法。

为了保证公平,和只使用视觉输入的基线对比时,HarmoniDPO也关闭了文本条件,纯靠视频特征生成音频,不占多模态输入的便宜。这一点在对比实验中执行得很干净。

视频生成音频,为何如此困难?

视频转音频看起来是个顺理成章的任务:画面里有啥就配啥声呗。但真上手做过的同学都知道,这个任务简直是个"既要又要还要"的修罗场。
先看同步性。视频是时间线上的视觉事件序列,音频必须跟画面里的动作精确对齐:敲击声必须落在手落下的那一帧,脚步声必须踩在脚掌触地的瞬间。差个几十毫秒,观众的耳朵马上就能察觉不对劲。
再看语义对应。画面里一个人倒水,是倒进玻璃杯的清脆碰撞,还是倒进马克杯的沉闷低响?画面里一条狗跑过来,是爪子敲击木地板的哒哒声,还是踩在草地上的沙沙声?同一个视觉场景,对应着无穷多种合理的声音可能性。这种一对多的映射关系,让单纯的监督学习非常尴尬——训练时拿一条"标准答案"音频去对齐,模型学到的只是"某一种"合理的映射,而不是"人类觉得好"的映射。
问题的根源在于训练目标。过去的主流方法,不管是基于Transformer的自回归模型还是扩散模型,核心损失基本都是L1或者L2重建损失,就是让生成结果跟真实音频在数值上尽量接近。可这里面有个致命的逻辑漏洞:重建损失假设"真实音频是唯一正确答案",但视频到音频本质上是个一对多的问题,真实音频只是众多可行解之一。让模型去逼近一个未必最优的参考目标,最后得到的音频往往是"指标上对齐了,听感上却差了意思"。
打个比方。让一个学画画的人照着照片画一只猫,照片里的猫是橘色的、趴着的、背景是沙发的。你让模型拿L2损失去拟合这张照片,它学到的是"这只猫长这样";但人类的审美偏好可能是"这猫的神情更灵动",或者"这猫的姿态更有趣"。重建损失只能保证"画得像",保证不了"画得好"。HarmoniDPO的出发点正是要解决这个问题——不跟参考音频死磕数值,而是直接优化人类偏好。

双视频表征:全局与细节的完美结合

要做视频配音,第一步得先把视频"看懂"。这里的"看懂"包含两个层次:一是这段视频整体在讲什么——是海边漫步还是城市街头,是厨房做饭还是工厂作业;二是视频里每一时刻发生了什么——手抬起来了、刀落下了、水倒出来了。前者是全局语义,后者是时间细节,两者缺一不可。
之前的方法大多图省事,把视频所有帧丢进CLIP图像编码器,然后取个平均特征。平均完的结果就好比把一整部电影压缩成一张静态海报——信息还在,但时间维度被抹平了。模型知道"这是海边",但不知道"浪打过来的瞬间"到底该配什么声。
HarmoniDPO的做法是双路并行。第一路用InternVid的视频编码器提取全局视频特征,负责捕捉整个视频的语义内容和运动模式。InternVid是在大规模视频-文本对上做对比预训练的模型,它比纯图像模型更懂视频里的时间动态。第二路用CLIP图像编码器对均匀采样的帧逐帧提取特征,保留"哪一秒发生了什么"的精细信息。两条路的特征投影到同一维度后拼接,再经过带旋转位置编码(RoPE)的多头自注意力层做融合——相当于把"大局观"和"细节控"绑在一块儿干活。
全局视频特征提取公式
全局视频特征计算公式:输入视频V经过InternVid视频编码器,输出维度为d_g的全局特征向量。
帧级特征提取公式
帧级特征提取公式:均匀采样N帧,每帧经CLIP图像编码器得到维度为d_f的特征向量。实现中N取250,不足250帧的视频用零向量补齐。
特征融合的具体流程是:先把全局特征f_g和逐帧特征e_i分别经过可学习的投影矩阵W_g和W_f,投影到公共维度d_c,然后拼接成一个长度为N+1的序列。这个序列再经过一个投影层W_h变换到模型隐藏维度d_h,最后送入带RoPE的多头自注意力层。RoPE的作用是让模型感知帧与帧之间的相对位置关系——第5帧和第50帧的"距离感"不一样,这对时序敏感的音频生成至关重要。
特征拼接公式
特征拼接:全局特征与N个帧级特征拼接成一个序列,作为后续注意力融合的输入。
融合后的表征通过交叉注意力机制注入扩散模型的U-Net解码过程,让去噪网络在每一步生成时都能"看到"视频的内容和节奏。模型的底座是预训练的文生音频模型Tango-2,整个训练过程中保持冻结,只微调新加入的投影层、自注意力层和交叉注意力层。这样既省算力,又保留了文生音频模型已经学会的音频先验。

在线偏好优化:让AI学会"听"出好坏

双视频表征解决了"看懂视频"的问题,但"HarmoniDPO最终要解决的是'什么声音更好听'"这个更主观的问题。这就要请出这次工作的重头戏——在线直接偏好优化(Online Direct Preference Optimization,简称online-DPO)。
这套方法的思路源自大语言模型领域的RLHF(基于人类反馈的强化学习)。传统RLHF的流程是:先训练一个奖励模型来模拟人类偏好,再用强化学习算法(比如PPO)让生成策略去最大化奖励。这套流程在语言模型上效果显著,但工程实现非常繁琐——奖励模型要单独训练,强化学习阶段要采样、要更新策略、还要担心策略崩溃,一套组合拳下来劝退不少团队。
DPO(直接偏好优化)的贡献在于证明了没必要绕这么大一圈。给定一个参考策略π_ref和一个最优策略π*,两者之间的比值可以直接表达奖励函数。换句话说,奖励被"重新参数化"成了策略比值的对数形式,偏好优化就从"训练奖励模型+强化学习"两步走,简化成了"直接优化策略"一步到位。
最优策略闭式解公式
RLHF中的最优策略闭式解:在KL散度约束下,最优策略π*正比于参考策略π_ref乘以奖励的指数形式,Z(v)是配分函数,β是控制偏离参考策略程度的温度系数。
奖励重参数化公式
奖励重参数化:把奖励函数r(v,a)写成策略比值取对数的形式,偏好优化就变成了直接优化策略本身。
HarmoniDPO在此基础上更进一步,提出了"在线"版本的DPO。标准DPO有个先天缺陷:偏好数据是预先收集好的静态数据集,训练过程中策略在变,但偏好数据不变,这会造成分布偏移——模型越训越好,生成的样本和旧偏好数据里的样本差距越来越大,优化信号逐渐失灵。
HarmoniDPO的解法是:不预设静态偏好数据集,而是在每一轮训练迭代中,让当前策略实时生成多个候选音频,用一个自动奖励函数打分,当场构造偏好对。这个奖励函数是个加权三维组合,分别衡量音画对应关系、文本一致性、内在音质三个维度:
奖励函数组合公式
奖励函数R(y)由三个归一化子分数加权求和:R'_av是音画对应分数(用CAV-MAE评估),R'_at是音频-文本一致性分数(用CLAP评估),R'_quality是内在音质分数(用Audiobox-Aesthetics预测器评估)。
打分之后,奖励最高的候选当"正样本",奖励最低的当"负样本",喂给DPO损失做优化。这里头还有个进阶设计叫Value-Aware DPO(价值感知DPO)。普通DPO只关心"谁比谁好"这个排序关系,不关心好多少;Value-Aware DPO把正负样本的奖励差值乘以系数λ塞进损失函数里,让模型不光知道"这个更好",还知道"好了一大截"还是"只好了那么一丢丢",训练效率自然更高。
整个流程在论文里表述为:训练过程中,模型就是那个"品鉴师",同时也是那个"创作者"。它先创作一批作品,自己打分,然后学着去创作更符合自己审美的作品。这跟人类艺术家的成长路径有点像——先学会分辨好坏,才能创作出好东西。

双尺度扩散搜索:推理时的质量提升器

训练阶段的偏好优化让模型学会了"什么是好的",但推理阶段还有潜力可挖。HarmoniDPO另外设计了一个测试时缩放策略,叫Dual-scale Diffusion Search(双尺度扩散搜索,简称DDS)。
这个想法源自文生图领域的一个观察:扩散模型在推理时如果做更多次采样搜索,往往能找到质量更高的结果。但盲目增加采样次数效率太低,HarmoniDPO的做法是用一大一小两种步长在潜空间里做探索——大步长负责全局搜索,快速扫过大面积区域寻找有潜力的方向;小步长负责局部精修,在找到的好区域里慢慢打磨细节。
小步长采样公式
小步长采样:x_s由当前状态x按系数β_s扰动得到,β_s较小,适合局部精修。
大步长采样公式
大步长采样:x_l由系数β_l扰动得到,β_l较大,适合全局探索。
每次搜索后,用CLIP/CLAP打分作为引导信号,保留分数更高的样本,继续下一轮迭代。这个策略有点类似"模拟退火"的思想:前期允许大步跳跃避免陷入局部最优,后期缩小步长收敛到精细区域。论文里的消融实验显示,DDS确实能带来稳定的性能提升,而且计算开销相对可控。

实验结果:全面超越现有方法

说完了方法,来看硬核的实验结果。评测数据集用的是VGGSound和AVSync15这两个视频配音领域的标准benchmark,指标覆盖六个维度:MKL衡量音频分布相似度,CLIP相似度衡量音画语义一致性,FID和FAD衡量生成保真度,CLAP相似度衡量音频文本对齐程度,Onset Acc和Onset AP衡量音画时间同步。对比的基线方法包括SpecVQGAN、Diff-Foley、V2A-Mapper、Seeing-and-hearing和FoleyCrafter。
表1 VGGSound数据集结果对比
表1 VGGSound测试集上的结果对比。HarmoniDPO在MKL、CLIP相似度、FID、FAD、CLAP相似度等多个指标上全面领先。值得注意的是,HarmoniDPO仅用了4500条视频做微调,就超过了用全量数据训练的基线方法,数据效率十分突出。
表2 AVSync15数据集结果对比
表2 AVSync15数据集上的对比结果。AVSync15专门考验音画同步能力,HarmoniDPO在Onset Acc、Onset AP和FID上均取得最优成绩,验证了双视频表征+偏好优化在时间对齐方面的优势。
为了排除DDS推理策略带来的干扰,论文还单独报告了不使用DDS的结果。即使去掉这个推理阶段的"外挂",HarmoniDPO的表现依然优于所有基线方法,说明性能提升主要来自模型本身和偏好优化的贡献。
表4 VGGSound数据集无DDS结果对比
表4 不使用DDS时在VGGSound上的结果。模型本身的能力已经足够强,DDS属于锦上添花。
图5 用户评估分数对比
图5 不同候选数下的用户评估分数。OVL代表整体质量,REL代表音画相关性,AVG是两者的平均。结果显示候选数为8时效果最佳。
论文还做了消融研究来验证各个模块的贡献。一个关键的消融是:把InternVid全局特征替换成CLIP平均特征,性能出现明显下降,直接验证了"双路表征优于单路平均"的核心假设。另外,训练时用图像帧条件代替视频特征,音画同步指标也会明显恶化,说明视频级别的时序建模确实不可或缺。
表5 视频特征消融对比
表5 视频特征来源消融:InternVid视频特征带来的性能提升明显优于CLIP平均特征,验证了全局时序建模的价值。
图6 频谱图对比分析
图6 在线DPO微调前后的频谱图对比。可以看到,经过偏好优化后,环境噪声被有效抑制,中频段响应得到优化,人声清晰度显著提升。
图7 文本条件可视化
图7 文本条件控制的可视化结果。对同一段视频分别给定"talking"(说话)、"pouring"(倒水)、"pouring milk to a cup"(往杯子里倒牛奶)三个文本提示,生成的音频频谱差异明显,说明文本条件能够对生成内容进行精细控制。
综合各项指标来看,HarmoniDPO在VGGSound和AVSync15两个数据集上都取得了全面领先的成绩。尤其值得注意的是,它只用4500条视频微调就超过了用全量数据训练的基线模型,说明偏好优化在数据效率上具有显著优势。不过也要注意,目前的优势主要是在自动评估指标上,主观听感评测的样本量相对有限,结论的普适性还有待更大规模的人工评测验证。

龙迷三问

下面是龙哥对于大家可能的一些问题的解答:
这篇论文到底在解决什么问题?HarmoniDPO首次将偏好优化引入视频到音频生成,用在线DPO替代传统重建损失,结合全局+帧级双路视频表征,音画同步与主观听感全面超过SOTA。
这篇工作最值得看的点是什么?在VGGSound和AVSync15数据集上,HarmoniDPO在所有指标上均优于现有方法。在VGGSound上,MKL从2.56降至1.82,CLIP从10.70提升至13.65,FID从19.67降至6.42;在AVSync15上,Onset ACC达到32.53,Onset AP达到69.97,均显著优于基线方法。
这篇工作的边界或风险在哪里?优点:(1)首次将偏好优化引入V2A任务,创新性强;(2)双视频表征有效保留时间动态和语义细节;(3)在线DPO避免了离线方法的分布偏移问题;(4)DDS推理时优化进一步提升质量。缺点:(1)依赖多个预训练模型(InternVid、CLIP、FLAN-T5、Tango-2),系统复杂度高;(2)奖励模型使用自动化指标近似人类偏好,可能与真实人类判断存在偏差;(3)训练需要大量计算资源(64块H800)。
如果你还有哪些想要了解的,欢迎在评论区留言或者讨论~

龙哥点评

论文创新性分数:★★★★☆

首次将在线DPO引入视频生成音频任务,双视频表征和推理时搜索策略都有新意,但整体框架仍基于已有扩散模型架构,创新点属于"组合式创新"而非"从0到1"。

实验合理度:★★★★☆

实验设计较为完备,覆盖两个数据集、多个基线和充分的消融研究,且公平地移除了文本条件进行纯视觉对比。但主观听感评测的样本量相对有限,用户研究维度不够丰富。

学术研究价值:★★★★☆

为视频生成音频领域打开了"偏好优化"这个新方向,对后续研究有较强的启发意义,特别是"自动奖励函数+在线DPO"的组合范式可能被迁移到其他多模态生成任务。

稳定性:★★★☆☆

在标准数据集上表现稳定,但自动奖励函数的可靠性是关键风险点——评估器本身的偏差可能被DPO放大。需要更多跨场景、跨领域的测试来验证稳定性。

适应性以及泛化能力:★★★☆☆

主要在中英文通用场景的视频上验证,对特殊领域(如音乐、体育赛事、动物叫声)的泛化能力尚未充分证明。对250帧的固定采样也可能在长视频场景下丢失信息。

硬件需求及成本:★★★☆☆

训练阶段需要64块H800 GPU,成本不低。推理阶段DDS需要多次采样搜索,增加了计算开销。好在基础模型Tango-2是冻结的,微调参数量有限,推理时也可以关闭DDS换取速度。

复现难度:★★★☆☆

论文未提供官方代码,但方法描述比较详细,基础组件(Tango-2、InternVid、CLIP)都是公开可得的。主要复现门槛在于大规模GPU集群和数据处理流程的搭建。

产品化成熟度:★★★☆☆

技术在电影配音辅助、短视频后期、游戏音效生成等场景有应用潜力,但目前的推理速度和多步搜索机制还达不到实时处理的要求,更适合离线批量生成的场景。

可能的问题:

自动奖励函数由三个预训练评估器加权组合,评估器本身在不同领域有偏好偏差,可能导致模型过度拟合评估器口味而偏离真实人类喜好。"在线"DPO依赖自动构造偏好对,缺乏真正的人类反馈闭环,长期看可能存在奖励黑客(reward hacking)风险。

主要参考文献

[1] Peng W, Zhang K. HarmoniDPO: Video-guided Audio Generation via Preference-Optimized Diffusion[J]. arXiv preprint arXiv:2608.11913, 2026.
[2] Rafailov R, Sharma A, Mitchell E, et al. Direct preference optimization: Your language model is secretly a reward model[J]. NeurIPS, 2023.

*本文仅代表个人理解及观点,不构成任何论文审核或者项目落地推荐意见,具体以相关组织评审结果为准。欢迎就论文内容交流探讨,理性发言哦~ 想了解更多原文细节的小伙伴,可以点击"阅读原文",查看更多原论文细节哦!       

转发文章 微博 X LinkedIn Facebook
龙哥读论文 · PaperDaily

本文基于龙哥读论文 PaperDaily 数据库整理,结合论文原文与工程视角进行解读。

LONGGE AI COMMUNITY

把每天读到的论文,变成长期积累

加入「龙哥读论文」知识星球,持续获取 AI 论文、资讯、开源项目、招聘与研究思路。

加入龙哥读论文微信群:添加微信 kangjinlonghelper,备注“研究方向 + 地点 + 学校/公司 + 昵称”。

龙哥读论文知识星球二维码 微信扫码加入知识星球