← 返回 PaperDaily 视觉与图像

视频阴影去除新SOTA!杭电等高校新方法,0.82dB领先

夏天在景区拍照,最难缠的不是人潮,而是地上那道怎么躲都躲不开的影子。照片还能靠后期硬修,一到视频里影子跟着物体动起来,简直是在考验修图师的心脏。今天这篇AAAI 2027论文《WildShadowRemover》,把“去除视频阴影”这件事直接交给视频扩散模型来搞定。看完只能说一句:还是让模型去扛吧,人眼真的看不过来。

图1:本方法在野外视频中有效去除复杂阴影,输入带影视频(上排),输出无影结果(下排),同时保持场景细节和帧间时间一致性。

视频阴影去除为什么难?从“影子”说起

光影是摄影的灵魂,这话在创作里没毛病,但在计算机视觉里,影子却是公认的刺头。阴影是光线被物体遮挡后形成的暗区域,看似普普通通,却给目标跟踪、三维重建、图像编辑等任务带来极大困扰。把“影子”干净利落地去掉,也不是简单提亮暗部那么简单,而是要恢复被阴影扭曲的纹理、颜色和光照信息,让区域看起来就像“从未被遮过”一样。
单图去影领域已经积累了非常多的经验:早期有基于卷积神经网络的DeshadowNet、方向感知网络,后来有ShadowFormer、HomoFormer这类Transformer架构,再往后还有融合语义与几何信息的OmniSR、ShadowRefiner,以及引入扩散模型的ShadowDiffusion、DeS3、StableShadowRemoval。然而,这些方法大多是给单张照片“做手术”,到了视频场景,问题一下子就变了。
为什么视频去影难这么多?关键在三个词:时间一致性、动态场景、光照变化。影子和物体是联动的——车开过去,影子跟着移动;树叶晃动,地上的碎影像水波一样跳来跳去。如果用单图模型逐帧去影再拼起来,会出现闪烁、亮度跳变、边缘抖动等一连串问题,观众一眼就能看出“这视频动过手脚”。
更棘手的是训练数据。早年的ISTD、SRD等数据集几乎都在受控环境下拍摄,场景固定、光源单一;后来OmniSR和Infinigen虽然用物理渲染生成了更高质量的数据,但主要盯室内。到城市街道、无人机航拍、自然风光这类“野外”环境,模型基本处于“裸奔”状态。论文作者在这点上看得挺准:视频阴影去除的真正瓶颈,不是网络花样不够多,而是泛化能力跟不上。
具体来说,视频阴影去除任务与单图去影存在本质差异。单图去影只需要考虑空间维度上的信息,模型可以借助全局上下文、语义分割结果甚至用户交互来定位阴影区域并恢复其下的纹理。但视频去影必须同时处理空间和时间两个维度:空间上要准确识别每一帧中阴影的边界和强度,时间上要保证阴影区域在帧与帧之间的过渡平滑自然。这种双重约束使得简单地将单图模型逐帧应用成为不可行的方案,因为每一帧独立处理时,模型无法感知到相邻帧中同一阴影区域的变化趋势,导致输出结果在时间轴上出现不连续的跳变。
此外,视频中的阴影往往伴随着复杂的运动模式。例如,当一个人走过路灯下方时,他的影子会在地面上拉长、缩短、旋转,甚至分裂成多个部分。这种动态变化要求模型具备对物理规律的基本理解——知道影子是如何随光源位置、物体姿态和地面几何形状而变化的。传统的单图模型缺乏这种时序推理能力,它们只能根据当前帧的静态信息做出判断,无法利用前后帧的上下文来推断阴影区域的真实外观。
光照条件的变化也是视频去影的一大挑战。在自然场景中,太阳角度、云层遮挡、周围物体反射等因素都会导致光照强度在短时间内发生显著变化。这些变化不仅影响阴影的明暗程度,还会改变阴影边缘的柔和度。例如,在阴天条件下,阴影边缘通常较为模糊,而在晴天直射光下,阴影边缘则非常锐利。模型需要能够适应这种光照条件的动态变化,而不是仅仅学习一种固定的阴影模式。

核心思路:冻结视频扩散模型+LoRA微调

既然单图方法搞不定时间一致性,那就直接从“懂视频”的模型出发。论文选用了Wan模型的Wan-Control变体作为底座。这里先补个概念:视频扩散模型(Video Diffusion Model,VDM)是近两年视频生成领域的主力军,它在海量视频上学过物体怎么运动、光线怎么变化、影子怎么跟着物体走,这意味着它天生拥有时空上下文的理解能力。
Wan-Control内部有两个关键部件:视频VAE和扩散Transformer(DiT)。视频VAE负责把视频压缩到潜空间,再解码回像素空间;DiT则在潜空间里学习条件速度场,是当前视频扩散模型的标配结构。Wan-Control原本支持RGB视频和深度视频双条件控制,论文只改了条件来源,把“文生视频/图生视频”变成“带影视频到无影视频的翻译”。
但直接微调整个视频扩散模型,计算量爆炸先不说,最怕的是把预训练模型里对世界运转规律的宝贵先验给“冲”没了。于是论文采用LoRA(Low-Rank Adaptation,低秩自适应)做参数高效微调。LoRA的核心思想是用低秩矩阵来近似模型权重更新量,每一层只需训练几个小矩阵,就能达到接近全量微调的效果,参数极少,还几乎不破坏原有知识。
具体流程是:输入带影视频X,用Depth Anything 3(DA3)从视频中逐帧估计出单目深度视频D。这里值得多说一句,DA3是一个强大的单目深度估计基础模型,输出的深度图能提示模型哪里是墙、哪里是地、物体离光源有多远,相当于给模型发了一张几何“地图”。阴影的形成与三维几何高度相关,有了深度先验,模型在复杂光照下能更可靠地区分真正的阴影区域和原本就暗的表面。
X和D经过冻结的视频VAE编码器,得到潜变量Zx和Zd。训练时目标无影视频Y也被编码为Zy,用来构造扩散训练目标。论文用的是流匹配(Flow Matching)范式:在噪声潜变量与目标潜变量之间做线性插值,让模型预测速度场。
形式化地看,给定插值路径Zₜ=(1−t)ε+tZᵧ,目标速度就是Vₜ=∂Zₜ/∂t=Zᵧ−ε。DiT网络以拼接后的条件作为输入,预测速度,再用最简单的均方误差做监督。所有预训练组件保持冻结,只有插在注意力投影层和FFN层中的LoRA适配器被更新,LoRA秩和缩放因子均设为64。整个训练分两个阶段:第一阶段让DiT学会潜空间里去影,第二阶段再冻结DiT、特训细节注入部分。训练用4张RTX 4090,这在视频扩散模型里属于相当克制的配置。
选择Wan-Control作为底座还有一层考虑:它本身支持深度条件输入,这意味着模型在预训练阶段就已经学会了如何利用深度信息来指导视频生成。论文将这一特性迁移到去影任务中,使得深度先验的引入更加自然,不需要额外的适配层。同时,Wan模型在视频生成领域已经展现出较强的时序建模能力,这为去影任务中的时间一致性提供了有力保障。
LoRA微调的具体实现也值得展开。在DiT的每个注意力层中,查询(Q)、键(K)、值(V)投影矩阵和输出投影矩阵都插入了LoRA适配器;在前馈网络(FFN)的两个线性层中也同样插入了LoRA适配器。每个LoRA适配器由一个低秩矩阵A(维度为输入维度×秩)和一个低秩矩阵B(维度为秩×输出维度)组成,前向计算时输出为原始输出加上AB的乘积乘以缩放因子。这种设计使得新增参数量仅占模型总参数量的很小比例,却能在特定任务上实现显著的性能提升。
图2:本方法框架总览。潜空间视频扩散模型预测粗去影结果,随后通过阴影掩码引导的细节注入模块进行细节恢复。红色箭头标注了放大区域,用于展示最终输出在细节保持方面的改进。

细节注入新招:频率分解调制如何聪明去影

扩散模型去影后有一个常见副作用:影子确实是没了,但纹理细节也跟着“蒸发”了。木板的纹路、布料的纤维、树叶的脉络全都糊成一团。如果直接把原始输入视频的编码器特征灌回解码器,又容易把阴影的残留信息一股脑“请”回来——因为在特征空间里,阴影和纹理纠缠得非常紧密。
论文的解法很有讲究,拆成三步走。

第一步:估计软阴影掩码。把输入带影视频X和粗去影结果做一个像素级相除,M=1−X/(Ŷ₀+ε),得到每个位置阴影贡献的软概率。这个掩码不需要任何外部标注,完全从数据中自监督生成。

第二步:频率分解调制。论文提出了一个频率分解调制(Frequency-Decomposed Modulation,FDM)模块。核心洞察在于:阴影主要影响低频光照成分,而纹理细节主要体现在高频信息里。FDM先用一个固定的通道级5×5均值滤波把特征拆成高频分量和低频分量,然后让软掩码通过一个小型调制网络,预测两组独立的仿射参数:低频频带的缩放与偏移、高频频带的缩放与偏移。低频被适度抑制,用来压制光照伪影;高频被选择性地增强,用来恢复纹理细节。这比起全频带一刀切的注入方式,精细了不止一个档次。

第三步:深度特征融合与冷启动门控。解码器每一层里,解码器特征与对应编码器特征拼接后先过FDM,再和经过1×1卷积投影的DA3深度特征拼在一起,送进RRDB模块做特征聚合。RRDB(Residual in Residual Dense Block)是ESRGAN中常用的残差密集块,擅长在保持稳定训练的同时恢复精细结构。最后,输出再经过一次FDM,并通过一个可学习的通道级门控权重wᵢ逐通道调整,以残差形式注回冻结的解码器主干。这个门控初始化为0,意味着刚开始时注入模块完全不干预解码器,随着训练推进逐步“打开”,这种渐进式冷启动能最大限度保护预训练的生成先验。

整套细节注入模块只有约4294万可训练参数,放在视频任务里算是非常轻量。
FDM模块的设计思路可以从信号处理的角度来理解。在自然图像中,阴影通常表现为大面积的亮度降低,这种变化在频域上主要集中于低频分量。而纹理细节,如木纹、织物纤维、树叶脉络等,则对应着高频分量。通过将特征分解为低频和高频两个部分,FDM能够针对性地处理这两类信息:对低频分量进行抑制以减少阴影带来的光照不均匀性,对高频分量进行增强以保留和恢复细节。这种频率层面的解耦操作,比直接在原始特征空间中进行调制更加精细和有效。
调制网络本身是一个轻量级的卷积网络,输入是软阴影掩码M,输出是两组仿射参数(γ_low, β_low)和(γ_high, β_high)。这些参数分别作用于低频特征和高频特征,实现通道级的缩放和偏移。值得注意的是,调制网络的设计使得不同空间位置的调制强度不同——阴影区域内的低频分量会被更强地抑制,而非阴影区域则几乎不受影响。这种空间自适应的特性,使得FDM能够精准地处理阴影区域,同时保持非阴影区域的原始外观。
冷启动门控机制也是细节注入模块中的一个巧妙设计。在训练初期,门控权重wᵢ被初始化为0,这意味着细节注入模块的输出不会对解码器产生任何影响,模型完全依靠预训练的视频扩散模型进行去影。随着训练的进行,门控权重逐渐增大,细节注入模块开始逐步参与解码过程。这种渐进式的引入方式避免了在训练初期由于注入模块尚未收敛而对预训练模型造成干扰,确保了训练的稳定性和最终效果。

WildShadow数据集:大规模多场景合成视频阴影去除基准

数据是这篇论文的另一大贡献。现有视频去影数据集规模小且部分未开源,论文干脆自建了一个大规模合成视频阴影去除数据集WildShadow,覆盖室内、城市户外、自然户外三大类场景。
室内场景用3D-FRONT模型库渲染,并且跟随OmniSR的渲染协议处理间接光照。城市户外场景用iCity这款Blender插件生成,模拟真实街道建筑、路面材质和路灯布置。自然户外场景则交给Infinigen程序化生成,山川、河流、森林应有尽有。影子由直接光照投射,无影真值就是把直接光的阴影去除后的渲染结果。每个视频片段包含21到60帧连续画面,影子与无影真值逐帧严格对齐。
图3:WildShadow数据及示例。每行展示成对带影输入与无影真值视频中的两个代表帧。
训练集总共包含6100个视频片段:3D-FRONT有4500条,iCity有900条,Infinigen有700条;测试集对应400、100、100条。此外,论文还从HSSD高仿真室内场景库单独渲染了50条视频,只用于测试,专门考察模型的跨域泛化能力。熟悉数据集构建的读者应该能感觉到,这个数据规模在视频去影领域算是很诚意了。
数据集的构建过程也体现了论文作者对数据质量的重视。在3D-FRONT室内场景中,作者遵循OmniSR的渲染协议,确保间接光照的处理方式与现有工作保持一致,这样不同方法之间的比较才具有公平性。iCity城市户外场景则通过Blender插件精确模拟了街道建筑、路面材质和路灯布置,使得生成的阴影具有真实世界的几何和光照特征。Infinigen程序化生成的自然场景则提供了丰富的地形和植被变化,为模型提供了多样化的训练样本。
每个视频片段的帧数从21到60不等,这种长度变化有助于模型学习不同时间跨度的阴影运动模式。较短的片段适合学习快速的阴影变化,而较长的片段则能捕捉更复杂的阴影演变过程。逐帧严格对齐的带影输入和无影真值,为训练提供了精确的监督信号,使得模型能够学习到像素级别的阴影去除映射。
HSSD测试集的引入是数据集设计中的一个亮点。HSSD是一个高仿真室内场景库,其渲染质量远高于3D-FRONT。将HSSD作为测试集,可以有效地评估模型在更高质量渲染数据上的泛化能力。如果模型在HSSD上也能取得良好的去影效果,说明模型学习到的不是特定渲染引擎的伪影,而是通用的阴影去除能力。

结果一览:图像基准、跨域泛化与真实世界视频效果

论文实验做得很扎实,图像任务、跨域泛化、真实世界视频、视频基准和消融实验全部覆盖。先来看图像基准上的表现。
在ISTD+、SRD、INS和自建的WildShadow-I四个基准上,论文方法在ISTD+和SRD上与专门的图像方法保持同一水平;在INS上达到31.06 dB PSNR和0.977 SSIM,超过所有对比方法。INS包含直接光和间接光混合的复杂室内场景,这个成绩说明潜空间扩散先验加几何引导确实能扛住复杂光照。在WildShadow-I上,相比第二好的OmniSR,PSNR提升0.82 dB,SSIM提升0.016。由于WildShadow-I上所有方法都在同一协议下重新训练和评估,这个提升是干净可信的。
表1:公共基准与WildShadow-I的定量比较。加粗为最优,下划线为次优。
跨域泛化是这篇论文最想展示的部分。论文把测试集拆成室内(INS+HSSD)和室外(iCity+Infinigen),分别比较只用室内数据训练和多域数据训练的效果。只拿INS训练时,室外PSNR跌到18.82 dB,真是“室内龙、室外虫”;加入iCity和Infinigen后,户外PSNR一跃到了27.51 dB,室内性能还基本不掉,整体从26.47 dB提升到29.28 dB。这个对比说明,跨越场景域的数据多样性对泛化的贡献比模型结构本身更明显。
表2:不同训练域设置下的室内和室外评估。室内由HSSD和INS组成,室外由iCity和Infinigen组成。
真实世界场景的定性对比更直观。论文在DL3DV真实视频和自拍无人机航拍视频上做了测试,没有真值可以量化,只能靠肉眼判断残影、亮度一致性和结构保持。OmniSR、StableSR、PhaSR在复杂场景下都留下明显暗区或亮度断层;本方法第一阶段就消掉了主要阴影,再经过细节注入模块,边界更锐利、纹理还在,整体观感自然很多。
图4:INS、HSSD和iCity上的定性比较。所有方法统一在WildShadow-I训练集上训练,本方法在去影更干净的同时保持颜色一致性和细粒度细节。红色箭头标出去影更彻底的区域。
图5:真实世界DL3DV视频与自拍无人机视频上的定性比较,不设无影真值参考。
视频基准上,论文对比了图像方法OmniSR逐帧推理、本方法逐帧变体和本方法视频模型三个设置,引入了时间翘曲误差Ewarp来衡量帧间运动补偿误差。视频模型达到30.802 dB PSNR、0.9655 SSIM,Ewarp降到1.775,显著低于逐帧版本。这说明视频模型确实学到了“影子跟着物体走”的动态规律,而不只是把每帧当孤岛处理。
表4:视频阴影去除基准的定量比较。图像基线方法采用逐帧推理方式评估。Ewarp为时间翘曲误差,数值越小越好。
消融实验也把每个组件的贡献量化得很清楚。去掉细节注入模块,PSNR直接掉0.62 dB,SSIM掉0.015,是最大的单项损失;去掉深度条件掉0.18 dB;去掉DA3特征掉0.13 dB;去掉掩码频率调制掉0.12 dB。这组数据清晰说明,视频扩散先验负责“粗去影”,细节注入负责“精装修”,深度先验则是在复杂光照下给模型兜底。
表3:本方法各组件的消融实验。
这里也说句公道话。结合PaperDaily已收录论文可观察到,INS这类室内复杂光照基准上,各家方法的结果往往与训练协议、测试分辨率强相关,目前已有资料里暂时没有同一split下的独立复现数值可供直接比较。因此更稳妥的解读是:本方法在报告设置下的表现有竞争力,但不宜简单宣称“全面碾压”。读者如果要拿这篇方法和别家模型做对比,最好先对齐数据划分和评价协议,再谈谁高谁低。
speechless表情

龙迷三问

下面是龙哥对大家可能的一些问题的解答:

问题一:为什么单图阴影去除方法不能直接用于视频?单图方法逐帧处理时完全忽略了帧间信息,影子在相邻帧之间是连续移动的,单帧结果拼起来会出现闪烁、亮度跳变和边缘抖动。视频扩散模型在海量视频上预训练,隐式掌握了“物体—影子”的时空关联,因此能生成时间一致的干净视频。论文实验结果也验证了这一点:帧间翘曲误差Ewarp从逐帧的2.2左右降到视频模型的1.775。

问题二:论文中的频率分解调制FDM到底是怎么做的?FDM先把特征图用固定的通道级5×5均值滤波拆成低频和高频两部分,再用阴影掩码通过一个小型调制网络分别预测高/低频各自的缩放γ和偏移β参数,然后对低频和高频分量独立做仿射调制。低频被适当抑制以去除光照类伪影,高频被选择性增强以恢复纹理,最终合并得到调制后的特征。比起不区分频带直接全量注入的做法,这种处理更不容易把影子伪影重新带回来。

问题三:为什么深度先验对去影有帮助?阴影的形成强烈依赖三维几何——物体遮挡关系、离地面多远、光源方位等都会影响影子的形态。Depth Anything 3给出的深度图提供了几何线索,让模型在光线复杂、遮挡严重的区域也能更可靠地判断哪里是真正的阴影区,而不是单纯按亮度一刀切。消融实验显示去掉深度条件PSNR下降了0.18 dB,去掉DA3特征又额外下降0.13 dB,说明几何信息确实在起作用。

问题四:论文方法在推理时速度如何?由于需要运行完整的视频扩散模型进行迭代去噪,推理速度相对较慢。在单张RTX 4090上处理一个约3秒、分辨率为256×256的视频片段,大约需要数十秒到数分钟不等,具体取决于采样步数。这一速度显然无法满足实时处理的需求,但对于离线视频编辑和后期制作场景来说是可以接受的。论文作者也提到,未来可以通过减少采样步数、使用蒸馏技术或更高效的扩散模型架构来加速推理。

如果你还有哪些想要了解的,欢迎在评论区留言或者讨论~

龙哥点评

论文创新性分数:★★★★☆

把预训练视频扩散模型引入野外视频去影任务,配合掩码引导的频率分解注入和几何先验,整体思路主线清晰,不是纯调参式创新。

实验合理度:★★★★☆

公共基准、跨域泛化、真实世界视频、视频基准、消融实验五件套齐全,多域训练实验尤其有说服力;遗憾是缺少用户研究或主观评分支撑“感知质量”的论述。

学术研究价值:★★★★☆

首次系统性验证了视频扩散模型在野外视频去影中的价值,WildShadow数据集有望成为后续视频去影研究的公共基准,为领域提供一个可复现的起点。

稳定性:★★★☆☆

在合成数据和展示的真实场景上表现稳定,但论文承认密集树叶、薄结构等复杂几何仍会翻车;视频推理的资源开销也决定了它目前很难做到实时稳定输出。

适应性以及泛化能力:★★★★☆

室内、城市、自然多域覆盖,真实DL3DV和无人机航拍也有不错定性表现;主要短板是依赖DA3等外部模型,深度估计一旦出错,去影质量会跟着受损。

硬件需求及成本:★★★☆☆

训练用4张RTX 4090,LoRA参数少,相对大模型全量微调属于中等成本;推理阶段要跑完整视频扩散模型并处理VAE编解码,消费级显卡实时性不必奢望。

复现难度:★★★☆☆

数据集构建涉及3D-FRONT、iCity、Infinigen等外部工具链,步骤繁琐且部分环境未完整开源,想端到端复现需要投入不少时间;模块代码若补齐开源,复现难度会明显下降。

产品化成熟度:★★☆☆☆

当前适合影视后期辅助、航拍素材预处理等离线场景,实时视频去影和极端场景处理还达不到直接面向终端用户的水准。

可能的问题:论文对合成渲染数据与真实数据之间的域差距分析相对简略;视频基准缺少与PSTNet等既有视频去影方法的直接对比;如果后续能补充自监督或弱监督训练策略,实用性还会有明显提升。


主要参考文献

[1] Xu J, Wang C, Dong Z, et al. WildShadowRemover: In-the-Wild Video Shadow Removal via Detail-Preserving Video Diffusion Models[C]. AAAI, 2027.
[2] Guo L, Huang S, Liu D, et al. ShadowFormer: Global Context Helps Image Shadow Removal[J]. arXiv:2302.01650, 2023.
[3] Guo L, Wang C, Yang W, et al. ShadowDiffusion: When Degradation Prior Meets Diffusion Model for Shadow Removal[C]. CVPR, 2023.
[4] Hu E J, Shen Y, Wallis P, et al. LoRA: Low-Rank Adaptation of Large Language Models[C]. ICLR, 2022.
[5] Wan Z, et al. Wan: Open and Advanced Large-Scale Video Generative Models[J]. arXiv, 2025.
[6] Fu H, Cai B, Gao L, et al. 3D-FRONT: 3D Furnished Rooms with Layouts and Semantics[C]. ICCV, 2021.
[7] Raistrick A, et al. Infinigen: Indoor Photorealistic 3D World Generation[J]. arXiv, 2023.
[8] Ho J, Salimans A, Gritsenko A, et al. Video Diffusion Models[J]. NeurIPS, 2022.
原文链接:https://arxiv.org/pdf/2607.26203v1.pdf

融会贯通

结合PaperDaily已收录论文的观察,视频阴影去除目前仍处在早期起步阶段,不少方法还是把图像方法搬到视频上逐帧跑,时间一致性指标往往只在论文里出现一次,跨论文直接对比更是少见。这篇工作的价值在于两点:一是把视频扩散模型这个强力底座带入视频去影任务,后续研究者可以直接在这个基础上换条件、换任务;二是提供了一个合成数据规模更充足的开放基准,让后来者有据可依。
如果把它和之前的图像级去影工作串联起来看,一个明显的趋势浮现出来:泛化能力越来越依赖数据规模和预训练先验,而不是网络架构的精雕细琢。这对研发团队的启示非常直接——数据工程和数据质量建设,比堆模块重要得多。当然也要提醒一句,本论文的定量对比多数采用256×256协议,如果实际业务要处理4K甚至8K视频,资源占用和效果需要重新验证,不宜直接把小分辨率指标线性外推。
从更宏观的视角来看,WildShadowRemover所代表的技术路线——将大规模预训练生成模型与任务特定的轻量适配模块相结合——正在成为视觉任务的一种通用范式。无论是图像修复、视频编辑还是阴影去除,预训练模型提供的强大先验知识都能显著降低下游任务的学习难度。这种“预训练+轻量适配”的模式,有望在未来取代传统的从头训练方式,成为计算机视觉任务的主流解决方案。
同时,这篇论文也揭示了合成数据在视觉任务中的巨大潜力。通过精心设计的渲染流程,WildShadow数据集提供了大量高质量、像素级对齐的训练样本,这在真实数据中几乎不可能获得。尽管合成数据与真实数据之间仍存在一定的域差距,但论文的实验结果表明,通过在多样化的合成数据上训练,模型已经能够在真实世界视频上展现出令人满意的泛化能力。这为那些难以获取大规模标注数据的视觉任务提供了一条可行的路径。

*本文仅代表个人理解及观点,不构成任何论文审核或者项目落地推荐意见,具体以相关组织评审结果为准。欢迎就论文内容交流探讨,理性发言哦~ 想了解更多原文细节的小伙伴,可以点击"阅读原文",查看更多原论文细节哦!       

转发文章 微博 X LinkedIn Facebook
龙哥读论文 · PaperDaily

本文基于龙哥读论文 PaperDaily 数据库整理,结合论文原文与工程视角进行解读。

LONGGE AI COMMUNITY

把每天读到的论文,变成长期积累

加入「龙哥读论文」知识星球,持续获取 AI 论文、资讯、开源项目、招聘与研究思路。

加入龙哥读论文微信群:添加微信 kangjinlonghelper,备注“研究方向 + 地点 + 学校/公司 + 昵称”。

龙哥读论文知识星球二维码 微信扫码加入知识星球