← 返回 PaperDaily 视觉与图像

最新理论证明:展开网络只相当于多项式滤波器,图像去噪还能这么玩?

算法展开(Algorithm Unrolling)一直是可解释深度学习的招牌做法,把迭代优化变成可学习的网络。这篇论文却给这个招牌泼了一盆冷水:图拉普拉斯去噪器的展开网络,无论怎么学,都只是多项式图滤波器,而且可达集还是测度零的严格子集——值得所有做可解释深度学习的人看一眼。

最新理论证明:展开网络只相当于多项式滤波器,图像去噪还能这么玩?

paperdaily_reaction_gif


原论文信息如下:
论文标题:
Unrolling a Graph-Laplacian Denoiser Realizes Only Compositions of Polynomial Graph Filters
发表日期:
2026年8月(arXiv预印本)
发表单位:
未标注(arXiv预印本)
原文链接:
https://arxiv.org/pdf/2608.09923v1.pdf
先设想一个场景:你是做图像去噪的工程师,不想用动辄几十亿参数的黑盒,于是选中了“算法展开”这条可解释路线——把传统迭代优化步骤展开成网络层,步长变成可学习参数,模型既有物理意义又能享受深度学习的拟合能力。听起来两全其美,对吧?
但新近一篇arXiv论文却给这条路泼了一盆彻骨的冷水:如果你展开的是图拉普拉斯去噪器,那么无论把参数调出什么花样,模型能表达的东西都不会超出某个多项式图滤波器类;更扎心的是,能到达的那部分,居然还是整个多项式空间里的一个测度零集合。这不是“盲人摸象”,这是在一张低维流形上反复打转。

展开网络真的能学到更多吗?——一个反直觉的理论发现

封面
封面
所谓算法展开(Algorithm Unrolling),最早来自Monga等人的综述[1],核心思想是把优化算法的固定迭代步骤展开成神经网络层,每层里的步长、正则系数等常数变成可学习参数。这样做的好处显而易见:网络结构自带可解释性,参数量也远小于通用大模型。过去十年里,从稀疏编码到压缩感知再到图像去模糊,算法展开几乎成了可解释深度学习的代名词。它的拥护者认为,既然每一层都对应着一次迭代,那么网络的中间变量就天然具有物理意义,训练过程也不再是盲盒式的黑箱调参。
这篇论文的标题很长,叫《Unrolling a Graph-Laplacian Denoiser Realizes Only Compositions of Polynomial Graph Filters》,作者是Seyed Alireza Hosseini,arXiv预印本,2026年8月发布。它盯上的是ICIP 2024一个可解释去噪器[3]的数学内核:先用泰勒级数展开(TSE,Taylor Series Expansion)把系统矩阵近似成算子多项式的形式,再用固定步数的共轭梯度法(CG,Conjugate Gradient)去求解,两阶段系数都放开学习。听起来像是“可解释+可学习”的双赢,论文却证明了一个让双赢变双输的结论。
核心结论一句话:这个展开网络端到端映射只能是去噪算子Ψ的多项式,且多项式的次数不超过两个截断阶数的乘积;在实践使用的阶数配置下,可达到的多项式集合是完整同类多项式空间里的一个测度零严格子集。“学习”并没有扩大假设空间,只是把一个本已狭窄的集合重新参数化了一遍。
为什么会出现这种情况?要理解它,得先弄明白图拉普拉斯去噪器和多项式图滤波器之间那条微妙的等价关系。这条等价关系并非显而易见——它依赖于图拉普拉斯算子的谱分解性质、Krylov子空间的结构,以及泰勒展开与共轭梯度法在代数上的深层联系。论文的贡献正在于把这些看似无关的数学工具串联起来,揭示出展开网络在表达能力上的真实边界。

从图拉普拉斯去噪器到多项式图滤波器:展开结构的数学本质

先把基本概念摆上桌。给定一个图,定义对称归一化图拉普拉斯L̂=I-W,其中W是从权重矩阵B做对称归一化得到的。图拉普拉斯去噪算子Ψ=(I+μL̂)⁻¹,作用是给带噪信号做一次沿图结构的平滑。因为L̂半正定,Ψ一定是对称正定、谱落在(0,1]区间里的非扩张算子,条件数κ(Ψ)=λ_max/λ_min的界限也随之确定。这个算子的物理意义很直观:它把每个节点的值向邻居方向拉拢,从而抑制高频噪声,同时保留低频的全局结构。μ控制平滑强度,μ越大,去噪越激进,但过度平滑的风险也越高。
图1:去噪算子谱区间与条件数定义
图1:去噪算子Ψ的谱落在(0,1]内,条件数等于最大特征值与最小特征值之比。
用这个算子做去噪,最朴素的目标是求解x=Ψy,也就是在图上做一次平滑。把它改写成线性系统Ax=y,就得到A=I+μL̂=Ψ⁻¹。注意,因为A和Ψ互为逆矩阵,“求解Ax=y”和“对y施加去噪算子Ψ”在数学上是同一件事,μ并不会作为独立参数出现在展开网络里——它完全藏在Ψ中。这个看似简单的观察其实暗藏玄机:既然μ被吸收进了Ψ,那么展开网络能学习的参数就只剩下泰勒系数和CG步长,而这些参数无论怎么调,都只是在Ψ的多项式框架内打转。
图2:系统矩阵A与去噪算子Ψ互逆
图2:系统矩阵A等于去噪算子Ψ的逆矩阵,这是后续多项式展开的出发点。
到了展开网络里,事情被拆成两层。第一层叫TSE模块,思路非常直接:把标量函数1/λ在点s处做泰勒展开并截断到K阶,再把λ替换成Ψ,就得到一个关于Ψ的多项式t_K(Ψ),用它来近似A=Ψ⁻¹。为了训练方便,展开里的系数从固定的阶乘权重改成了可学习的{a_k}。论文的命题3指出,这个模块的所有可能输出恰好覆盖“所有次数不超过K的Ψ多项式”。换句话说,TSE模块本身并不笨——它理论上能表达所有K次以内的多项式,问题出在后面的CG模块如何与它配合。
图3:1/λ在s处的泰勒展开式
图3:泰勒级数展开公式,s为非零展开中心,K为截断阶数。
图4:TSE模块的可学习多项式
图4:TSE模块将系数替换为可学习参数,整体是关于Ψ的次数不超过K的多项式。
第二层是CG模块:对t_K(Ψ)x=y跑m步共轭梯度求解。CG是求解对称正定线性系统的经典迭代法,它的每一步迭代{x_k}都待在Krylov子空间里。所谓Krylov子空间,就是K_j=span{y,A_K y,...,A_K^{j-1}y},也就是从初始向量y出发,用A_K反复乘法到不同次数后能得到的所有向量的线性组合。这个子空间的结构非常特殊:它完全由初始向量y和矩阵A_K决定,不依赖任何其他外部信息。CG算法在这个子空间里寻找使残差范数最小的近似解,因此它的每一步输出都必然落在某个Krylov子空间内。
图5:CG迭代中关键向量的子空间递推关系
图5:CG迭代中近似解、残差和搜索方向分别落在不同阶数的Krylov子空间里,α和β是可学习步长参数。
CG迭代里的系数α_k、β_k虽然可学习,但它们只是标量乘在已有向量上,不会把向量推出这个子空间。每步迭代至多乘一次A_K,所以跑完m步之后,输出一定可以写成某个次数不超过m-1的多项式作用在y上。又因为A_K本身是Ψ的K次多项式,两个多项式复合以后,整体输出x_m=P(Ψ)y,次数不超过K(m-1)。这就是定理4的核心结论:整个网络等价于一张多项式图滤波器。这个结论的证明并不复杂,但它的含义却极其深远——它意味着展开网络的表达能力被牢牢锁定在一个多项式类里,无论你如何调整参数,都无法跳出这个类。
图6:端到端输出是Ψ的多项式
图6:定理4的结论,展开网络输出等于P(Ψ)y,多项式次数不超过K(m-1)。
顺着这个思路再往深处扎一刀:既然输出总是多项式P(Ψ)y,那学习过程到底能覆盖多少种多项式?论文的命题5给出一个很“扎心”的回答:可达集合R是参数空间R^(K+2m+1)的像,它是一个半代数集,维数最多不超过K+2m+1。而完整的多项式类P_{K(m-1)}的维数是K(m-1)+1。当K(m-2)>2m时,这个可达集合只是完整空间里的一个测度为零的严格子集。这里的“测度零”是一个数学术语,粗略理解就是“在空间中占比为0”——如果你在完整多项式空间里随机挑一个多项式,它落在展开网络可达集合里的概率是0。
图7:可达集合维数严格小于完整多项式类维数
图7:可达集合的维数上界严格小于完整多项式类的维数,因此成为测度零的薄集合。
翻译成大白话:在论文实验使用的K=10、m=3配置下,网络有17个可学习参数,但这17个参数只能在一个维数不超过17的薄集合里游走,而它“名义上”应该覆盖的多项式空间有21维。那4个维度去哪儿了?被嵌套结构吃掉了。具体来说,TSE模块的K+1个系数和CG模块的2m个步长之间存在严重的冗余——某些参数组合会产生相同的端到端映射,导致有效自由度远低于表面参数数量。这种“参数化退化”现象在深度学习中并不罕见,但论文首次在算法展开的语境下给出了精确的数学刻画。
论文原文里有一句话很适合做这条定理的注脚:“学习到的步长只是从一个Krylov子空间中选取了一个元素,而这个子空间并不会因为学习而变大。”
当然,这个结论不是对整个CG算法的否定。论文特别注明适用范围:跨样本共享固定步长的展开式CG属于受限场景;教科书里那种依赖输入y自适应选择步长的CG是真正的求解器,不在本文讨论范围内。另外,如果网络每一层都重新估计图结构,不同层的滤波器作用在变化着的算子上,那种复合就可能跳出这个多项式类——论文指出,真正能突破边界的做法是去“学习图”,而不是去“学习CG步长”。这个区分非常重要,它提醒读者不要将结论过度泛化到所有算法展开方法。
speechless.png
看到这,训练过程表示:我辛辛苦苦调参,原来是在一个低维薄片上挪动?

初始化即泄漏:频谱响应的闭式分析与条件数下界

定理4回答的是“能表达什么”,但还没回答“从哪开始”。论文接下来分析了默认初始化下的行为:令a_k=(-1)^k、s=1,TSE模块的频谱响应能够闭式化简。如果CG模块收敛到精确解,端到端响应g_K(λ)也就有了显式表达。这个闭式解非常有用,它让我们可以在不训练的情况下就预测出网络的初始行为——这在深度学习中几乎是奢侈的。
图8:初始化时端到端频谱响应闭式
图8:初始化时的端到端频谱响应g_K(λ),λ为特征值,K为泰勒截断阶数。
这个g_K很有意思:它在λ=1处等于1,能完美保真;但当λ<1时,它始终大于理想响应λ;当λ→0⁺时,它没有降到0,而是停在一个不低于1/(K+1)的地板上。也就是说,初始化网络是一个“漏水的去噪器”——低频分量本该被有效压制,它却总留下一截。命题7给出了这个偏差的定量界限。这个“地板效应”的直观解释是:泰勒展开在截断后无法完全捕捉1/λ在λ=0附近的奇异行为,因此总会残留一个常数项。
图9:初始化解与理想去噪输出之间的误差上界
图9:初始化输出的误差被1/(K+1)控制,K越大越接近理想去噪结果。
那么K需要多大才够用?这就要看条件数了。因为Ψ的谱在(0,1]里,条件数κ(Ψ)=1/λ_min(Ψ)。而λ_min(Ψ)与归一化邻接矩阵W的最小特征值直接挂钩,论文给出了一个精确等式:κ(Ψ)=1+μ(1-w_min)。注意,这里没有任何近似,w_min一旦确定,条件数就完全由μ和图结构决定,与图像内容无关。这个等式的推导依赖于Ψ的谱分解和W的特征值性质,它把去噪算子的“病态程度”归结为图结构的一个纯几何量。
图10:条件数的精确表达
图10:条件数κ与归一化邻接矩阵最小特征值w_min的关系。
论文选用的图构造方式基于像素位置和灰度特征构造双边风格权重,实测λ_min=9.37×10⁻³,κ≈107。按截断误差估计,要达到ε=0.01的精度,至少需要K≥488;而实践中只用了K=10,差了将近50倍。这个缺口不是靠训练就能轻易补上的——因为训练只能在多项式类的薄集合里移动,改变不了“初始化就站在坑里”的事实。换句话说,展开网络的初始化本身就偏离理想目标很远,而训练又无法跳出这个偏离方向。
图11:初始化时频谱响应曲线
图11:初始化时的频谱响应。黑色虚线是理想目标λ,彩色曲线是不同K下的实际响应g_K(λ),灰色虚线是1/(K+1)地板。可以看出,在低特征值区域,响应明显偏离目标并趋近于一个非零常数。
更狠的是,命题12证明了一个不依赖图像内容的条件数下界:在平移不变情形下,只要空间核采用截断高斯核且σ_r(π)<0,就必然有w_min<0,从而κ(Ψ)>1+μ。这个下界完全来自图的结构和参数μ,跟具体图像内容没有关系。实验中,一个纯常数patch就能把中位κ复现到0.34%的误差,验证了这一点。这个下界的意义在于:它告诉我们,无论输入图像是什么,展开网络面对的去噪问题都不会比某个难度更低——条件数下界是图结构固有的属性。
图12:平移不变核的谱函数定义
图12:平移不变核的谱函数σ_r(θ),用于判断w_min符号,进而给出条件数下界。
这三段分析连起来就是一幅完整的图景:展开网络在初始化时就带着结构性偏差,响应偏大、有非零地板、需要极高的阶数才能逼近目标;而训练参数又只能在这个受限的多项式类内部调整,弥补不了这个结构性偏差。如果换一个参数化方式,直接站在完整多项式类上优化,会不会更好?论文给出的答案是:不但更好,而且好得有理论保障。

Bernstein参数化:一个更优的替代方案

如果展开网络辛辛苦苦只能到达P_d里的一个零测集,那为什么不直接在P_d上做优化?这正是论文给出的替代方案:用Bernstein多项式基[11]参数化整个多项式类。伯恩斯坦多项式是数值分析里的老熟人,在单位区间上有非常好的稳定性质。它最初被用于Bezier曲线的构造,后来在逼近论和计算机辅助几何设计里大放异彩。论文把它引入图滤波器设计,可以说是一个巧妙的知识迁移。
具体地,把P(λ)写成P(λ)=Σ_{j=0}^d c_j·C(d,j)·λ^j·(1-λ)^(d-j)。命题9给出了三个关键性质,每一个都精准地打在展开网络的痛点上。
第一是完备性:当系数c_j遍历R^(d+1)时,P就能遍历所有次数不超过d的多项式。展开网络只能到达的零测集,在这里变成了整个空间。这意味着Bernstein参数化没有浪费任何自由度——每一个参数组合都对应一个不同的多项式,不存在展开网络那种“参数冗余”问题。
第二是结构化的安全性保证:若所有c_j都落在[0,1]区间内,那么P(Ψ)自动半正定且谱范数不超过1。这等于免费赠送一个非扩张性质,不需要额外加正则项或约束层。这个性质在优化中非常宝贵——它意味着只要把系数限制在箱子里,网络的输出就自动满足稳定性要求,无需额外的投影或裁剪操作。
第三是理想的初始化:令c_j=j/d,则P(λ)=λ精确成立。换句话说,目标响应Ψy从一开始就落在假设空间里,而且是零近似误差。展开网络从g_K(λ)出发,响应偏亮还有地板;Bernstein直接站在靶心上。这个初始化策略的优雅之处在于:它不需要任何预训练或启发式调参,一个简单的线性赋值就能让网络从最优起点出发。
从训练角度看还有额外好处:Bernstein形式的输出关于系数c是线性的,所以平方误差损失是凸函数,加上箱子约束后依然是凸问题。而展开网络的目标函数是一个嵌套映射,本质非凸。凸性意味着梯度下降不会陷入局部最优——任何局部最优都是全局最优,这给优化过程提供了强有力的理论保障。论文在实验里特别加了一个“无优化器参考”:直接求约束/无约束最小二乘解,用来对比参数化本身带来的优化难度差异。
计算代价上也不吃亏。任何P∈P_d通过Krylov基都只需要d次Ψ黑盒调用;而一个展开块要花费Θ(Km)次调用去勉强描出一个零测集。论文原话说得直白:“matching degrees costs no more, and the saving is not the point”——关键不在于省几次算子调用,而在于可到达集合的大小。换句话说,即使计算代价完全相同,Bernstein参数化能到达的多项式空间也远比展开网络大得多。
这句对比非常精辟:展开网络是在一个零测集里挣扎,Bernstein直接给你完整空间,而且保证稳定性。算力相同,自由度却天差地别。
不过,免费的午餐也有配送费:c_j∈[0,1]是P([0,1])⊂[0,1]的充分条件而非必要条件。实验显示,这个箱子约束会让PSNR损失约2.4dB。想要安全保证,就得牺牲一点表达力——这是一笔清醒的trade-off。在实际应用中,如果对稳定性要求极高(比如医疗影像或自动驾驶),箱子约束带来的安全保证可能远超2.4dB的精度损失;反之,如果追求极致精度且能接受一定的风险,无约束版本可能更合适。
为了让大家快速把握本研究的主干信息,这里汇总如下:
*表格超出部分左右可以滑动 图4
图4

实验验证:理论预测与优化动态的定量对比

论文的实验不玩花活,直接做等参数、等精度的公平对比。数据来自TAMPERE17数据集[12],300张图切成不重叠的64×64灰度patch;图用双边风格权重在(x,y,I,∂xI,∂yI)五个特征上构建,窗口半径r=3,μ=100。求解器和展开模块都在这些patch上做去噪,噪声水平σ=0.1(对应8bit约25.5灰阶),256个patch取中位数作为最终指标。这个实验设计的巧妙之处在于:它把“参数数量”这个变量控制住了,让对比完全聚焦在参数化方式本身。
实验中比较了三个臂:不训练的Ψ(0参数)作为基线;展开TSE/CG块(K=10, m=3,学习{ak}, s, {αk}, {βk}共17参数);Bernstein多项式(degree 16,17个系数)。每个臂都从学习率网格{5e-3,...,2e-1}里挑自己最好的学习率,训练到平台期(15000步),重复3个随机种子。另外还加了一个P20类最小二乘最优解作为“能力参考”——它不是训练臂,而是放在完整多项式类上的性能上界。这个参考值非常关键,它告诉我们:在同样的多项式类里,理论上能到达的最好成绩是多少。
从结果上看,表格里的趋势跟理论预测高度吻合:Bernstein达到27.52±0.60dB,展开网络只有26.65±1.67dB,前者高出约0.9dB且方差小得多;二者离P20参考28.08dB分别差0.6dB和1.4dB。这印证了一个判断:17个参数确实都能工作,但同样的预算,展开网络的参数化方式用得更差。更值得注意的是方差差异——展开网络跨种子的标准差是Bernstein的近3倍,说明它对初始化非常敏感,训练结果的可重复性较差。
表格:三种去噪臂的测试PSNR对比
表1:三种去噪臂在相同参数预算下的测试PSNR对比。最后一行是P20类最小二乘最优参考,并非训练臂。
比最终精度更能说明问题的是训练动态(图2上方)。Bernstein在100步内就冲到25.65dB,而展开网络需要1200到1300步才追上来,相差一个数量级。展开网络跨种子的PSNR标准差为±1.67dB,Bernstein只有±0.60dB;在学习率网格上,展开网络最终PSNR波动3.95dB,Bernstein仅波动0.29dB。这不是“精度不够”的问题,而是“优化路径太陡、太脆”的问题。展开网络的损失面就像一个布满沟壑的山谷,梯度方向经常突变,导致训练过程极不稳定;而Bernstein的损失面则像一个平滑的碗,梯度方向始终一致,训练过程又快又稳。
图2下半部分则从几何上解释了为什么优化这么困难:参数到响应的Jacobian矩阵,在初始化时展开网络的奇异值超过第12个之后就跌到相对10⁻¹²以下,数值秩只有12/17;Bernstein则是满秩17/17,动态范围10⁵。换句话说,展开网络的17个参数里只有12个真正可用的优化方向,剩下的5个方向在数值上几乎是死的。论文把这种现象称为“参数化退化”,并指出它来自嵌套映射的内部冗余——比如t_K和q_{m-1}之间存在尺度退化关系。这种退化不是训练能解决的,它是参数化方式固有的结构缺陷。
图13:训练动态与Jacobian奇异值对比
图13:训练动态对比与Jacobian奇异值分析。上方显示展开网络训练慢一个数量级且有晚期突变;下方显示展开网络初始化数值秩仅有12/17。
论文还专门测试了Bernstein的“箱子约束”代价:同样的17参数类,加上c∈[0,1]约束后,凸问题最优解只有25.64dB,而无约束最优解27.99dB,相差约2.4dB。这说明命题9(ii)给的免费安全保证确实有隐性成本——在实际使用中需要权衡是追求稳定性还是极致精度。这个权衡在工程实践中非常重要:如果部署环境对稳定性要求苛刻(比如医疗影像),箱子约束带来的安全保证可能远超2.4dB的精度损失;反之,如果追求极致精度且能接受一定的风险,无约束版本可能更合适。
最后,论文也提醒读者别把结论读歪了:这里的受限是“固定图、固定展开结构”下的受限。如果网络每一层都重新估计图结构,让不同层的滤波器作用在变化的算子上,就跳出了单个多项式类的框架。真正能突破边界的不是去学CG步长,而是去学图本身。这个提醒非常重要,它划定了论文结论的适用范围,避免被过度解读成“算法展开全都没用”。

龙迷三问

下面是龙哥对于大家可能的一些问题的解答:
这篇论文到底在解决什么问题?本文从理论上证明,图拉普拉斯去噪器的展开网络(TSE+CG)在任意参数设置下都只能实现一个次数不超过K(m-1)的多项式图滤波器,其可达集在该多项式类中是测度零的严格子集,且初始化时存在泄漏下界。
这篇工作最值得看的点是什么?实验表明:1)展开网络(TSE/CG)与Bernstein参数化在相同参数预算下达到相近的测试PSNR(26.65±1.67 dB vs 27.52±0.60 dB),验证了Theorem 4的预测;2)Bernstein参数化收敛速度快约10倍(100步 vs 1200-1300步);3)展开网络对学习率更敏感(PSNR变化3.95 dB vs 0.29 dB);
这篇工作的边界或风险在哪里?优点:1)理论分析严谨,通过定理和命题清晰刻画了展开网络的实际表达能力;2)揭示了展开结构对假设空间的限制而非扩展,具有重要的理论指导意义;3)提出了Bernstein参数化作为替代方案,具有结构性的非扩张保证;4)实验设计巧妙,通过相同参数预算的对比验证了理论预测。缺点:1)理论分析主要针对线性去噪器,对非线性情况(如ℓ1图先验)的推广有限;2)实验规模较小(仅TAMPERE17数据集);3)未提供实际应用中的性能对比,缺乏与最新深度去噪方法的比较。
如果你还有哪些想要了解的,欢迎在评论区留言或者讨论~

龙哥点评

论文创新性分数:★★★★☆

本文通过理论分析证明,将图拉普拉斯去噪器的截断泰勒展开与共轭梯度求解器嵌套展开所构成的网络,其端到端映射始终是去噪算子的多项式(次数不超过K(m-1)),且可达到集在该多项式类中是测度零的严格子集,从而揭示该展开结构限制而非扩展了假设空间。

实验合理度:★★★★☆

PSNR(峰值信噪比),条件数κ,频谱响应

学术研究价值:★★★★☆

本文通过理论分析证明,将图拉普拉斯去噪器的截断泰勒展开与共轭梯度求解器嵌套展开所构成的网络,其端到端映射始终是去噪算子的多项式(次数不超过K(m-1)),且可达到集在该多项式类中是测度零的严格子集,从。

稳定性:★★★☆☆

现有材料未提供充分的极端条件、重复运行或扰动测试,稳定性暂按中性评价。

适应性以及泛化能力:★★★☆☆

现有材料未完整展示跨数据集、跨场景或分布外实验,泛化能力仍需进一步验证。

硬件需求及成本:★★★☆☆

不适用(本文为理论分析,不涉及具体计算量评估)

复现难度:★★★☆☆

现有材料未确认完整代码、配置、数据处理脚本和权重是否齐备,复现难度暂按中性评价。

产品化成熟度:★★★☆☆

论文验证以研究实验为主,真实部署中的时延、成本、维护和异常场景仍需补充验证。

可能的问题:1)理论分析主要针对线性去噪器,对非线性情况(如ℓ1图先验)的推广有限;


*本文仅代表个人理解及观点,不构成任何论文审核或者项目落地推荐意见,具体以相关组织评审结果为准。欢迎就论文内容交流探讨,理性发言哦~ 想了解更多原文细节的小伙伴,可以点击"阅读原文",查看更多原论文细节哦!       

转发文章 微博 X LinkedIn Facebook
龙哥读论文 · PaperDaily

本文基于龙哥读论文 PaperDaily 数据库整理,结合论文原文与工程视角进行解读。

LONGGE AI COMMUNITY

把每天读到的论文,变成长期积累

加入「龙哥读论文」知识星球,持续获取 AI 论文、资讯、开源项目、招聘与研究思路。

加入龙哥读论文微信群:添加微信 kangjinlonghelper,备注“研究方向 + 地点 + 学校/公司 + 昵称”。

龙哥读论文知识星球二维码 微信扫码加入知识星球