论文标题:
Scalable Operator Learning via Nyström Approximation with Denoising Applications
发表日期:
2026年06月
发表单位:
Pennsylvania State University; Indian Institute of Technology Delhi
原文链接:
https://arxiv.org/pdf/2606.26652v1.pdf
计算瓶颈下的去噪困境
去噪这件事,看起来像是“把脏东西擦掉”,实际上常常是和结构信息抢地盘:噪声要去掉,信号还不能被顺手抹平。音频要保留音色和瞬态,图像要保留边缘和纹理,CT 重建还得兼顾物理成像规律。于是,很多方法都在“去噪”这个任务上卷出了花,但一旦数据规模上来,核方法就开始露出本性——效果不错,代价也不小。这篇论文盯住的核心矛盾很直接:核方法太慢。标准核回归在训练样本数为 n 时,通常要构造并求逆一个 n×n 的核矩阵,时间复杂度大致是 O(n3),存储复杂度是 O(n2)。样本一多,机器就会开始沉默,仿佛在说:“我不是不会算,我只是算不动。”而去噪任务偏偏又很爱大数据、长序列、高分辨率图像和实时流式输入,这就把核方法逼到了墙角。作者没有选择把核方法一脚踢开,而是给它“做减法”——用Nyström 子采样来近似原始核矩阵。Nyström 方法的直觉很朴素:既然全量核矩阵太大,那就挑一小撮代表点,先把大矩阵的骨架搭出来,再用低秩近似去替代完整计算。这样一来,很多原本要在 n 维空间里硬刚的操作,就能缩到 m 维,m 远小于 n,算力压力立刻轻松不少。图1:运动模糊下,KRR、Nyström 近似、BM3D 和 DnCNN 的重建结果对比。可以先记住一个结论:Nyström 不是来“另起炉灶”的,而是来把核方法的体积压下去,同时尽量保住原有效果。这里顺手解释两个缩写。KRR 是 Kernel Ridge Regression,中文常译为核岭回归,是核方法里最经典的一类回归模型;Nyström 则是经典的核矩阵低秩近似思路,用少量子样本逼近整体结构。论文中的目标不是把核方法替换掉,而是证明:在向量值回归和算子学习场景里,Nyström 也能站得住。
很多近似方法的问题都很像:跑得是快了,可理论上像“蒙的”。这篇论文比较讨喜的一点,是它没有停在工程优化上,而是认真分析了 Nyström 子采样在向量值回归中的收敛性。论文给出的不是“看起来差不多”,而是最小极大最优收敛率(minimax-optimal convergence rates)。这个术语可以拆开看。最小极大的意思是:在一类最坏情况里,算法表现已经接近理论上能达到的最好水平;收敛率说的是样本越来越多时,误差下降得有多快。换句话说,作者不是只证明“能收敛”,而是证明“收敛得还挺漂亮”。这就像不是只会跑,还能跑进前排。理论分析里最值得注意的是它使用了更一般的源条件。很多经典工作只讨论 Hölder 型条件,或者 operator-monotone 这类较特殊的假设;而本文引入的是由 index function 描述的通用源条件。这里的 index function 可以理解为刻画目标函数“有多光滑”的一把尺子,尺度更灵活,能把多种传统假设统一起来。这样一来,理论不再只适用于“教科书式的理想情况”,覆盖面更广。论文还讨论了一个很关键的条件:Tikhonov 正则化的“资格”是否覆盖某个 index function。Tikhonov 正则化就是在经验风险后面加一项范数惩罚,防止模型把训练集记成死记硬背的“学霸笔记”。资格覆盖则表示这种正则方式足够表达目标函数的平滑度要求。听上去像理论细节,实际上决定了误差界能不能成立。更进一步,在额外假设特征值满足多项式衰减时,论文把误差率推到了与已有最优结果一致的水平。这个结论很重要,因为它说明 Nyström 近似不是“为了快,牺牲一点点理论也没关系”,而是速度和统计效率可以同时兼顾。对于一个近似算法来说,能做到这一步,已经相当能打。
实验表现:均衡性能与效率
实验部分的思路很清楚:先看 Nyström 近似会不会把效果“近似没了”,再看它到底能省多少计算资源。论文使用的是高斯核,并在多个任务上与 full KRR 进行比较。这里的 full KRR 就是完整核岭回归,作为性能上限参照;Nyström KRR 则是子采样近似版本。对比对象里还出现了 BM3D 和 DnCNN,说明作者并不满足于只和自己比,而是把传统方法和深度方法也拉进来一起看。表1:不同 m 下 Full KRR 与 Nyström KRR 在 MSE、信噪比增益和计算时间上的比较。最直观的现象是:m 越大,Nyström 越接近 full KRR,但计算时间也会随之上升;m 太小则快是快了,误差也会跟着冒头。离线信号去噪里,Nyström 近似在 m=150 时已经非常接近 full KRR,说明低秩近似并没有把信号的主要结构打散。更有意思的是,m 从较小值逐步增大时,MSE 下降、SNR 增益上升,这种趋势非常符合直觉:代表点越多,骨架越完整,恢复出来的信号就越像原始核方法。与此同时,预测时间则明显更低,体现出近似法的工程优势。图4:m 与 RMSE 的关系曲线。这个图很像在提醒读者:Nyström 不是越省越好,得在“近似精度”和“计算成本”之间找一个甜点区间。实时音频去噪尤其能体现这类方法的价值。流式场景里,模型不能等整段音频都到齐再慢悠悠处理,而是要边来边算。Nyström 近似在这里的意义非常实在:把“能不能算完”变成“能不能实时算完”。论文的结果显示,它在保持较好去噪质量的同时,能显著缩短单段预测开销,这对在线音频、边缘设备和交互式系统都很友好。图2:高斯噪声下,KRR、Nyström 近似、BM3D 和 DnCNN 的重建结果对比。图像里最怕的不是噪声,而是“去噪之后一片塑料感”,而这里 Nyström 近似的结果基本保住了结构轮廓。图像去噪部分也很有说服力。无论是运动模糊还是高斯噪声,Nyström 近似都能给出与 full KRR 接近的重建效果。和 BM3D、DnCNN 这些经典方法相比,核方法的优势在于它更像一个统一的算子学习框架,不需要为不同噪声类型单独设计太多花活。代价当然是计算量更高,但 Nyström 恰好把这个短板补上了一截。表2:不同 m 下 Full KRR 与 Nyström KRR 在 MSE、信噪比增益和计算时间上的比较。这里的重点不是某个单点数值,而是趋势本身:近似做得越认真,性能越稳,代价也越高,典型的工程平衡题。CT 重建和能效预测则补上了“不是所有任务都长得像去噪”这一点。前者是典型逆问题,后者则是普通回归任务。实验显示,这个框架并不局限于某一种输入输出形式,而是可以在功能上迁移到不同的结构化预测任务中。换句话说,它的卖点不是某一个特定数据集上的花哨分数,而是方法论层面的通用性。表4:运动模糊条件下的图像重建结果。运动模糊往往最容易把边缘拖成“毛边”,而核近似方法仍能维持较平滑的恢复效果。表5:高斯噪声条件下的图像重建结果。高斯噪声属于最常见也最“烦人”的那类扰动,结果说明 Nyström 近似并没有因为压缩模型而把图像细节一并压缩掉。综合这些实验,可以得到一个比较稳妥的判断:Nyström 近似在这篇论文里不是“为了省算力凑数”的配角,而是能真正撑起效果与效率平衡的主角之一。尤其在 m 适中时,它几乎可以把 full KRR 的表现保住,同时把计算成本压下去一大截。对于实际应用来说,这种“少算很多、少掉不多”的方案,显然比单纯追求极致精度更有现实意义。
总结与启示
这篇论文的价值,主要不在于“发明了一个全新去噪器”,而在于它把Nyström 子采样、向量值核学习和去噪应用三件事拧成了一股绳。它证明了一个很实用的思路:当模型结构已经比较成熟时,提升可扩展性未必需要推倒重来,对计算瓶颈做结构化近似,往往就是最划算的路子。从写论文的角度看,这类工作也很值得借鉴。第一,先把理论框架讲清楚,再把近似方法塞进去,逻辑会非常顺。第二,实验不要只盯单一任务,尽量覆盖不同输入输出形态,这样才能说明方法不是“只会在一个坑里跳舞”。第三,若方法的核心卖点是效率,最好把时间、内存和精度一起讲,不然读者很容易怀疑:快是快了,快到哪儿去了?不过,Nyström 近似也不是万能钥匙。它依赖子采样质量,也依赖 m 的选择;如果任务本身极其复杂,或者数据分布变化很大,低秩近似未必总能稳稳命中最优点。也就是说,这套方法更像一把锋利但要会用的刀,而不是“拿来就能无脑切菜”的神器。
Naveen Gupta, Vaibhav Silmana, S. Sivananthan. Scalable Operator Learning via Nyström Approximation with Denoising Applications. arXiv:2606.26652v1, 2026.B. Schölkopf, A. J. Smola. Learning with Kernels. MIT Press, 2002.A. Caponnetto, E. De Vito. Optimal rates for the regularized least-squares algorithm. Foundations of Computational Mathematics, 2007.A. Rudi, L. Rosasco, G. C. De Vito. Regularization learning with Nyström method. Journal of Machine Learning Research, 2015.M. Meunier et al. Operator learning with general multiplicative kernels. 2024.