← 返回 PaperDaily 前沿研究

五个基准全领先:LaST-SR把超分频率拆成“稳态+瞬态”

论文基本信息 原文标题: LaST-SR: Laplace-Inspired Steady-Transient Complex-Frequency Decomposition for Single Image Super-Resolution 首次公开: 2026年9月2日(arXiv v1) 任务: 2×与4×单图像超分辨率 原文: https://arx

论文基本信息

原文标题:LaST-SR: Laplace-Inspired Steady-Transient Complex-Frequency Decomposition for Single Image Super-Resolution

首次公开:2026年9月2日(arXiv v1)

任务:2×与4×单图像超分辨率

原文:https://arxiv.org/abs/2609.02063

龙哥导读

超分辨率最难恢复的,往往不是一条孤立边缘,而是“整栋楼的线条要连续,拐角处又不能糊成一团”。LaST-SR最值得看的进步,是把频域特征明确拆成维持全局结构的稳态响应刻画局部突变的瞬态响应,再让两者互相校正。论文在5个标准基准的2×和4×设置上都给出最高PSNR/SSIM;更重要的是,结果图里那些容易断裂的条纹、交叉线和弯曲纹理,确实恢复得更连贯。

论文4×定性对比:Urban100 img_092与Manga109 YumeiroCooking。图中包含HR、LR、Bicubic、SwinIR、SwinFIR、CRAFT、LAMNet-large和LaST-SR;红色数字为LaST-SR局部裁块的PSNR/SSIM。图片来自论文,作学术评论引用,版权归原作者。

01|先看最难的地方:线条不断,还要在拐角处转对

一张低分辨率图被放大4倍时,模型面对的不是简单“补像素”。同一团模糊灰块,可能对应平行条纹、弯曲边缘、交叉结构,也可能只是平坦区域里的轻微起伏。只要高频细节选错,图像会更锐,却不一定更真。

首屏结果图左边的Urban100建筑立面里,多组斜线在转角附近交汇;右边的Manga109纹理则包含密集、弯曲且方向不断变化的条纹。这两类区域正好同时考验全局连续性和局部变化。

Urban100裁块里,LaST-SR得到19.50/0.8401,对比图中的CRAFT为18.54/0.5082,SwinIR为15.05/0.6248。更值得看的是视觉形态:它不只把线条涂黑,而是把多组方向关系和交汇位置一起恢复出来。

Manga109裁块里,LaST-SR达到29.67/0.9608。弯曲条纹的走向更接近高分辨率真值,而不是在局部变成模糊色带。这里揭示了论文的主线:超分既需要看完整幅图的重复规律,也需要处理局部不规则、非周期、会突然改变方向的细节。

过去的频域方法往往强在前半句。傅里叶变换可以快速获得全图感受野,对周期纹理和长距离重复结构很友好;但同一套全局频率权重会被所有位置共享,建筑拐角、文字笔画转折、局部裂纹这些“只在这里发生”的变化容易被平均掉。

02|为什么只做傅里叶还不够?

傅里叶分析的核心假设,是用一组遍布整个空间的正弦和余弦波解释信号。它特别擅长回答“整张图里有哪些频率”,却不天然擅长回答“这个频率只在某个小窗口里增强,并沿某个方向逐渐衰减”。

可以把它类比成听音乐。全局频谱能告诉你整首歌有鼓点、低音和高音,却很难单凭一个总频谱指出某次鼓点从第几秒开始、余响怎样消失。图像里的拐角、短边和突变纹理,也像只在局部出现的“瞬态事件”。

LaST-SR引入的关键,不是简单把FFT再做一遍,而是借用拉普拉斯分析里的复指数思想。复频率不仅有控制振荡的虚部,还有控制增长或衰减包络的实部。于是,一个局部模式可以一边振荡,一边随空间位置增强或减弱。

虚部回答“纹理以多快的频率变化”,实部回答“这种变化沿空间怎样出现或消失”。这正好对应超分中的两类需求:规则条纹要保持周期和方向,局部转折又要允许幅度突然改变。

但拉普拉斯式建模也不能直接覆盖整张二维图。若让指数包络在全局无限延展,数值可能被放大,而且局部事件会再次失去位置约束。论文把瞬态分支限制在16×16窗口内,用归一化局部坐标控制作用范围;全局布局则交给稳态分支。

因此,所谓“稳态+瞬态”不是漂亮命名,而是一种职责分工:稳态分支负责不丢全局骨架,瞬态分支负责不抹平局部变化。两者都做频域计算,却使用不同的空间范围和不同的复数参数化。

03|整套架构:PDPM分流,CFD建模,STCA再汇合

LaST-SR总体架构:浅层特征依次经过多个STAR块,再进入重建模块。每个STAR块包含PDPM双分支投影、CFD稳态/瞬态复频域建模,以及STCA双向交互聚合。示意复平面中的极点与稳态、瞬态响应。图片来自论文,作学术评论引用,版权归原作者。

输入低分辨率图像先经过浅层特征提取,然后串联6个STAR块。STAR可以理解为一套重复执行的“分流—处理—会合”单元:先把同一份特征投影成稳态与瞬态两路,再用不同算子处理,最后让两路交换信息并融合。

第一步PDPM是双分支投影。LayerNorm后的输入分别经过两套独立的1×1投影,每一路降到8个中间通道。稳态特征保持完整H×W布局;瞬态特征被切成互不重叠的16×16窗口。

这里没有共享投影参数,是因为两路需要学习不同的“观察语言”。全局分支要识别跨越大范围的重复和布局,局部分支要对边缘突变、方向变化和不规则纹理更敏感。若一开始就强迫两者使用同一组通道组合,职责分工会变弱。

第二步CFD是论文最核心的复频域分解。稳态路在完整特征图上做二维FFT,瞬态路在每个小窗口里做FFT并套入可学习的极点—留数响应。两路计算完成后都通过逆变换回到实数空间。

第三步STCA负责协作。它不是把两路简单相加,而是先让每一路做窗口自注意力,再生成共享引导特征;随后稳态和瞬态分别以自己的查询去读取共享引导,最后经过重叠交叉注意力与通道校准输出。

这条链路的价值在于,每一种表示都保留独立性,又不会变成两个互不沟通的孤岛。全局结构可以纠正局部瞬态的方向,局部细节也能提醒全局分支哪里不能只按周期模板补齐。

04|稳态分支:保留完整频谱,而不是只挑低频

稳态分支先对完整特征图做二维离散傅里叶变换,得到每个空间频率上的复数系数。复数系数同时包含幅度和相位:幅度表示这种频率有多强,相位决定条纹、边缘和重复结构在空间中的对齐位置。

稳态分支的核心关系

Ys = Re{ F-1[ w(ξ) · Wc · F(Xs) ] }

F与F-1是正、逆二维傅里叶变换;Xs是稳态特征;Wc是可学习复数通道混合;ξ表示频率坐标;w(ξ)=1+η||ξ||ε是频率权重;Re取逆变换后的实部。

计算顺序不能颠倒。先做FFT把空间结构展开到频率域,再用复数矩阵Wc混合通道,相当于学习不同特征通道之间的频率协作;随后乘上与频率半径相关的权重,最后逆变换回空间域。

权重里的ε固定为0.7,η由训练学习。||ξ||越大,通常对应越高的空间频率。这个设计让模型可以增强高频,但基础项“1”又保留原始频谱通路,避免把所有信息都押在一套增益上。

值得注意的是,论文没有截掉高频,也没有只保留少数傅里叶模态。完整频谱参与计算,目标是同时维持低频布局、相位关系和高频结构。对Urban100的窗格、栏杆和建筑边线,这类全图一致性非常关键。

同一个频率混合器在所有位置共享。若图像左上角是规则窗格,右下角是树叶或文字拐角,全局算子不能仅靠频率索引表达“这种模式只在局部出现”。瞬态分支正好补上这个表示空位。

05|瞬态分支:用极点和留数描述局部“出现—变化—消失”

瞬态分支把特征切成16×16窗口,每个窗口使用归一化局部坐标。窗口内先做FFT,再由12×12组可学习复数模态构造响应。每个模态有一个复数极点μ和一个复数留数r。

极点—留数的直觉

复数极点 μ = a + ib:b控制空间振荡频率,a控制指数包络的增长或衰减;复数留数r控制该模态的强度与相位。多个模态叠加后,得到窗口内的局部瞬态响应。

如果极点实部a等于0,复指数只负责振荡,行为更接近普通傅里叶模式;如果a不等于0,振荡的幅度会沿局部坐标变化。于是,模型可以表达一组条纹在靠近拐角时逐渐增强、减弱或改变结构,而不是让它无限重复到整张图。

论文把这套过程写成有理频谱响应:频率变量与极点之间的距离进入分母,留数进入分子。直觉上,某个输入频率越接近一个可学习极点,对应模态就越容易被激活;不同极点共同解释窗口内多种方向和尺度。

再经过逆复指数重建,模型取共轭对称组合的实值结果,回到可与卷积、注意力继续处理的特征空间。这里的“拉普拉斯启发”应准确理解为复指数与极点—留数参数化,不等于模型真的在求解某个物理拉普拉斯方程。

作者还做了一个有意思的消融:强制所有极点实部小于0,让包络只能衰减,Urban100的PSNR反而下降0.10dB。有限窗口里,有些局部纹理需要沿某个方向增强后再由边界截断,完全禁止正实部会损失表达能力。

06|STCA:不是两路相加,而是让全局和局部互相提问

Urban100 img_005中间表示:(a)输入;(b)(c)为PDPM投影后的稳态与瞬态特征;(d)(e)为对应CFD响应;(f)为STCA融合结果。稳态响应保留建筑整体网格,瞬态响应突出密集局部变化,融合后同时维持长线条与转角细节。图片来自论文,作学术评论引用,版权归原作者。

这张图把抽象分支变得可见。上路CFD响应仍能看出建筑立面的大范围轮廓和网格方向;下路响应更像高频、局部、稠密的变化图,尤其在弯曲表面和细线交汇处更活跃。

STCA先分别给两路做常规窗口与移位窗口自注意力,让每一路在自己的表示空间里整理信息。接着,两路特征被合成为共享引导G;稳态特征和瞬态特征分别作为查询,G作为共享键和值,执行双向交叉注意力。

“共享键值、独立查询”很关键。查询决定当前分支正在找什么:稳态路想知道哪些局部变化会破坏全局结构,瞬态路想知道局部细节应沿着哪条全局方向延续。共享引导让两者读取同一份协作上下文。

之后的重叠交叉注意力会跨越原先窗口边界,通道校准再调整不同通道的重要性。这样可以缓解16×16窗口切分带来的接缝问题,也避免局部瞬态只在小格子里自说自话。

消融结果支持这层交互:把交叉分支注意力换成两路独立自注意力,Urban100下降0.06dB,Manga109下降0.02dB。幅度不算巨大,但方向一致,说明协作不是装饰模块。

真正有效的分解,不是把问题切成两半就结束,而是让两种专业表示在关键节点交换证据。这条思路也适用于多尺度恢复、时空建模和多传感器融合:分支要有职责差异,也要有明确会合机制。

07|用伪代码看懂一个STAR块

把公式压缩成流程后,一个STAR块其实很清楚:同一份输入分成全局与局部两路;一路保留完整频谱,一路在窗口内使用复指数模态;最后通过共享引导融合。下面是根据论文方法整理的伪代码,不是作者发布的可运行实现。

根据论文方法整理的伪代码

输入:特征 X
Xs ← PDPM_steady(LayerNorm(X))       # 保留完整空间布局
Xt ← Window(PDPM_transient(X), 16)   # 切成局部窗口

Ys ← IFFT(频率权重 × 复数通道混合 × FFT(Xs))
Yt ← 局部复指数重建(FFT(Xt), 极点 μ, 留数 r)

Gs, Gt ← 分支内窗口注意力(Ys, Yt)
G ← 融合为共享引导(Gs, Gt)
Zs ← CrossAttention(query=Gs, key=G, value=G)
Zt ← CrossAttention(query=Gt, key=G, value=G)

输出:X + OCAB(融合(Zs, Zt))

最关键的是中间两行。Ys把整幅图的频率关系一次看全;Yt允许每个窗口用带指数包络的复数模态解释局部变化。它们不是同一算子换个名字,而是空间范围、参数化方式和擅长问题都不同。

后四行则回答“分开以后怎样不丢信息”。两路先各自整理,再共同形成G,最后各自带着不同问题读取G。残差连接保留原始特征,OCAB扩大交互范围并减轻窗口边界。

08|双域损失:像素要对,频谱幅度也要对

网络最终用两部分目标训练。第一部分是空间域L1损失,逐像素约束重建图与高分辨率真值;第二部分是傅里叶幅度L1损失,比较两者频谱幅度,权重λf设为0.01。

训练目标

L = ||ISR − IHR||1 + λf || |F(ISR)| − |F(IHR)| ||1

ISR是重建图,IHR是真值,F是傅里叶变换,竖线表示频谱幅度;λf=0.01控制频域项强度。

空间L1负责“这个位置的亮度是否接近”,频域幅度项负责“整张图的频率能量分布是否接近”。两者互补:只有频域损失可能丢相位和位置,只有像素损失又容易在不确定高频处给出平均答案。

去掉傅里叶幅度损失后,Urban100和Manga109都下降0.12dB。这个结果说明频域监督确实有增益,但也提醒读者:主效果不是靠一个额外损失“刷出来”,稳态与瞬态算子才是主要贡献。

实验使用DIV2K的800张训练图,随机裁取64×64低分辨率块,采用翻转和旋转增强。模型设置72个通道、6个STAR块、每路8个投影通道、12×12个瞬态复频模态,训练50万次迭代。

评估覆盖Set5、Set14、BSD100、Urban100和Manga109,低分辨率图由双三次下采样生成,PSNR/SSIM在YCbCr的Y通道计算。这套经典设置让不同超分方法可以在同一口径下比较。

09|实验到底赢了多少?先看全表,再看消融

在2×设置下,LaST-SR在Set5、Set14、BSD100、Urban100、Manga109分别达到38.32/0.9617、34.13/0.9225、32.41/0.9026、33.25/0.9380、39.43/0.9786。论文报告这五组PSNR/SSIM都位列比较方法首位。

在4×设置下,对应结果为32.65/0.9000、28.93/0.7895、27.80/0.7440、26.87/0.8081、31.43/0.9189,同样全部领先。难度更高的Urban100与Manga109最能体现结构建模价值。

相对当时最强竞争结果,2×的Urban100提高0.09dB,Manga109提高0.04dB;4×分别提高0.05dB和0.09dB。数字不属于“跨代碾压”,却在多个数据集和倍率上保持一致,可信度比只挑一张表里的单点提升更高。

与直接相关的SwinFIR-T相比,2× Urban100从33.03提升到33.25,Manga109从39.30提升到39.43;4× Urban100从26.72提升到26.87,Manga109从31.23提升到31.43。SwinFIR同样使用全图傅里叶卷积,这组对比支持“局部瞬态补充全局频域”的价值。

另一个相关方向DiffFNO使用加权傅里叶神经算子、空间注意力算子和扩散过程处理任意倍率超分。它关注频率重平衡与连续尺度;LaST-SR关注固定倍率下的稳态—瞬态分工。两者都反对“一套频率操作包打天下”,但计算路径和适用问题不同。

消融更有解释力。把全局傅里叶稳态算子换成卷积,Urban100下降5.13dB,Manga109下降6.18dB;去掉局部复频瞬态,分别下降0.11dB与0.08dB。

这意味着全局分支是地基,局部分支是精修。不能因为0.11dB看起来小,就把瞬态机制说成无用;也不能把全部提升都归功于新颖的极点—留数叙事。大幅收益来自完整频域全局建模,瞬态与交叉注意力在此基础上继续抠结构细节。

模型参数量在2×时约132.9万,4×时约151.6万,处于轻量超分网络区间。论文还报告FLOPs,但真实部署速度会受复数运算、FFT实现、显存访问和设备后端影响;参数少不自动等于手机端更快。

10|这项工作最值得借鉴的,不只是超分

第一,把“全局规律”和“局部例外”交给不同算子。很多视觉任务都存在类似矛盾:去噪要学习全图噪声统计,又要保护局部细纹;去模糊要估计整体运动,又要处理景深和遮挡变化;自动驾驶要维护场景布局,又要响应突然出现的行人。

第二,分支差异必须落实到数学表示,而不只是网络命名。LaST-SR让稳态路用完整频谱和共享频率混合,让瞬态路用窗口坐标、极点、留数和复指数包络。职责差异可以被公式、可视化和消融逐项检查。

第三,融合模块要回答“谁向谁取证”。STCA没有粗暴拼接,而是独立查询共享引导。做多模态、多尺度或多传感器系统时,这比“把特征concat以后交给网络自己学”更容易形成可解释的设计假设。

对研究者来说,一个直接的新问题是:瞬态极点能否由输入内容动态预测,而不是所有图像共享?当前可学习极点是模型参数,它能覆盖训练分布里的常见局部变化;若遇到真实噪声、未知模糊或新型纹理,输入自适应极点也许更灵活,但稳定性和计算成本会更难控制。

另一个问题是窗口边界。STCA与重叠注意力能修补接缝,但局部复频建模仍从固定16×16划分出发。未来可以探索多尺度窗口、重叠复频分析或由结构方向决定窗口形状,让弯曲长边不被规则方格切断。

对工程团队来说,最现实的启发不是立刻重写超分管线,而是先做错误分型。若现有模型主要问题是全局线条断裂,扩大感受野或频域全局分支可能收益最大;若全局结构已经稳定,剩余问题集中在局部转角和非周期纹理,再引入瞬态分支更划算。

11|局限与落地:漂亮基准之后,还要补三张答卷

第一张答卷是真实退化。论文训练与测试使用双三次下采样,这能保证标准对比,却没有覆盖传感器噪声、压缩、镜头模糊、锐化残留和多种退化叠加。复杂频率模型在真实噪声下是否会把伪频率放大,需要专门实验;合成退化结果不能直接外推到手机、监控或老照片。

第二张答卷是速度与稳定性。FFT理论复杂度友好,但可学习复数矩阵、极点、留数、小窗口复数模态、双分支注意力和重叠交叉注意力都会增加实现与内存搬运成本。无约束极点实部也可能放大响应,目前的稳定性依赖有限窗口、归一化坐标和训练分布。

第三张答卷是可复现性。论文给出了详细训练设置和结构参数,足以理解方法;但文章没有把未核验的代码地址当成可运行资源。在实现、权重和完整训练脚本得到独立检查前,当前能确认的是论文证据,不是开箱即用的工程成熟度。

此外,PSNR/SSIM擅长测保真,却不能完整评价人眼感知、文字可读性或下游任务价值。五个基准全部领先很扎实,但提升多在0.04—0.09dB量级;是否值得增加系统复杂度,要结合具体错误类型、延迟预算和维护能力。

适合优先尝试的场景,是建筑、漫画、工业纹理、遥感线状结构等包含长距离重复与局部突变的图像。若输入主要是平滑自然场景,或者产品更看重感知锐度而非像素保真,生成式超分或更简单的轻量网络可能更合适。

12|龙哥点评:好方法,是把矛盾拆对,而不是模块堆多

龙哥觉得,这篇论文最好的地方,是它先把超分里的矛盾说清楚:全局频率模型能抓重复规律,却容易忽略局部非周期变化;局部模型能追细节,又可能失去长距离一致性。后面的每个模块都围绕这对矛盾展开。

它也没有把“拉普拉斯”当成一层包装。极点实部、虚部、留数、窗口坐标分别对应可解释的计算角色,响应可视化和极点约束消融能回到这些角色。这种从问题、数学表示到实验验证的闭环,值得做视觉恢复的同学认真读。

不过,对漂亮结果仍要保持工程理性。五个基准全领先证明了方法方向有效,不等于任何真实照片都能获得同样收益。真正决定落地的,还是退化分布、硬件算子支持、延迟和团队能否维护复数频域模块。

如果把结论压成一句话:LaST-SR不是让模型“看见更多高频”,而是让模型区分哪些高频属于全局稳定结构,哪些属于局部瞬时变化。这个区分,比单纯再加一层注意力更有方法论价值。

龙迷三问

第一问:瞬态分支只有0.08—0.11dB,值得增加复杂度吗?如果产品错误主要发生在拐角、文字、密集条纹等局部结构,这个增益可能比全图平均数字更重要;若目标只是平滑场景的快速放大,则需要用延迟和功耗实测决定。

第二问:极点实部不约束,会不会不稳定?有限窗口和归一化坐标把指数作用限制在局部,论文消融也显示放开正实部更有效;但跨分辨率、跨退化和长链路部署仍需检查数值范围,不能把有限基准上的稳定直接外推。

第三问:这套思路能迁移到视频吗?有潜力。稳态可以描述跨帧持久结构,瞬态可以描述运动边界、遮挡出现和光照突变;但视频还要处理时间一致性,二维局部复频模式不能直接替代光流、时序对齐或三维频域建模。

总结

LaST-SR给出了一条清楚的技术路线:PDPM把特征投影为全局稳态与局部瞬态两路;CFD用完整傅里叶频谱处理前者,用极点—留数复指数处理后者;STCA再通过共享引导完成双向交互。

实验上,它在五个标准数据集的2×和4×设置中都取得最高PSNR/SSIM;消融显示全局傅里叶分支贡献最大,局部瞬态、交叉注意力和频域损失继续提供稳定增益。结果图则让“长线不断、拐角不糊”变得可见。

真正值得带走的判断是:复杂视觉问题往往不是缺少更大的统一模型,而是需要把稳定规律与局部例外分开建模,再设计可信的证据交换。这既是超分的方法,也是一种更普遍的系统设计思路。

主要参考资料

LaST-SR官方论文
https://arxiv.org/abs/2609.02063

SwinFIR官方论文
https://arxiv.org/abs/2208.11247

DiffFNO官方CVPR页面
https://openaccess.thecvf.com/content/CVPR2025/html/Liu_DiffFNO_Diffusion_Fourier_Neural_Operator_CVPR_2025_paper.html

本文基于龙哥读论文PaperDaily数据库及PaperMiner的MCP进行汇总整理。

本文仅代表对论文公开内容的理解与评论。指标与图表来自原论文,尚未进行独立训练复现;请结合原文、代码与具体业务条件判断。

转发文章 微博 X LinkedIn Facebook
龙哥读论文 · PaperDaily

本文基于龙哥读论文 PaperDaily 数据库整理,结合论文原文与工程视角进行解读。

LONGGE AI COMMUNITY

把每天读到的论文,变成长期积累

加入「龙哥读论文」知识星球,持续获取 AI 论文、资讯、开源项目、招聘与研究思路。

加入龙哥读论文微信群:添加微信 kangjinlonghelper,备注“研究方向 + 地点 + 学校/公司 + 昵称”。

龙哥读论文知识星球二维码 微信扫码加入知识星球