← 返回 PaperDaily 视觉与图像

从时间序列到3D形状:一个框架通吃四类生成任务

先看一个让龙哥觉得有点"反直觉"的画面:下面这张图,从左到右分别是64×64、128×128、256×256、512×512,直到1024×1024分辨率的人脸生成结果。

从时间序列到3D形状:一个框架通吃四类生成任务
原论文信息如下:
论文标题:
Functional Mean Flow in Hilbert Space
发表日期:
2025年11月
发表单位:
Georgia Institute of Technology
原文链接:
https://arxiv.org/pdf/2511.12898.pdf

封面
先看一个让龙哥觉得有点"反直觉"的画面:下面这张图,从左到右分别是64×64、128×128、256×256、512×512,直到1024×1024分辨率的人脸生成结果。注意,模型训练时只用到了256×256图像中随机采样的四分之一像素,却能单步生成1024×1024的高清图像,而且每一档分辨率都清晰得不像话。
Diffusion模型要采样几十步甚至上千步,Flow Matching也要迭代很多次,而这项工作直接把采样步数压到了极限——一步。更特别的是,它不是在离散像素网格上干活,而是把图像当成连续函数来生成,所以你想生成多大分辨率都行,完全不训练时没见过的高分辨率所限制。
图2:将数据表示为函数,使得同一模型可以在不同噪声水平下以任意分辨率合成图像。该模型仅在256×256 CelebA-HQ图像的随机1/4像素子集上训练,并执行一步生成。从左到右:64×64、128×128、256×256、512×512和1024×1024
图2:将数据表示为函数,使得同一模型可以在不同噪声水平下以任意分辨率合成图像。该模型仅在256×256 CelebA-HQ图像的随机1/4像素子集上训练,并执行一步生成。从左到右:64×64、128×128、256×256、512×512和1024×1024
这项工作来自佐治亚理工学院,题为《Functional Mean Flow in Hilbert Space》(希尔伯特空间中的函数均值流)。一句话概括:它把原本只能在有限维欧氏空间玩转的均值流(Mean Flow)一步生成范式,硬生生拓展到了无限维的希尔伯特空间,并给出了一套理论自洽、实现可行的完整框架。

一步生成遇上无限维空间:函数均值流如何破局?

要理解这篇论文的定位,得先搞清楚两个关键词:函数型生成模型和均值流。
传统的生成模型,比如Diffusion和Flow Matching,处理的数据本质上是离散的向量或张量——图像就是像素网格上的数值。而函数型生成模型(Functional Generative Models)思路完全不一样:它把数据当作连续函数。比如一张图像,不再是一个H×W×3的张量,而是一个定义在二维坐标空间上的函数,你问它"坐标(0.3, 0.7)处什么颜色",它回答你一个RGB值。好处非常直观:训练和采样时,可以只随机采样一部分坐标点来计算,内存和计算开销不再跟数据分辨率直接挂钩。以前的工作比如Infty-Diff,已经能做到8倍的坐标下采样而不损失质量。
但函数型生成模型有个老大难问题——采样太慢。和Diffusion、Flow Matching一样,推理时需要沿着轨迹一步步积分,动辄几十步上百步。怎么破?
这里就要说到均值流了。标准Flow Matching学习的是瞬时速度场u(t, f_t),沿着轨迹从噪声分布把数据"推"到目标分布,推理时要用数值积分器一步步走。而均值流(Mean Flow)换了个思路:不学瞬时速度,直接学一段时间内的平均速度。想象一下,从A点开车到B点,瞬时速度可能忽快忽慢,但平均速度是一个稳定的值——知道平均速度,乘以总时间,一步就能算出终点。Mean Flow在有限维空间已经证明了自己,比之前的一步生成模型FID改善了50%到70%。
问题来了:能不能把均值流也搬到无限维函数空间?理论上很美,但实际做起来有两大拦路虎。
第一只拦路虎:无限维空间里的理论不一致。有限维空间里,条件流和边缘流之间的一致性可以轻松建立。但在无限维希尔伯特空间里,把条件均值流对数据分布求期望得到的边缘流,跟真实的边缘均值流并不等价——也就是说,用条件目标去训练,不保证能逼近真正的边缘目标。需要一个新的理论工具来弥合这个裂缝。
第二只拦路虎:数值不稳定。无限维空间中的泛函导数(Frechet导数)和算子值速度场,听着就头大。这些数学对象在优化过程中极易引发数值震荡,不同任务上收敛行为也不一致,一不小心训练就崩了。
佐治亚理工这篇论文干的,就是同时解决这两个问题。

从有限维到无限维:均值流的理论跨越与挑战

先花30秒铺垫一下函数空间里生成模型的数学框架,这样后面讲FMF才好懂。
设F是一个可分的希尔伯特函数空间,里面有函数之间的内积。函数空间上的概率分布叫测度(measure)。生成任务就是:从一个参考高斯测度μ₀出发,学一个随时间变化的向量场u,把μ₀"搬运"到目标数据分布μ₁=ν。这个搬运过程用数学语言描述,就是下面的弱连续性方程:
公式1
公式(1)中,ψ是任意合适的测试函数,梯度∇_gψ是函数空间中的泛函梯度,μ_t是t时刻的边缘分布,当t=0时为μ₀,t=1时为μ₁。
有了速度场,从一个初始函数f₀出发,沿着如下常微分方程积分到t=1,就得到了生成结果:
公式2
公式(2)定义了采样过程的动态方程,其中f₁服从目标分布ν。
进一步,这个微分方程还定义了流φ_t——一个把初始函数映射到t时刻函数的算子。t=0时φ₀是恒等算子(输入啥输出啥),随t演化:
公式3
公式(3)中,∘表示函数复合运算,Id_F是函数空间上的恒等算子。
理论框架看着很顺,但实际训练时有个麻烦:真实的边缘速度场u_t没法解析计算。所以已有工作Functional Flow Matching(FFM)想了个办法——不直接学边缘速度,而是学条件速度。具体来说,给定一个目标函数f,设计一条从噪声到f的条件路径,可以解析算出条件速度u_t^f。然后对所有可能的f按数据分布ν求加权平均,就能间接得到全局的边缘速度。这是标准的Flow Matching套路搬到了函数空间。
FFM这样做没问题,因为条件速度的期望恰好等于边缘速度。但到了均值流这里,事情就没那么简单了。
均值流的核心概念是双参数流φ_{t→r},它表示从时间t出发、走到时间r的映射。真正的边缘均值流定义为ū_{t→r} = (φ_{t→r} - Id_F)/(r-t)。注意,这里要求条件均值流的边缘化结果必须等于边缘均值流。但论文的Statement 1证明了:在一般情况下,这两个量根本不等价!
图1:函数均值流的示意图
图1:函数均值流示意图。该图展示了无限维函数空间的二维投影,生成过程中流将一个高斯测度搬运到目标函数测度。u预测版FMF建模流轨迹上任意两点f_t与f_r之间的平均速度ū_{t→r}(f_t),而x₁预测版FMF则估计沿平均速度ū_{t→r}(f_t)继续走完剩余距离1-t后到达的预期位置f̂_{1,t→r}(f_t)。
既然条件期望这条路走不通,论文搬出了一个更高级的数学工具——双参数流的初始时间导数定理(Theorem 3.1)。这个定理说的是,双参数流φ_{t→r}(g)对起始时间t求偏导时,等于流算子对g的Frechet导数Dφ_{t→r}(g)作用在速度场u_t(g)上再取负号:
公式8
公式(8)揭示了一个深刻的事实:双参数流对初始时刻t的导数,完全由当前速度场u_t和流算子的Frechet导数决定,并不需要知道r时刻以后的信息。
基于这个定理,再加上对时间参数的巧妙变换(链式法则和微积分基本定理的组合拳),论文得到了均值流ū_{t→r}(g)的一个等价表达形式:
公式9
公式(9)给出了均值流的三个等价表达形式,其中D表示Frechet导数,s g表示停梯度操作,u_t(g)是t时刻的瞬时速度。
这一步变换很妙——公式右边的第一项仍然含有ū本身,看起来是个"循环引用",但论文借鉴了Consistency Model里的做法:用当前模型的预测值加上stop-gradient(停梯度)操作来替代,也就是说训练时把这一项当作常数,不反传梯度。再加上u_t(g)可以写成条件速度u_t^f(g)的边缘期望形式,于是论文就得到了一个可以直接优化的条件损失函数。Theorem 3.2证明了这个条件损失跟理想中的边缘损失只差一个与模型参数无关的常数——这意味着优化条件损失就等于在优化边缘损失,理论自洽。
到这一步,u预测版的FMF已经完整了。推理时只采样一个初始噪声函数f₀,直接套公式f₁ = f₀ + ū_{0→1}(f₀),一步出结果。

x₁预测:让训练更稳定的关键设计

熟悉Diffusion和Flow Matching的朋友都知道,模型可以预测不同的目标:u预测是直接预测速度场,x₀预测是预测原始噪声,而x₁预测则是直接预测最终的数据。不同预测目标各有优劣。这篇论文把x₁预测第一次引入到均值流框架中,并在函数空间里给出了完整的理论和实现。这就是FMF的x₁预测变体。
简单理解:u预测的均值流学的是"从t到r的平均速度",那x₁预测学的就是"沿着这个平均速度走到t=1时到达的位置"。两个目标存在一个线性的几何关系,理解起来很直观——看下面这张图:
图3:(a) 函数流匹配的x₁预测;(b) 函数均值流的x₁预测
图3:(a) 函数流匹配的x₁预测;(b) 函数均值流的x₁预测。左图展示了流匹配中u预测与x₁预测之间的关系:f̂_{1,t}(f_t) := (1-t)·u_t(f_t) + f_t。基于此关系,可以类比定义函数均值流的x₁预测。
从论文的实验来看,在大多数任务上u预测和x₁预测表现旗鼓相当,但在某些任务上u预测的训练极其不稳定,输出方差直接崩掉,损失曲线狂舞;而x₁预测则稳如老狗,方差保持健康,损失平滑下降。L博士的理解:x₁预测相当于把优化目标从"矢量场"变成了"终点位置",函数空间中梯度传播路径更短,天然不容易出现梯度爆炸或方差坍缩。下面是论文中一个直观的对比:
图6:不同学习率下u预测与x₁预测FMF的训练行为对比
图6:不同学习率下u预测与x₁预测FMF的训练行为对比。(a)(c) u预测模型出现空间方差坍缩和损失不稳定;(b)(d) x₁预测模型保持稳定方差和平滑优化。
还能看出一点,x₁预测跟Consistency Model(一致性模型)和Flow Map Matching(流映射匹配)虽然有相似之处,但有本质区别。CM和FMM预测的是从当前函数出发、沿真实流走到未来某个时刻的确定状态;而FMF的x₁预测,预测的是当前平均速度的外推线与t=1的交点。同时CM无法充分利用梯度信息,FMM的优化目标在梯度算子内部导致不稳定和高成本。FMF的x₁预测跟u预测在理论上等价,但避开了这些坑。
有了u预测和x₁预测两个变体,加上配套的训练和推理算法(论文的Algorithm 1和Algorithm 2),FMF的完整框架就搭好了。训练时最小化条件损失,推理时只要一步:
u预测:f₁ = f₀ + ū_{0→1}(f₀);x₁预测:f₁ = f̂_{1,0→1}(f₀)。
就这么简单粗暴。那效果到底如何?下面看实验。

四大任务验证:时间序列、图像、PDE与3D形状

好方法不能只在玩具数据上转悠。论文在四大类任务上做了实验:真实世界函数生成(含时间序列和流体PDE求解)、基于函数的图像生成、基于SDF(Signed Distance Function,符号距离函数)的3D形状生成。核心亮点在于,FMF只是改变了训练目标,并没有改动原来模型的神经网络结构——把原来输入单个时间t的地方改成输入两个时间(t, r)就行。
先看时间序列与PDE。实验用了五个一维统计数据集:AEMET(每日温度)、Genes(基因表达时间序列)、Pop.(经济人口时间序列)、GDP(人均GDP)、Labor(劳动力规模),外加一个二维的Navier-Stokes(纳维-斯托克斯)流体数据集。模型统一采用FNO(Fourier Neural Operator,傅里叶神经算子)骨干网络。对比对象包括多步方法FDDPM、DDO、FFM-OT(最优传输变体)、FFM-VP(方差保持变体),以及此前的单步函数生成方法GANO。
表1:不同函数生成方法在一维数据集上的比较
表1:一维数据集上不同函数生成方法的统计指标(均值、方差、偏度、峰度、自相关)比较,1步和多步设置下的最优结果以粗体突出显示。NFE表示网络函数评估次数,越小代表推理越快。
从表1可以看到,FMF(无论u预测还是x₁预测)在NFE=1的情况下,统计指标全面优于同为单步的GANO,在一些数据集上更媲美甚至超过多步方法FFM-OT和FFM-VP。比如在Genes数据集,FMF-u预测的均值误差1.6e-3,虽然不如FFM-OT的6.7e-4,但已经优于DDO的4.2e-3。
表2:Navier-Stokes数据集上真实样本与生成样本的密度和频谱MSE对比
表2:Navier-Stokes数据集上,真实样本与生成样本在密度和频谱表示上的MSE指标比较。1步设置和多步设置下的最优结果均以粗体标出。
在二维Navier-Stokes流体数据集上,FMF的单步生成质量甚至反超了多步方法FDDPM和DDO,并且跟FFM-OT/VP缠斗得难分难解。这个结果对龙哥来说是有说服力的——它说明理论上「一步到位」的均值流在函数空间不仅是可行的,而且在复杂的物理场生成上能打。
再看图像生成。这一步更有意思。图像被表示成连续函数,训练时从256×256图像中随机抽取四分之一的像素点,模型就在这些稀疏坐标上学习生成。推理时想生成多大分辨率都行,因为函数本身是连续的。论文在CelebA-HQ、AFHQ、FFHQ、LSUN-Church上做了验证,FID_CLIP和Inception FID双指标都报。
表3:FID_CLIP指标与既有无限维方法相比的结果
表3:FID_CLIP指标与既往无限维方法的对比。为便于和几个采用Inception FID的既有方法对比,标星号(*)的为本文方法的Inception FID。
在CelebA-HQ 256×256上,FMF单步就拿到13.51的FID_CLIP,碾压所有需要50步采样的多步对比方法。要知道FFM-VP-50步也要20.06。一步打败五十步,这个效率优势属于压倒性的。
表4:不同分辨率下的结果对比
表4:不同分辨率下的生成结果对比,所有模型在256×256图像上用四分之一像素训练,测试分辨率提升至数据集最大分辨率。采样的随机性在图2中可以看到,分辨率从64到1024自由切换。
注意表4的关键信息:同样一个模型,在64×64上FID_CLIP是15.25,到512×512时是18.05。随着分辨率提升,性能只是略有下降,这分辨率外推能力得益于函数空间的连续性。
下面展示AFHQ、LSUN-Church、FFHQ上的效果:
图4:AFHQ、LSUN-Church、FFHQ上的生成结果
图4:AFHQ、LSUN-Church、FFHQ数据集上的生成结果。模型仅用256×256图像的四分之一像素子集训练,推理时一步生成,可在256×256和512×512两种分辨率下评估。
CelebA-HQ不同分辨率的结果
还可以看到,FMF模型输入输出都建模成连续函数之后,训练和图像生成可以定义在任意像素坐标上,而不是被限制在离散网格上。这个特性在下面的图中呈现得更直观:
图5:FMF中输入和输出均建模为连续函数
图5:在函数均值流中,输入与输出都被建模为定义在连续坐标空间上的函数,因此训练和生成可在任意像素坐标上进行,而非局限于离散的规则网格。
最后是硬核的3D形状生成。这个任务非常考验模型的极限能力:只给64个从目标表面随机采样的点,模型要重建出完整的3D几何体,本质上是学习一个SDF函数。原来的Functional Diffusion框架需要64步生成,FMF的x₁预测直接把整个流程压缩为一步。
图7:3D形状生成的结果
图7:3D形状生成结果。这是一个极具挑战性的任务,生成模型仅以目标表面随机采样的64个点为条件,需要重建完整几何。GT列显示真实表面,Condition列显示给定的64个条件点。
从图7可以看到,仅仅给定64个稀疏点,单步FMF重建出的椅子、汽车等形状已经相当接近真值。量化的IoU(Intersection over Union,交并比,衡量两个形状重叠程度)、Chamfer距离和F-score指标如下:
表5:重建质量的定量比较
表5:重建质量的定量比较。模型在ShapeNet上训练,条件输入为目标表面采样的64个点。Step表示推理步数。
从表5看,FMF的x₁预测单步IoU达到55.4%,而多步的基线F-Diff-64步也只有57.9%,相差2.5个百分点;但别忘了FMF只要1步,速度是64倍。有意思的是,u预测在这个任务上失败得比较彻底(输出方差崩了),这也再次印证了x₁预测对稳定性的价值。
这个结论对龙哥来说是站得住的:FMF在基准上并没有全面碾压多步方法的每个单项指标,但它用一步换来了接近甚至持平的效果,这份效率优势是决定性的。如果算上推理成本,FMF比多步方法快几十倍——在实时交互和资源受限场景下,这就是代差。

总结与展望:一步生成的新范式

论文把均值流这个有限维空间里的一步生成利器,成功推向了无限维函数空间。两大理论障碍都被解决:双参数流的初始时间导数定理弥合了条件与边缘之间的裂缝,x₁预测变体则有效避免了训练中方差坍缩的问题。更难得的是,FMF与现有框架天然兼容,不需要改动FNO、混合稀疏-稠密算子、基于点的函数生成网络等模型的骨干结构,只需把时间嵌入从一维换成二维。
从一个更广的视角来看,这篇工作的意义不仅在于函数生成速度的提升,更在于它为「函数的单步生成」建立了理论地基。在过去,Diffusion也好Flow Matching也罢,都摆脱不了多步求解的限制。均值流这一脉的思路是让模型学会「概要性的搬运动力」,而非细碎的瞬时速度,天然适配一步到位。如今连无限维函数空间这块硬骨头都啃下来了,未来AI在科学计算中直接单步求解PDE、单步生成高分辨率3D资产,路径已经清晰可见。
至于遗留的短板也要客观看待:一是在部分一维时间序列上,FMF的统计误差仍有不少场景高于多步FFM方法(比如GDP上的kurtosis);二是x₁预测的理论性质(Theorem 3.3)在更复杂的分布上能否保持同样优势,有待更多数学工作来夯实;三是FMF虽然降低了推理开销,但训练时因为要额外计算JVP(Jacobian-vector product,雅可比-向量乘积)来近似梯度项,训练成本相比普通Flow Matching更高。这也是目前这个框架最需要面对的一个性价比问题。
任意分辨率生成示意图

龙迷三问

下面是龙哥对于大家可能的一些问题的解答:
这篇论文到底在解决什么问题?佐治亚理工学院提出函数均值流FMF,将Mean Flow拓展到无限维希尔伯特空间,为单步生成提供扎实理论并引入更稳定的x1预测变体。
这篇工作最值得看的点是什么?论文方法在各类任务上均达到一步生成方法中的最优性能,与多步方法性能相当。在1D数据集上,FMF在多数指标上优于GANO;在图像生成上,FMF在CelebA-HQ-64上FID_CLIP达3.48,优于∞-Diff的4.57(但∞-Diff在更高分辨率上更优);在3D形状生成上,x₁-prediction FMF在Chamfer距离上优于多步方法3DS2VS和FD。
这篇工作的边界或风险在哪里?优点:1) 首次将Mean Flow扩展到无限维Hilbert空间,理论推导严谨;2) 提出x₁-prediction变体,在某些任务上比u-prediction更稳定;3) 支持任意分辨率生成,一步采样效率高;4) 在多种功能数据任务上验证了通用性。缺点:1) 图像生成质量仍略低于多步方法(如∞-Diff在高分辨率上更优);2) u-prediction在某些任务(如3D形状生成)上训练不稳定;3) 理论假设较强,实际应用中可能需要额外条件;4) 与多步方法相比,在部分指标上仍有差距。
如果你还有哪些想要了解的,欢迎在评论区留言或者讨论~

龙哥点评

论文创新性分数:★★★★☆

将Mean Flow框架扩展到无限维Hilbert空间,通过推导双参数流的Frechet导数建立理论公式,并引入x₁-prediction变体实现稳定的一步生成。

实验合理度:★★★★☆

1D数据集:均值、方差、偏度、峰度、自相关的MSE;2D Navier-Stokes:密度和频谱的MSE;图像生成:FID_CLIP和Inception FID;3D形状生成:Chamfer距离、F-Score、Boundary误差

学术研究价值:★★★★☆

将Mean Flow框架扩展到无限维Hilbert空间,通过推导双参数流的Frechet导数建立理论公式,并引入x₁-prediction变体实现稳定的一步生成;更关键的是问题定义是否可复用到同类任务。

稳定性:★★★☆☆

现有材料未提供充分的极端条件、重复运行或扰动测试,稳定性暂按中性评价。

适应性以及泛化能力:★★★☆☆

现有材料未完整展示跨数据集、跨场景或分布外实验,泛化能力仍需进一步验证。

硬件需求及成本:★★★☆☆

论文未明确给出具体FLOPs数值,但强调FMF实现一步生成(NFE=1),相比多步方法(如FFM需要数百步)大幅降低了推理计算量。

复现难度:★★★☆☆

现有材料未确认完整代码、配置、数据处理脚本和权重是否齐备,复现难度暂按中性评价。

产品化成熟度:★★★☆☆

论文验证以研究实验为主,真实部署中的时延、成本、维护和异常场景仍需补充验证。

可能的问题:1) 图像生成质量仍略低于多步方法(如∞-Diff在高分辨率上更优);

主要参考文献

[1] Zhiqi Li, Yuchen Sun, Greg Turk, Bo Zhu. Functional Mean Flow in Hilbert Space. arXiv:2511.12898, Georgia Institute of Technology.
[2] Lipman et al. Flow Matching for Generative Modeling. ICLR 2023.
[3] Song et al. Consistency Models. ICML 2023.
[4] Kerrigan et al. Functional Flow Matching. AISTATS 2025.

end
🔥 一步前向,图像/时序/3D 全搞定,告别几十上百次采样!
欢迎加入龙哥读论文粉丝群,扫描下方二维码或者添加龙哥助手微信号加群:kangjinlonghelper。一定要备注:研究方向+地点+学校/公司+昵称(如 图像生成+上海+清华+龙哥),根据格式备注,可更快被通过且邀请进群。『龙哥读论文』微信群目前包含:图像处理、大模型及智能体、自动驾驶及机器人、AI医疗及AI金融5个群,等你一起来聊~

*本文仅代表个人理解及观点,不构成任何论文审核或者项目落地推荐意见,具体以相关组织评审结果为准。欢迎就论文内容交流探讨,理性发言哦~ 想了解更多原文细节的小伙伴,可以点击"阅读原文",查看更多原论文细节哦!       

转发文章 微博 X LinkedIn Facebook
龙哥读论文 · PaperDaily

本文基于龙哥读论文 PaperDaily 数据库整理,结合论文原文与工程视角进行解读。