← 返回 PaperDaily 大模型与智能体

告别复杂两步法!端到端训练线性网络,状态估计误差仅1/√T

这个问题就像一个“灵魂拷问”:我们费劲训练一个模型预测时间序列的下一个值,它除了学会预测,它的内部“黑盒”里是否也偷偷学会了理解这个世界的底层规律?这篇来自康奈尔大学、华盛顿大学和帝国理工的论文,用严格的数学证明了:一个简简单单的两层线性网络,在训练之后,它的隐藏层居然自己学习了卡尔曼滤波!方法巧妙,理论扎实,而且开源了代码,非常建议关注时序建模和状态估计的

告别复杂两步法!端到端训练线性网络,状态估计误差仅1/√T
🐉 龙哥读论文知识星球来了!
公众号每日8篇拆解不够看?星球无上限更AI领域论文、资讯、招聘、招博、开源代码,一站式干货,每日2分钟刷完即赚! 👇扫码加入「龙哥读论文」知识星球,前沿干货、实用资源一站式拿捏~ xingqiu_header

龙哥推荐理由:
这个问题就像一个“灵魂拷问”:我们费劲训练一个模型预测时间序列的下一个值,它除了学会预测,它的内部“黑盒”里是否也偷偷学会了理解这个世界的底层规律?这篇来自康奈尔大学、华盛顿大学和帝国理工的论文,用严格的数学证明了:一个简简单单的两层线性网络,在训练之后,它的隐藏层居然自己学习了卡尔曼滤波!方法巧妙,理论扎实,而且开源了代码,非常建议关注时序建模和状态估计的小伙伴深读一下。


原论文信息如下:
论文标题:
Two-Layer Linear Auto-Regressive Models Estimate Latent States
发表日期:
2026年06月

发表单位:
Cornell University, University of Washington, Imperial College London

原文链接:
https://arxiv.org/pdf/2606.12691v1.pdf

开源代码链接:
https://github.com/sdean-group/linear-ar-kf

好的,龙哥这就给你把这篇文章安排上! 封面
封面图:两层线性自回归模型架构。
好了,言归正传,咱们直接切入正题,看看这篇论文到底说了啥。

1. 从自回归模型到卡尔曼滤波:一条理论桥梁

在进入正题前,咱们先掰扯掰扯两个基础概念,方便大家后面看得更爽。
什么是自回归模型?简单说,就是“用过去预测未来”。比如,预测明天的温度,就看看过去几天的温度变化趋势。在机器学习里,模型输入是一段历史数据(比如一段文字,或者一段视频帧),输出是下一个时刻的数据。大语言模型(LLMs)的核心思想就是自回归。
什么又是卡尔曼滤波?这可是控制理论界的明星算法,专门用来从充满噪声的传感器数据中,估计出系统真正的“隐藏状态”。想象一下,一架无人机在空中飞行,它的GPS信号会有误差,风速也是未知的。卡尔曼滤波器就能像一个聪明的“大脑”,把不完美的GPS测量值和物理模型(比如动力学方程)结合起来,给出一个对无人机位置和速度的“最优估计”。它需要一个已知的系统模型(A, B, C矩阵)和噪声特性才能工作。
一个是现代深度学习的“万能工具”,一个是经典控制理论的“最优滤波器”,看起来八竿子打不着。但本文的作者们却硬生生地在这两者之间架起了一座理论桥梁。他们研究的核心问题是:一个训练好的自回归模型,它的“内部世界”是不是也在干着卡尔曼滤波的活儿?
这篇论文可以说是对系统辨识(System Identification)领域的一次现代化升级。传统方法通常是两步走:先用数据学一个模型,再用Ho-Kalman分解这种古典方法去提取隐藏状态。但本文的方法非常“端到端”:直接把一个两层线性网络扔到输入-输出数据里训练,然后惊讶地发现,网络的隐藏层激活值,竟然和卡尔曼滤波器给出的状态估计惊人地一致!

2. 三层核心贡献:近似、优化与统计

这篇论文的理论推导很扎实,但咱们不用被那些数学公式吓到。龙哥帮你把它的核心贡献拆解成三个“台阶”,一步一个脚印,咱们看看它是怎么证明自回归模型“天生就是卡尔曼滤波器”的。
第一层:滤波器近似——卡尔曼滤波能被“约等于”吗?
第一个问题是:卡尔曼滤波这种递归算法,能不能用一个固定长度的“窗口”数据来近似?毕竟自回归模型只看固定长度的历史。论文的命题1给出了肯定的答案:只要观测窗口长度 L 足够长,卡尔曼滤波的估计值就可以被一个线性函数近似。这个函数只依赖于过去 L 步的输入和输出数据。用数学点的话说,就是状态估计和观测数据之间,存在一个线性的映射关系,而且这个映射的误差会随着窗口长度 L 的增加而指数级减小。这就为后面的“用线性网络去学这个映射”铺平了道路。
第二层:优化景观——“寻宝”地图是光滑的
第二个问题是:我们要用经验风险最小化(Empirical Risk Minimization, ERM)来训练这个两层网络,但目标函数是非凸的,这意味着梯度下降很容易掉进“局部最优”的坑里,找不到“全局最优”。论文的命题2告诉我们,不用担心!在满足一定的条件下(比如历史窗口长度足够长,数据量足够多),这个看似复杂的非凸优化问题,其“地形图”是非常良性的(benign)。所有的“鞍点”(Saddle Point)都是“严格鞍点”,意味着梯度下降可以轻易地逃离它们;而所有的局部最小值,实际上都是全局最小值。这相当于给优化过程上了一道保险,只要我们用带随机扰动的梯度下降(Perturbed Gradient Descent),基本就能找到那个最优解。
第三层:统计保证——学到的“地图”能用来找宝藏吗?
有了前面的基础,最后一个问题就是:学到的模型在没见过的数据上表现如何?能不能真正用来估计状态?这部分是论文最硬核的贡献,体现在定理2、3和4
咱们来个大白话版解读:
定理2(样本内预测误差):在训练数据上,我们学到的模型(G₂G₁)做出的预测,和“已知系统模型后,用卡尔曼滤波做的最优预测”之间的差距,会随着训练数据量 T 的增加而减小(误差大约是 1/√T)。简单说就是:模型在训练集上见得越多,学得越好。
定理3(参数估计误差):这不只是预测好,模型学到的参数(也就是G₂G₁这个乘积)本身,也会逼近一个真正的系统参数H = OC。这说明模型真正“理解”了数据背后的动态系统结构。
最后,定理4(隐藏状态恢复)则是最终的成果:只要数据量足够大,训练好的模型在隐藏层的激活值(G₁z),和真正的卡尔曼滤波的状态估计,只差一个线性变换。这就像找到了一把钥匙,可以解开模型的“黑盒”,看到里面其实在运行一个卡尔曼滤波器。
图3:定理4的核心公式截图,展示了隐藏层激活值与卡尔曼滤波估计之间的理论关系。
图3:定理4的核心公式,它告诉我们,隐藏层激活值和卡尔曼滤波估计之间,误差与训练数据量的平方根成反比。

3. 线性网络如何“学会”滤波?——深入剖析

咱们再来深入看看,这个神奇的“变身”过程具体是怎么发生的。

3.1 问题建模与模型架构

首先,我们研究的是一个部分可观测的线性动态系统(Partially Observed Linear Dynamical System, LDS)。简单说,系统里有一个我们看不到的“隐藏状态” x_t,我们能观测到的是系统的输入 u_t 和输出 y_t。这个动态过程可以用下面这个状态空间模型来描述:
x_{t+1} = A * x_t + B * u_t + w_t
y_t = C * x_t + v_t
其中,w_t 和 v_t 是噪声。我们的目标是:只给定一堆输入-输出数据对 {(u_t, y_t)},不告诉模型 A, B, C 是啥,也不告诉噪声有多大,能不能训练一个模型来估计系统的隐藏状态 x_t 呢?
本文采用的模型非常简单:一个两层线性自回归模型
图1:两层线性自回归模型架构
图1:这就是论文里用的模型。输入是过去一段时间的观测向量z_t,经过第一个线性层G₁映射到隐藏状态h_t,再经过第二个线性层G₂映射到未来一段时间的预测输出。
这里有几个关键点:
输入 z_t:是由过去 L 步的输入和输出堆叠而成的向量。比如 z_t = [u_{t-L}, ..., u_{t-1}, y_{t-L}, ..., y_{t-1}]。输出:模型预测的是未来 H 步的输出 y_{t:t+H-1}。隐藏层 h_t:这就是我们关心的“中间表示”。

3.2 算法与训练

训练过程就是求解一个经验风险最小化(ERM)问题:
min L(G₁, G₂) = (1/T) * Σ || G₂ G₁ z_t - y_{t:t+H-1} ||²
可以看到,这个模型没有非线性激活函数,就是一个纯粹的矩阵乘法。这在深度学习里非常罕见,但也正是它的优点——数学上容易分析!训练时,作者用了权重衰减(Weight Decay)作为正则化项,相当于在优化目标中隐式地限制了参数的范数。
插图
看到这里你可能要问了:就这么一个简单的线性模型,就能学会卡尔曼滤波?
龙哥一开始也怀疑,但理论就是这么让人意外。它的巧妙之处在于,卡尔曼滤波的稳态形式本身就是一个线性函数。卡尔曼滤波器的“预测器”形式会输出一个状态估计,而这个估计可以用历史输入的线性组合来表达。因此,当模型参数量(隐藏层维度h)足够大时,线性网络在理论上就可以完美地拟合这个线性函数。

4. 仿真验证:从随机系统到基准系统

理论说得天花乱坠,最终还是要看实验能不能打。作者们设计了几个实验,来验证自回归模型是否真的能“学会”估计隐藏状态。

4.1 实验设置

他们测试了两种系统:
随机生成的合成系统:状态维度 n=4,输入 p=2,输出 m=3。系统矩阵A被缩放至谱半径为1,确保系统是临界稳定的。
ControlGym 基准系统:这是一个公开的线性系统测试基准,作者选取了“水下航行器”(UMV, n=8)和“飞机”(AC6, n=10)两个系统,更贴近实际工程场景。
对于每个系统,只采集一条长度为 T 的轨迹,然后构建输入-输出对来训练模型。训练时,他们使用了Adam优化器,并设置了权重衰减。

4.2 实验结果

首先,他们通过网格搜索(Grid Search)来确定最佳的隐藏层维度h。
表1:不同隐藏维度下的训练损失
表1:网格搜索结果显示,当隐藏层维度 h=4 时,取得了最低的平均训练损失。而 h=4 恰好等于真实状态维度 n,这说明模型在“无师自通”的情况下,找到了最合适的隐藏层大小。
接着,他们检验了模型隐藏层是否能恢复出卡尔曼滤波的状态估计。他们用一个线性映射S,把模型的隐藏层激活值G₁z映射到卡尔曼滤波的估计空间上,然后计算两者的相关系数(用R²统计量来衡量)。
图2:预测状态估计与学习激活值的对齐图
图2:在合成系统上的可视化结果。图中每个点代表一个时刻,横轴是卡尔曼滤波给出的状态估计,纵轴是模型经过线性变换后的隐藏层激活值。可以看到,所有点都紧密地聚集在对角线附近,R²值高达0.99,说明两者的状态完美对齐!
表2:隐藏状态恢复的R²统计量结果
表2:在三个系统上的R²结果。可以看到,无论是随机系统还是ControlGym基准系统,平均R²都在0.98以上。可以说,模型完美地学会了在隐藏层复现卡尔曼滤波的估计。
作者们还做了样本复杂度(Sample Complexity)的实验,探究历史窗口长度 L 对模型性能的影响。
图3(b):固定未来预测窗口H=5时,改变历史窗口长度L的样本复杂度图。
图3(b):结果验证了理论,当历史窗口L足够大时(比如L=10),模型能够以更少的数据量(T更小)达到较低的预测误差。

5. 总结与展望

这篇论文用严格的数学证明了:一个最简单的两层线性自回归模型,在通过ERM训练后,其隐藏层会自发地学习去模拟最优的卡尔曼滤波器。这项研究为理解深度学习中“表示学习”的机理提供了一个非常清晰、有说服力的范例。它告诉我们,在特定问题上,即使模型没有显式地建模“状态”,它也能在内部“发现”状态
当然啦,这只是一个开始。未来的研究方向也很有想象力:

1. 向非线性系统进军:本文只在线性系统上证明了理论。对于更复杂的非线性系统,自回归模型(比如带激活函数的神经网络)的隐藏层里又在“扮演”什么角色?是不是相当于一个非线性卡尔曼滤波器(比如EKF)?这绝对是个值得深挖的题目。

2. 扩展到控制任务:既然模型学会了状态估计,那能不能用来做控制?直接用学到的隐藏层输出去当控制器的输入,是不是比传统方法更鲁棒、更高效?

3. 理解更大的模型:这个“学习即滤波”的观点,能否帮助我们理解更复杂模型,比如Transformer、RNN、甚至世界模型的工作原理?比如,一个训练好的世界模型,其内部表征是不是也在运行一个复杂的滤波器?


龙迷三问

下面是龙哥对于大家可能的一些问题的解答:

这篇论文解决什么问题?它解决一个理论问题:一个最简单的自回归模型(两层线性网络)在训练后,它的内部表示能否学会执行最优的状态估计(卡尔曼滤波)?本文不但证明了“能”,还给出了严格的数学保证和样本复杂度。

文中提到的“ERM”和“LDS”代表什么意思?ERM是Empirical Risk Minimization(经验风险最小化)的缩写,简单说就是“在训练集上让损失函数最小化”,是我们训练模型最常用的方法。LDS是Linear Dynamical System(线性动态系统),指的是可以用线性方程描述的、随时间变化的系统。比如一个弹簧振子、一个RLC电路,都属于线性动态系统的范畴。

什么是“状态空间表示”的“相似性变换”?简单说,就是给系统的状态变量“换个单位”或者“换个坐标系”。比如,我们描述一架飞机的位置,可以用经纬度,也可以用公里坐标。虽然用的数字完全不同,但描述的都是同一个物理过程。本文的定理4说,模型学到的隐藏状态和卡尔曼滤波的状态估计只差一个“相似性变换”,就是说两者本质上是同一个东西,只是“坐标系”不同。这说明了模型确实抓住了状态的真谛!

如果你还有哪些想要了解的,欢迎在评论区留言或者讨论~

龙哥点评

论文创新性分数:★★★★✰

方法本身并不复杂,但切入点非常巧妙,将非凸优化、系统辨识和深度学习理论完美结合,给出了一套完整的理论证明,在方法论上非常有启发性。

实验合理度:★★★★✰

实验设计很合理,从合成系统到基准系统,从定性的散点图到定量的R²统计量,都能有力地支持理论结论。不过,由于模型本身非常简单,实验的挑战性有限。

学术研究价值:★★★★★

极高!这篇论文为理解“表示学习”提供了一个宝贵的理论“水晶球”。它把深度学习中的一个黑盒现象,用经典控制理论的语言说得清清楚楚,为未来研究更复杂的模型奠定了基础。是理论深度学习领域的一篇佳作。

稳定性:★★★✰✰

作为理论分析,稳定性是基于严格的假设(如线性系统、高斯噪声)。在实际工程中,系统往往是非线性的,噪声也非高斯,因此理论结论的直接迁移需要谨慎。

适应性以及泛化能力:★★✰✰✰

模型本身是线性且无激活函数,这大大限制了它的表达能力和适应性。它只能处理线性的、时不变的动态系统,对于其他类型的数据(如文本、图像)几乎没有直接应用的可能。

硬件需求及成本:★★★★★

成本极低!只是一个两层线性网络,训练和推理的速度都非常快,在普通CPU上就能轻松运行。

复现难度:★★★★★

非常容易。论文不仅提供了详细的伪代码,还开源了全部代码(链接在文中)。只要你懂一点Python和PyTorch,基本可以快速复现。

产品化成熟度:★★✰✰✰

这篇工作的核心价值在于理论启发,离产品化还很远。它不会直接被用来做一个APP或者一个网站,但它证明了“简单模型也能做聪明事”,这对于指导工业界设计更高效、可解释的模型非常有价值。

可能的问题:模型过于简化(两层线性无激活函数),理论分析依赖于强假设(线性系统、高斯噪声、可观可控),这些在真实世界中很难完全满足。论文也提及,对于约束优化下的梯度下降收敛性分析尚未完成,是一个理论留白。


主要参考文献

[1] Sattar, Y., et al. "Two-Layer Linear Auto-Regressive Models Estimate Latent States." arXiv preprint arXiv:2606.12691v1 (2026).
[2] Oymak, S., & Ozay, N. "Non-asymptotic identification of LTV systems: A subspace method." IEEE TAC (2021).
[3] Tsiamis, A., & Pappas, G. J. "Finite sample analysis of Kalman filtering." ACC (2019).
[4] Ziemann, I., et al. "Finite sample system identification: A unified theory." IEEE TAC (2022).
[5] Umenberger, J., et al. "Policy gradient for linear quadratic control with partially observed information." ICML (2022).
[6] Open source code: https://github.com/sdean-group/linear-ar-kf

*本文仅代表个人理解及观点,不构成任何论文审核或者项目落地推荐意见,具体以相关组织评审结果为准。欢迎就论文内容交流探讨,理性发言哦~ 想了解更多原文细节的小伙伴,可以点击"阅读原文",查看更多原论文细节哦!       

end
看来,有时候真的不需要来点“神秘”操作,网络自己就能学会最优滤波!想跟龙哥一起探索更多AI“朴实”又强大的原理吗?快来群里嗨聊吧!
欢迎加入龙哥读论文粉丝群,扫描下方二维码或者添加龙哥助手微信号加群:kangjinlonghelper。一定要备注:研究方向+地点+学校/公司+昵称(如 图像处理+上海+清华+龙哥),根据格式备注,可更快被通过且邀请进群。
『龙哥读论文』微信群目前包含:图像处理、大模型及智能体、自动驾驶及机器人、AI医疗及AI金融5个群
wechat_helper dianzan
转发文章 微博 X LinkedIn Facebook
龙哥读论文 · PaperDaily

本文基于龙哥读论文 PaperDaily 数据库整理,结合论文原文与工程视角进行解读。