这篇论文的理论推导很扎实,但咱们不用被那些数学公式吓到。龙哥帮你把它的核心贡献拆解成三个“台阶”,一步一个脚印,咱们看看它是怎么证明自回归模型“天生就是卡尔曼滤波器”的。
第一层:滤波器近似——卡尔曼滤波能被“约等于”吗?第一个问题是:卡尔曼滤波这种递归算法,能不能用一个固定长度的“窗口”数据来近似?毕竟自回归模型只看固定长度的历史。论文的命题1给出了肯定的答案:只要观测窗口长度 L 足够长,卡尔曼滤波的估计值就可以被一个线性函数近似。这个函数只依赖于过去 L 步的输入和输出数据。用数学点的话说,就是状态估计和观测数据之间,存在一个线性的映射关系,而且这个映射的误差会随着窗口长度 L 的增加而指数级减小。这就为后面的“用线性网络去学这个映射”铺平了道路。第二层:优化景观——“寻宝”地图是光滑的第二个问题是:我们要用经验风险最小化(Empirical Risk Minimization, ERM)来训练这个两层网络,但目标函数是非凸的,这意味着梯度下降很容易掉进“局部最优”的坑里,找不到“全局最优”。论文的命题2告诉我们,不用担心!在满足一定的条件下(比如历史窗口长度足够长,数据量足够多),这个看似复杂的非凸优化问题,其“地形图”是非常良性的(benign)。所有的“鞍点”(Saddle Point)都是“严格鞍点”,意味着梯度下降可以轻易地逃离它们;而所有的局部最小值,实际上都是全局最小值。这相当于给优化过程上了一道保险,只要我们用带随机扰动的梯度下降(Perturbed Gradient Descent),基本就能找到那个最优解。第三层:统计保证——学到的“地图”能用来找宝藏吗?有了前面的基础,最后一个问题就是:学到的模型在没见过的数据上表现如何?能不能真正用来估计状态?这部分是论文最硬核的贡献,体现在定理2、3和4。咱们来个大白话版解读:定理2(样本内预测误差):在训练数据上,我们学到的模型(G₂G₁)做出的预测,和“已知系统模型后,用卡尔曼滤波做的最优预测”之间的差距,会随着训练数据量 T 的增加而减小(误差大约是 1/√T)。简单说就是:模型在训练集上见得越多,学得越好。定理3(参数估计误差):这不只是预测好,模型学到的参数(也就是G₂G₁这个乘积)本身,也会逼近一个真正的系统参数H = OC。这说明模型真正“理解”了数据背后的动态系统结构。最后,定理4(隐藏状态恢复)则是最终的成果:只要数据量足够大,训练好的模型在隐藏层的激活值(G₁z),和真正的卡尔曼滤波的状态估计,只差一个线性变换。这就像找到了一把钥匙,可以解开模型的“黑盒”,看到里面其实在运行一个卡尔曼滤波器。图3:定理4的核心公式,它告诉我们,隐藏层激活值和卡尔曼滤波估计之间,误差与训练数据量的平方根成反比。
3. 线性网络如何“学会”滤波?——深入剖析
咱们再来深入看看,这个神奇的“变身”过程具体是怎么发生的。
3.1 问题建模与模型架构
首先,我们研究的是一个部分可观测的线性动态系统(Partially Observed Linear Dynamical System, LDS)。简单说,系统里有一个我们看不到的“隐藏状态” x_t,我们能观测到的是系统的输入 u_t 和输出 y_t。这个动态过程可以用下面这个状态空间模型来描述:x_{t+1} = A * x_t + B * u_t + w_t y_t = C * x_t + v_t其中,w_t 和 v_t 是噪声。我们的目标是:只给定一堆输入-输出数据对 {(u_t, y_t)},不告诉模型 A, B, C 是啥,也不告诉噪声有多大,能不能训练一个模型来估计系统的隐藏状态 x_t 呢?本文采用的模型非常简单:一个两层线性自回归模型。图1:这就是论文里用的模型。输入是过去一段时间的观测向量z_t,经过第一个线性层G₁映射到隐藏状态h_t,再经过第二个线性层G₂映射到未来一段时间的预测输出。这里有几个关键点: 输入 z_t:是由过去 L 步的输入和输出堆叠而成的向量。比如 z_t = [u_{t-L}, ..., u_{t-1}, y_{t-L}, ..., y_{t-1}]。输出:模型预测的是未来 H 步的输出 y_{t:t+H-1}。隐藏层 h_t:这就是我们关心的“中间表示”。
[1] Sattar, Y., et al. "Two-Layer Linear Auto-Regressive Models Estimate Latent States." arXiv preprint arXiv:2606.12691v1 (2026).[2] Oymak, S., & Ozay, N. "Non-asymptotic identification of LTV systems: A subspace method." IEEE TAC (2021).[3] Tsiamis, A., & Pappas, G. J. "Finite sample analysis of Kalman filtering." ACC (2019).[4] Ziemann, I., et al. "Finite sample system identification: A unified theory." IEEE TAC (2022).[5] Umenberger, J., et al. "Policy gradient for linear quadratic control with partially observed information." ICML (2022).[6] Open source code: https://github.com/sdean-group/linear-ar-kf