← 返回 PaperDaily 大模型与智能体

一个指数终结百年难题!1/3成矩阵逼近终极天花板

这不是AI论文,而是一篇让AI背后的线性代数“地基”更稳固的纯数学硬核成果。UCLA学者几乎交换矩阵逼近的指数推到了1/3,并证明没法再快了。一个百年老问题,给出终极答案,值得所有做矩阵计算、量子信息和数值算法的人瞄一眼。

原论文信息如下:
论文标题:
关于归一化Hilbert–Schmidt范数下几乎交换矩阵的研究
发表日期:
2026年8月(arXiv预印本)
发表单位:
加州大学洛杉矶分校(UCLA)
原文链接:
https://arxiv.org/pdf/2608.31000v1.pdf
大家有没有想过这么一个问题:如果两个东西“几乎一样”,那能不能通过很小的调整,让它们变得“完全一样”?这听起来像是一个生活哲理问题,但实际上,它是一个从1929年就困扰数学家的正儿八经的难题。今天要聊的,正是这个问题的矩阵版本——几乎交换矩阵逼近问题。

百年数学难题:几乎交换矩阵的逼近问题

先说说什么是“交换”。两个矩阵X和Y,如果满足XY = YX,就称它们可交换。对矩阵不太熟的读者可以想象成两台设备:可交换意味着两台设备的操作顺序不影响最终结果,先按A再按B,跟先按B再按A一样。这在量子力学里是大事,因为可交换的观测算符意味着可以被同时精确测量。
问题的有趣之处在于“几乎交换”。什么叫几乎交换?就是XY和YX非常接近,但不完全相等。数学上定义一个交换子[X, Y] = XY − YX,如果这个交换子“很小”,就说X和Y几乎交换。
那么问题来了:如果X和Y几乎交换,能不能找到一对真正交换的矩阵X'、Y',让它们分别跟原来的X、Y很接近?换句话说,一个系统如果几乎可以同时测量,那它是不是真的可以同时测量?这个问题的源头可以追溯到1929年,现代数学物理的奠基人冯·诺依曼在遍历理论的研究中埋下了这颗种子。1969年,Rosenthal在《美国数学月刊》上正式把它提炼成一个公开问题;1976年,Halmos又在一篇名为“深度未知的未解问题”的文章

百年数学难题:几乎交换矩阵的逼近问题

先把这场“逼近游戏”的标尺说清楚。论文使用的主要工具是归一化Hilbert–Schmidt范数(Hilbert–Schmidt norm,简称HS范数)。对于任意d×d复矩阵X,它的定义如下:
归一化Hilbert–Schmidt范数的定义公式
公式 = 归一化Hilbert–Schmidt范数的定义:矩阵所有元素模平方的平均值,再开根号。相当于把d²个分量先求“平均能量”再开方。
为什么非要除以d?因为普通Frobenius范数会随着维度d增大而“膨胀”单位矩阵的范数变成√d。归一化后,单位矩阵的范数恒为1,所有估计才有可能做到不依赖于维数。论文里的核心不等式之一,就是归一化HS范数与算子范数的关系:
归一化HS范数与算子范数的关系式
这个不等式说明,归一化HS范数比算子范数更“温和”,因此HS范数下的逼近问题往往比算子范数版本更容易处理,但想拿到最优指数依然非常困难。
下面把问题写成数学语言。设B_d是算子范数不超过1的自伴矩阵集合。自伴矩阵就是共轭转置等于自身的矩阵,实数对称矩阵是它的特例。论文讨论的是:给定X、Y∈B_d,如果交换子[X,Y]=XY−YX在归一化HS范数意义下很小,能否找到一对真正可交换的X'、Y'∈B_d,让X'贴近X、Y'贴近Y?而且这里额外要求X'与X可交换,即[X',X]=0。这个附加条件大大增加了问题的难度,但也为后续推广带来了便利。
B_d的定义:算子范数不超过1的自伴矩阵集合
这个问题的历史,可以追溯到1929年冯·诺依曼在遍历理论中埋下的种子。1969年Rosenthal在《美国数学月刊》上正式将其提炼为公开问题,1976年Halmos又在一篇题为“深度未知的未解问题”的文章中再次强调。半个多世纪以来,数学家们在这条赛道上不断刷新纪录,本文就是这条接力赛的“终极一棒”。
先来看算子范数版本的故事。1995年,Lin用抽象方法证明了维数无关的存在性定理,后来Friis和Rørdam给出了简短证明。再往后,定量版本浮出水面:存在常数C,使得逼近距离(不平方)满足:
算子范数版本的定量估计公式
这里的关键是指数1/2,它在算子范数意义下被证明无法改进。可以说算子范数版本的“终点线”早就画好了。
但本文所在的赛道——归一化HS范数版本——则是另一番景象。Hadwin等人用自由熵和C*-代数工具率先证明了存在性,但定量结果迟迟没有出现。直到2010年Glebsky给出第一个定量估计,指数仅为1/6;随后Filonov与Safarov把它改进到1/4。此后的十余年里,1/6到1/4之间的推进仿佛被冻住了,再无人能撼动。
这就像百米短跑:先有人跑进10秒,再有人跑到9.9秒,然后卡住了。而今天这篇论文直接宣布:9.5秒就是人类极限,并且给出了数学意义上的严格证明。这种“一步封神”的成果,在纯数学领域并不常见。

核心突破:指数1/3的最优估计

论文的成果可以浓缩成一句话:在归一化Hilbert–Schmidt范数下,指数1/3既是可以达到的,也是不可能再改进的“天花板”。
先看正面结果——定理1.1。对于任意两个算子范数不超过1的自伴矩阵X、Y,都能找到一对可交换的自伴矩阵X'、Y',使得:
定理1.1:距离平方和的上界估计公式
这里的X'、Y'满足[X',Y']=[X',X]=0。特别之处在于,X'不仅与Y'可交换,还与X可交换——这相当于在“更强约束”下逼近,仍然拿到了指数2/3。如果换一种写法,把距离不平方,结论等价于摘要中的表述:
‖X−X'‖_{2,d} + ‖Y−Y'‖_{2,d} ≤ 5‖[X,Y]‖_{2,d}^{1/3}。常数C_t1在论文的完整证明中可取为24,作者自嘲说“没有刻意优化常数”,四舍五入后得到摘要中的5。
正面结果已经很漂亮,但真正让这篇论文“封神”的是它的反面结果——定理1.2。作者构造了一对“刁钻”的矩阵:
定理1.2中构造的两个特殊矩阵X0和Y0
其中X₀是对角元依次递增的对角矩阵(特征值为1/d、2/d、…、d/d),Y₀是“次对角线全1”的对称带状矩阵,像一条腿的梯子。它们的交换子是一个反对称的三对角矩阵:
接下来,无论你怎么挑满足条件[X',Y']=[X',X₀]=0的逼近对(X',Y'),距离平方和都不可能小于:
定理1.2:距离平方和的下界估计公式
这就在指数2/3(即距离指数1/3)的位置钉死了一颗钉子:任何声称“比1/3更快”的估计,都会在这对矩阵上碰得头破血流。
用大白话说:作者先造了一对几乎交换的矩阵,然后证明任何“化装大师”都无法把这对矩阵“洗”成真正交换却不付出至少ε^{2/3}的代价(ε是交换子大小)。上界与下界完美咬合,指数1/3就此一锤定音。

证明思路:离散优化与连续估计的巧妙结合

这个证明最精妙的地方,在于把“连续”的矩阵逼近问题,转化成“离散”的组合优化问题。用一句话概括:先把无限维的矩阵配对问题压缩成有限个“断点”的选择,再用谱间隙约化和加权平均完成最后一击。

第一步:断点——X'的“分组方案”

因为X'与X可交换,而且X是自伴矩阵,所以它们可以同时酉对角化。于是不妨假设X和X'都是对角阵:X=diag{x₁,…,x_d},X'=diag{t₁,…,t_d}。但X'的特征值可以重复出现——这正是逼近的“自由度”所在:把多个相近的特征值合并成一个,X'的结构就变简单了。
设X'的特征值按从小到大排列,相等值构成一组。分组的分界位置就叫断点(breaking points)。比如X'的前b₁个特征值相等,接着b₂−b₁个相等,依此类推,直到b_ℓ=d。记P_j为第j个特征值对应的谱投影(把向量投影到对应特征子空间的算子)。
论文的引理2.1给出一个“偷懒工具”:只要断点固定了,最优的X'和Y'可以直接用公式写出来,根本不需要反复迭代优化。最优X'在每个特征子空间上取X的迹平均值:
最优X'的显式表达式:在每个特征子空间上取X的迹平均值
最优Y'则只保留Y在每个特征子空间内的块,把跨块元素全部清零:
最优Y'的显式表达式:分块对角部分
直观地说,要让Y'与X'可交换,Y'必须与所有谱投影P_j可交换,也就是说Y'只能是“分块对角”的。最优选择当然是保留每块内的Y、丢掉块外部分。而X'在每块内取X的平均值最划算。于是,原本复杂的矩阵逼近问题,一下子被简化成了:断点到底怎么选?

第二步:谱间隙约化——先“磨平”X的尖刺

断点选得太少,X'离X就远;断点选得太多,Y'丢掉的块外元素就多。想要两全其美,还得先解决一个麻烦:如果X的相邻特征值间隔很大(存在“大间隙”),那么X本身就呈现出一种“分裂”结构。
论文的引理3.2说:如果某个矩阵元素Y_ij对应的特征值差|x_i−x_j|足够大,而交换子整体又很小,那么可以直接把这个矩阵元素清零,而不会让最终估计变差。反复使用这个引理,就能把一个关键假设“洗”出来:
X的谱没有“大间隙”,即任何相邻特征值之差都被控制在ε^{2/3}的量级以下。这一步至关重要,它让后续的“均匀划分”策略变得可行。

第三步:按代价函数挑断点

现在到了本文真正“秀操作”的地方。定义一个断点b的代价ζ_b:
断点b的代价函数定义公式
它的含义直观而形象:如果选b作为断点,那么Y矩阵中所有“跨越”断点的元素(即i≤b且j>b的那些Y_ij)都会被丢弃。ζ_b计算的就是这些被丢弃元素模平方的总和(乘2是因为上下三角对称各算一份)。显然,所有断点处的ζ_b加起来,就是Y'相对Y的损失。
接下来的操作堪称“手术刀级”精细:先把区间[−1,1]均匀切成ℓ−1小段(ℓ大致取ε^{−1/3}量级),每段长度记为r。然后在每个小区间内,选择ζ_k最小的整数点作为“候选断点”。由于X的谱无大间隙,每个小区间内的特征值分布相当“密”,这使得断点处的代价可以被整体交换子大小“均匀吸收”。
经过精巧的求和换序、Cauchy–Schwarz不等式等一系列估计,最终得到Y侧的损失上界:
Y侧的损失上界估计公式
而X侧因为X'的每个特征值都落在X对应特征值附近的一个小区间内,距离平方自然也被ε^{2/3}控制。两部分合起来,定理1.1得证。
整个证明流程可以浓缩成一个“三步连环计”:先固定结构(断点),求得显式最优解;再用谱间隙约化保证结构可优化;最后用离散贪心加连续分析完成封顶。每一步单独看都不算惊世骇俗,但合在一起,刚好把指数推到了极限位置。

推广与延伸:多矩阵情形的处理

定理1.1只处理两个矩阵,但数学上更自然的提问是:如果手头有N个两两几乎交换的矩阵,能否把它们同时逼近成N个真正交换的矩阵?
Glebsky和Filonov–Kachkovskiy的构造有一个共同特点:它们构造出的X'不依赖Y,因此可以按“X₁→X₂→…”的次序逐次迭代,从而覆盖多个矩阵。而本文定理1.1中的断点选取是依赖Y的——这是把指数从1/6推进到1/3的关键,却也堵死了直接迭代的路径。
作者没有回避这个困难,而是给出了定理1.3:对于任意X、Y₁、…、Y_N∈B_d,存在X'、Y'₁、…、Y'_N使得:
定理1.3:可交换条件 定理1.3:多矩阵情形的距离估计公式
也就是说,一个X和N个Y_j可以“并肩逼近”,代价不超过24√N乘以所有交换子“总能量”的1/3次方。额外多出的√N因子,是多个Y_j通过Cauchy–Schwarz叠加时不可避免的代价。
进一步,利用定理1.3可以迭代得到推论1.4——N个矩阵同时交换逼近:
推论1.4:N个矩阵同时逼近的估计公式
指数变为2/(3N−1),随着N增大指数逐渐下降。作者坦承,这个指数并不期望是最优的——它只是目前已知最好的结果。
值得强调的是,虽然推论1.4的指数并不是终极答案,但它比以往任何已知结果都强。这也是论文标题中“within these constraints, the exponent 1/3 cannot be improved”的含义所在——在“两个矩阵加上与X交换”这个精确框架内,问题的答案已经尘埃落定。

数学意义与未来展望

这个1/3究竟牛在哪?不妨把它看作一张坐标系中的“收束”过程。上界一侧,指数从1/6(Glebsky)到1/4(Filonov–Safarov)再到1/3(本文),一路上攻;下界一侧,本文用反例把1/3钉死为“不可能超越之墙”。上界与下界相撞的瞬间,一个持续近百年的基本问题,就在这个特定框架内画上了句号。
论文技术上的最大突破在于:断点的选择第一次被允许同时依赖X和Y。之前Glebsky等人的构造中,断点只依赖X的谱位置,导致精度受限;本文通过代价函数ζ_b把Y的矩阵元信息注入断点选择过程,相当于让“切蛋糕的刀”学会了躲避蛋糕上的“奶油花”。这个洞察,正是指数从1/4跃升到1/3的“胜负手”。
更广泛地看,这个结果对整个“几乎交换”研究版图有连锁意义。在C*-代数中,几乎交换矩阵序列是研究迹稳定性(tracial stability)的重要测试床。指数1/3的确定,让这类定量估计的“最优标尺”终于有了标定。在量子信息理论中,可交换观测算符对应可以同时精确测量的物理量;小交换子意味着“几乎可同时测量”。本文结果说明,只要允许ε^{2/3}的误差“预算”,就能把几乎可同时测量的系统彻底“转正”为真正可同时测量的系统——而且这个预算已经是最小的。
当然,问题并没有就此终结。多矩阵情形的指数2/(3N−1)看起来仍有余地;非自伴矩阵甚至酉矩阵版本的HS范数几乎交换问题,也还有大量未开拓的空间。正如作者在文中所言:“我们并不预期它是最优的。”数学的魅力恰恰在于:每解决一个终极问题,就会在远处升起新的问号。

龙迷三问

下面是龙哥对于大家可能的一些问题的解答:
这篇论文到底在解决什么问题?本文研究归一化Hilbert–Schmidt范数下的几乎交换矩阵逼近问题,证明任意两个自伴矩阵可被可交换矩阵对逼近,距离平方和不超过交换子范数的2/3次幂,且指数1/3不可改进。该结果同时被推广至多矩阵情形。
这篇工作最值得看的点是什么?本文为纯理论数学论文,无实验部分。主要结果包括:定理1.1给出指数1/3的逼近估计(常数可取24);定理1.2证明该指数不可改进;定理1.3将结果推广到多个矩阵情形;推论1.4给出N个矩阵的迭代估计。
这篇工作的边界或风险在哪里?优点:1) 首次在归一化Hilbert-Schmidt范数下获得指数1/3的定量结果,且证明指数最优;2) 证明方法新颖,将离散优化与连续估计相结合;3) 结果可推广到多个矩阵情形。缺点:1) 常数较大(24),未做优化;2) 定理1.1的结论不能直接迭代到多个矩阵,需要额外修改;3) 推论1.4的估计可能不是最优的。
如果你还有哪些想要了解的,欢迎在评论区留言或者讨论~

龙哥点评

论文创新性分数:★★★★☆

本文通过将几乎交换矩阵问题分解为离散优化与连续优化两部分,利用谱间隙假设和加权平均估计,证明了在归一化Hilbert-Schmidt范数下存在指数为1/3的定量逼近结果,并证明该指数不可改进。

实验合理度:★★★☆☆

现有材料未完整覆盖数据划分、基线公平性和统计显著性,因此按中性评价处理。

学术研究价值:★★★★☆

本文通过将几乎交换矩阵问题分解为离散优化与连续优化两部分,利用谱间隙假设和加权平均估计,证明了在归一化Hilbert-Schmidt范数下存在指数为1/3的定量逼近结果,并证明该指数不可改进;更关键的是问题定义是否可复用到同类任务。

稳定性:★★★☆☆

现有材料未提供充分的极端条件、重复运行或扰动测试,稳定性暂按中性评价。

适应性以及泛化能力:★★★☆☆

现有材料未完整展示跨数据集、跨场景或分布外实验,泛化能力仍需进一步验证。

硬件需求及成本:★★★☆☆

现有材料缺少完整训练资源、参数量、显存和推理时延信息,成本暂按中性评价。

复现难度:★★★☆☆

现有材料未确认完整代码、配置、数据处理脚本和权重是否齐备,复现难度暂按中性评价。

产品化成熟度:★★★☆☆

论文验证以研究实验为主,真实部署中的时延、成本、维护和异常场景仍需补充验证。

可能的问题:1) 常数较大(24),未做优化;2) 定理1.1的结论不能直接迭代到多个矩阵,需要额外修改;3) 推论1.4的估计可能不是最优的。

主要参考文献

[1] Glebsky L., Almost commuting matrices with respect to normalized Hilbert-Schmidt norm, arXiv:1002.3082 (2010).
[2] Filonov N., Kachkovskiy I., A Hilbert-Schmidt analog of Huaxin Lin's theorem, arXiv:1008.4002.
[3] Filonov N., Safarov Y., On the relation between the operator and its self-commutator, J. Funct. Analysis 260 (2011), 2902–2932.
[4] Friis P., Rørdam M., Almost commuting self-adjoint matrices — a short proof of Huaxin Lin's theorem, J. Reine Angew. Math. 479 (1996), 121–131.
[5] Hastings M., Loring T., Almost commuting matrices, localized Wannier functions, and the quantum Hall effect, J. Math. Phys. 51 (2010), no. 1, 015214.
[6] Choi M.-D., Almost Commuting Matrices Need not be Nearly Commuting, Proc. Amer. Math. Soc. 102 (1988), no. 3, 529–533.
[7] Dor-On A., Hall L., Kachkovskiy I., On almost commuting unitary matrices, arXiv:2510.03674 (2026).
[8] Atkinson S., Some Results on Tracial Stability and Graph Products, Indiana Univ. Math. J. 70 (2021), no. 3, 1167–1187.
论文原文链接:https://arxiv.org/pdf/2608.31000v1.pdf

end
交换子轻轻一抖,距离指数握在手;
矩阵逼近到最优,龙哥群里来交流!🍻
欢迎加入龙哥读论文粉丝群,扫描下方二维码或者添加龙哥助手微信号加群:kangjinlonghelper。一定要备注:研究方向+地点+学校/公司+昵称(如 数学+上海+复旦+龙哥),根据格式备注,可更快被通过且邀请进群。
『龙哥读论文』微信群目前包含:图像处理、大模型及智能体、自动驾驶及机器人、AI医疗及AI金融5个群,数学与基础理论同好也在集结中~
wechat_helper dianzan

*本文仅代表个人理解及观点,不构成任何论文审核或者项目落地推荐意见,具体以相关组织评审结果为准。欢迎就论文内容交流探讨,理性发言哦~ 想了解更多原文细节的小伙伴,可以点击"阅读原文",查看更多原论文细节哦!       

转发文章 微博 X LinkedIn Facebook
龙哥读论文 · PaperDaily

本文基于龙哥读论文 PaperDaily 数据库整理,结合论文原文与工程视角进行解读。