← 返回 PaperDaily
大模型与智能体
卡内基梅隆提出MultiPathFormer:无线基础模型告别信道张量,多径预测让定位误差骤降至5.57
把大语言模型那套自回归玩法搬到无线信道建模里,还顺势治好了“信道张量混合多路径信息”的老毛病。卡内基梅隆大学提出的MultiPathFormer,首次在路径级别做预训练,定位误差从68米干到5.57米,属实有点东西。
龙哥读论文
发布于 2026-08-14 09:12:30
阅读 4
查看原文
原论文信息如下:
引言:多径传播如何成为无线基础模型的新预训练范式?
想象一下这个场景:同一部手机在同一个房间里,信号从基站出发,一路直达,一路撞墙反弹,一路被窗户折射,一路在街角绕射,最终在接收端叠加成一股“混合信号”。这就是无线通信里最经典也最让人头疼的多径传播现象。传统做法拿到的信道张量,实际上就是这些路径的大杂烩——谁也不知道里面藏着几条路、每条路多强、从哪个角度来。
已有的无线基础模型,比如WiFo和Large Wireless Model(LWM),都在信道张量上做掩码重建。思路听着顺理成章,但问题在于:信道张量把可解释的物理参数(路径数量、时延、功率、角度)全搅在一起,还绑死了天线配置和子载波采样方式。这就好比让一个大语言模型直接去学习一篇用特殊字体排版且句子顺序完全打乱的文章,难度直线上升。
卡内基梅隆大学的研究者们换了个角度:既然信道是路径的叠加,那不如直接在路径级别做预训练。他们把收发链路表示成一段按功率降序排列的路径序列,用类似大语言模型的下一词预测方式来训练,只是这里的“词”变成了连续值路径描述符,包含时延、功率、相位、到达角、离开角和交互类型。这套方法被命名为MultiPathFormer。
这里要先说清楚一个核心逻辑:为什么路径级别比信道级别更根本?看一下信道张量的数学表达式就明白了。频域子载波上的信道响应是若干条路径的复指数叠加,每条路径由复增益、时延和到达/离开角度描述。信道级预训练需要从混合信号里反推环境结构,而路径级预训练直接面对物理参数本身,保留了路径数量可变、主路径占优、角度几何结构等物理特征。这就像一个是直接看菜谱学做菜,另一个是先吃完菜再猜菜谱,难度完全不在一个量级。
做这个选择需要回答三个问题:第一,怎么对连续取值的变长路径序列做自回归预测?第二,怎么处理和稳定主路径的生成?第三,怎么把收发链路相关的环境上下文检索出来辅助路径预测?这三个问题对应了MultiPathFormer的三项关键设计:自回归路径生成框架、首路径簇码本(First-Path Cluster Codebook)和环境检索增强生成(Environmental RAG)。
问题背景及相关工作
在聊MultiPathFormer之前,先回顾一下无线基础模型这个赛道的发展脉络。
最早的探索可以追溯到Large Wireless Model(LWM),它用BERT风格的掩码信道建模,在天线和子载波维度上做预训练,得到上下文相关的信道嵌入表示,用于LoS分类和波束预测。WiFo把输入扩展到3D信道张量,用掩码自编码器增强重建能力,在时间、频率和空间三个维度上捕捉信道演变。WirelessGPT更进一步,把这类模型应用到了人类活动识别和环境重建。ChannelGPT则尝试把大模型接入网络反馈回路,让模型能响应物理环境和网络性能的变化。
这些工作有一个共同点:把信道张量当作预训练对象,目标函数是某种掩码信道建模(Masked Channel Modelling,MCM)的变体。问题是,信道张量把多条路径叠加成了一个整体,路径的数量和属性全被混在一起,模型很难从中分离出真正由环境决定的物理结构。
在任务特定的无线模型方向,早期工作包括用MLP从sub-6 GHz信道预测毫米波波束和阻塞状态,用深度神经网络做低开销导频到波束选择的映射,以及CsiNet这类面向大规模MIMO信道压缩和重建的自编码器架构。这些工作证明了神经网络在信道恢复上的价值,但本质还是信道矩阵方法,没有显式建模传播路径。
MultiPathFormer的定位很清晰:第一个把预训练对象从信道张量升级为多径序列的无线基础模型。它的预训练数据来自27个环境场景的2390万个多径令牌,在31个场景上做了全面评估,主路径时延误差降低38.7%,路径功率误差降低59.2%。
方法概述
MultiPathFormer的整体框架可以概括为“一个主干、两个增强”。主干是一个编码器-解码器Transformer架构,负责从发射机、接收机位置和环境特征中提取表示,并自回归地生成多径序列。两个增强分别是环境RAG模块和首路径簇码本。
先说数据流。给定一个环境、一个发射机和一个接收机,模型拿到三类输入:发射机地理坐标、接收机地理坐标、环境特征。编码器把这三类输入编码成环境表示,同时监督预测路径数量。解码器以环境表示和已生成的路径序列为条件,逐步预测下一条路径的参数。环境RAG模块检索局部和走廊对象,生成链路特定的几何上下文。首路径簇码本则通过KMeans聚类为第一条路径提供粗粒度先验,模型只需要预测残差修正量。
这个设计要解决的第一个问题是路径排序。语言模型里的词有天然的时序顺序,但无线多径没有。论文选择了按功率降序排列路径,把最强的路径放在最前面。这符合物理直觉:第一条路径通常携带最大能量,很大程度上决定了链路的整体特征。模型在序列开头加入一个零值起始令牌,并在生成结束时显式预测路径数量来终止生成。
核心设计:环境RAG与码本机制注入场景几何的两种创新设计
环境RAG模块解决的是一个很实际的问题:把整个环境的描述一股脑塞给模型,信息量太大而且大部分不相关。一条链路的路径只和接收机附近的物体以及收发机连线附近的物体有关。
模块具体做三件事。第一,局部稠密检索:以接收机或发射机位置为中心,在最大半径内取最近的K个物体,保留距离、高度、占地面积和材料属性等稠密描述。第二,走廊稠密检索:把每个物体的质心投影到收发机连线上,计算质心到投影点的距离,取距离最近的K个物体。第三,稀疏多尺度摘要:围绕发射机和接收机,在不同半径内统计物体数量和最大高度;沿着收发机走廊划分若干区间,统计每个区间内的物体密度和高度变化。最后把三部分拼接成完整的检索上下文。
首路径簇码本则处理另一个问题:第一条路径在自回归生成中的错误会传播到后续所有路径。语言模型里每个token的重要性差不多,但无线路径不是这样。第一条路径通常是最强路径,它的时延和功率决定了信道的粗略尺度。
码本的做法不复杂但对效果很关键:对每个发射机,在其覆盖的所有接收机上对首路径的功率和时延做KMeans聚类。因为基站位置固定,邻近接收机往往具有相似的首路径结构,聚类结果会形成空间上连贯的区域。测试时,新接收机通过最近邻方式从训练接收机中获取簇分配,由此得到首路径先验。模型只需预测码本先验的残差修正量,大大减轻了第一步生成的压力。
模块之间的衔接逻辑很清楚:码本提供“默认假设”,RAG提供“场景证据”,Transformer负责“精细化推理”。三者各司其职,码本解决首路径稳定性,RAG提供链路特定的环境上下文,Transformer则专注于完整的连续路径参数预测。
多路径传播如何成为无线基础模型的新预训练范式?
先看一张公式截图,这是现有无线基础模型普遍采用的预训练目标——掩码信道建模(Masked Channel Modelling,MCM):
这个目标函数在WiFo、Large Wireless Model(LWM)等一系列工作中被反复使用。原理不复杂:拿信道张量,遮住一部分,让网络把缺失值猜出来。但问题恰恰出在“信道张量”这个预训练对象上。信道张量是把多条传播路径在频域上叠加后的结果,路径数量、每条路径的时延和角度、天线响应、子载波采样方式全部纠缠在一起。在这种对象上做自监督学习,模型很难把“环境决定的物理结构”从“系统配置带来的影响”中剥离出来。
MultiPathFormer的解法是:把预训练对象从信道换成多径序列。论文把每条发射机-接收机链路表示成一组按功率降序排列的路径,每条路径用一个8维连续向量描述,包括路径功率、时延、相位、到达方位角和俯仰角、离开方位角和俯仰角、交互类型(反射、绕射、散射、视距)。这是一个标准的自回归序列建模问题:
p θ(P | xm) = ∏t=1..L p θ(πt | π<t, xrx, xtx, xenv)
把大语言模型那套“下一个词预测”搬到无线物理层,听着很顺,但落地有三个坎。
第一,语言模型面对的是离散词表,而路径参数是连续值。没有词汇表可用,模型必须直接回归出每个路径的物理参数。第二,语言有天然的时间顺序,多径没有。论文的解决办法是按功率降序排列——最强的路径排最前面,后面路径的预测都依赖这条最强路径。第三,语言模型用终止符结束句子,但连续回归空间里没有“终止”这个概念。MultiPathFormer用一个独立的回归头显式预测路径数量,数量预测到了就停止生成。这条路径数量预测公式如下:
训练损失由三部分组成:路径参数的L2回归损失、路径数量的平方损失、交互类型的交叉熵损失。三部分加权求和,用标准反向传播端到端训练。整体结构是一个编码器-解码器Transformer,编码器从发射机位置、接收机位置和环境特征中提取全局表示,解码器在这个表示条件下逐步生成路径。后面讨论的两个增强模块——环境RAG和首路径簇码本——就架在这个主干上。
环境RAG与码本机制:注入场景几何的两种创新设计
有了自回归路径生成框架,下一个问题是:模型怎么知道当前链路处在什么环境里?
最朴素的做法是把整个环境的描述向量喂给模型。但一个真实的城市环境里有成百上千栋建筑,一条链路的传播路径只和接收机附近的物体以及收发机连线附近的物体有关。全局描述信息量太大,噪声太多,模型很难从中挑出真正影响这条链路的场景要素。环境RAG(Retrieval Augmented Generation,检索增强生成)模块就是来解决这件事的。
环境RAG做三件事。第一是局部稠密检索:以接收机或发射机位置为中心,在给定半径内找最近的K个物体,保留距离、高度、占地面积、材料属性这些稠密特征。第二是走廊稠密检索:把每个物体的质心投影到收发机连线上,算质心到投影点的距离,取最靠近连线的K个物体。第三是稀疏多尺度摘要:围绕发射机和接收机,在不同半径范围内统计物体数量和最大高度;再把收发机连线划分成若干区间,逐区间统计密度和高度变化。三部分拼接起来,就得到这条链路专属的环境上下文。
码本机制解决的是另一个问题:首路径的稳定性。在自回归生成里,第一步的错误会一路传播到后面所有路径,而无线传播恰恰又是由一条最强路径主导的。如果这条路径的时延和功率预测偏了,后面全崩。
论文观察到,在固定发射机下,空间上邻近的接收机往往具有相似的首路径时延和功率,因为大尺度几何、遮挡结构和视距/一阶反射条件接近。于是对每个发射机覆盖的所有训练接收机,用KMeans对首路径功率和时延做聚类,得到K个簇中心。测试时,新接收机先在训练接收机里找最近邻,继承最近邻的簇分配,从而拿到一个首路径的粗粒度先验。模型要做的事情从“凭空预测整条路径”简化为“在先验基础上预测残差修正量”。这个设计和Retrieval-Augmented Generation的思想有异曲同工之处——先用检索到的知识给模型一个立足点,再让模型做精细化推理。
图4展示了一个城市场景中的路径生成实例。三个模块的配合逻辑可以概括为:码本提供“默认假设”,RAG提供“场景证据”,Transformer负责“精细化推理”。少了任何一个,生成质量都会掉一截。
27个场景预训练,跨场景迁移与微调效果如何?
预训练数据来自27个环境场景,累计2390万个多径令牌。评估覆盖31个DeepMIMO场景,其中27个参与预训练,另外4个完全未见的场景用于测试跨场景泛化能力。
表1报告了三个配置的对比:直接自回归基线、加码本、码本+环境RAG全配置。结论很明确:全配置相比基线,时延MAE降低38.7%,功率MAE降低59.2%,角度误差和交互分类也同步改善。这说明码本的粗粒度先验和环境RAG的场景上下文确实在各自发挥作用。
图3进一步展示了训练数据规模的影响:即便训练用户数量大幅缩减,MultiPathFormer的MAE也维持在较低水平。这对实际部署很友好——基站侧收集多径标注数据并不便宜。
表2揭示了两个关键事实。第一,零样本迁移在未见场景上还有明显短板,后面细说。第二,在场景特定微调条件下,预训练权重比随机初始化强得多。这说明路径级预训练确实学到了可复用的物理传播表征,而不是简单记住了训练场景。
四大下游任务全面超越:波束预测、定位、LoS识别与信道估计
预训练模型的价值最终要落到下游任务上。论文选了四个无线通信里最有代表性的任务:用户定位、波束预测、视距(Line of Sight,LoS)分类、信道估计。
从表3的数据看,MultiPathFormer取得平均定位误差5.57米、top-3波束预测准确率0.914、LoS分类准确率0.994、信道估计NMSE 0.561。相比LWM和WiFo,波束预测提升最多30%,LoS分类提升3%,定位误差相比基线最多降低65米,信道估计NMSE从1.312以上降到0.561。
特别值得注意的是波束预测的提升幅度。毫米波和大规模MIMO系统里,波束选择的准确率直接决定链路质量。预训练路径生成模型能学到场景中反射体的大致位置,自然比信道级预训练更适合波束级推理。
图5展现了环境RAG的另一个隐性收益:空间一致性。没加RAG时,相邻位置预测的到达角可能跳来跳去;加上RAG后,模型借助局部物体几何信息,预测角度在空间上连贯多了。
表4的推理时间也给产品落地留了余地。三个配置的推理时间都在毫秒级,平均而言并未因为环境RAG的检索操作而显著变慢。
零样本迁移的局限与未来方向
表2第一块的结果值得认真解读。预训练模型在27个场景的留存用户上表现稳健,但在4个未见场景上,零样本路径生成的误差明显高于场景内迁移。这说明MultiPathFormer的零样本跨场景能力还不算真正的“全能”。
原因也好理解:路径的生成高度依赖场景几何——建筑的分布、高度、密度直接决定了反射和遮挡结构。一个全新的城市布局在预训练里从未出现过,模型只能靠发射机和接收机的坐标“猜”环境长什么样。码本先验也依赖预训练场景里的发射机拓扑,新发射机没有对应的聚类簇。环境RAG虽然能拿到新场景的3D物体信息,但模型没见过这种物体组合模式,检索到了也不见得会用。
未来的改进方向也藏在问题里。第一,扩大预训练场景的多样性,让模型见过足够多种城市形态,零样本迁移能力自然提升。第二,引入在线微调机制,新场景只靠少量无标注数据快速适应。第三,把码本从“每个发射机独立聚类”升级为跨场景共享的传播模式先验。第四,路径级表征和信道级任务解码器之间的衔接还有优化空间,比如让预训练目标直接对齐特定下游任务的性能。
龙迷三问
这篇论文到底在解决什么问题? 卡内基梅隆大学提出MultiPathFormer,首个以多径传播为预训练对象的无线基础模型。通过自回归路径预测、环境RAG与首路径码本,在波束预测、用户定位、LoS分类和信道估计…
这篇工作最值得看的点是什么? MultiPathFormer在所有下游任务中均优于基于信道的SOTA基础模型:波束预测Top-3准确率0.914(优于WiFo 0.616、LWM 0.648),平均定位误差5.57米(WiFo为68.79米,LWM为72.78米),L…
这篇工作的边界或风险在哪里? 优点:(1)首次将多路径传播作为预训练对象,比信道张量更接近物理本质,具有更好的可解释性和表征复用性;(2)环境RAG和码本机制创新性地将场景几何知识融入基础模型,显著提升路径预测精度;(3)自回归公式化与语言模型相似但适配连续值路径序列…
如果你还有哪些想要了解的,欢迎在评论区留言或者讨论~
龙哥点评
论文创新性分数: ★★★★☆
首个把预训练对象从信道张量换成多径序列的无线基础模型,自回归连续值路径预测的范式本身就有开创性。码本+RAG的组合也体现了对物理场景的深入思考。
实验合理度: ★★★★☆
31个场景、4个下游任务、多个消融变体,实验设计比较完整。扣一星是因为对比基线LWM和WiFo都属于早期工作,缺少与更新的信道基础模型的直接对比。
学术研究价值: ★★★★☆
把大语言模型的预训练范式系统性地迁移到无线物理层,并给出了完整的解决方案,对后续无线基础模型研究有很强的启发意义。
稳定性: ★★★☆☆
依赖3D环境模型和码本先验,新场景零样本性能明显下降,需要场景特定微调。在真实部署中环境数据质量和基站拓扑变化都会影响稳定性。
适应性以及泛化能力: ★★★★☆
跨场景微调优于从头训练,说明预训练表征有较好的泛化基础。但纯零样本跨场景还有差距,不能算全覆盖。
硬件需求及成本: ★★★★☆
推理端毫秒级延迟,算力要求不高。预训练阶段和DeepMIMO数据生成的具体计算成本论文未详细披露,但整体在学术实验室可承受范围。
复现难度: ★★★☆☆
论文发布了预训练权重和数据集,环境3D模型可基于公开地图数据构建,但完整训练代码未明确开源,多径数据提取和环境预处理有一定工程门槛。
产品化成熟度: ★★★☆☆
波束预测和定位任务的效果已经接近实际部署需求,且推理延迟低。但环境依赖和零样本短板限制了在快速变化的城市环境中的大规模落地,更适合基站侧场景固定的无线网络。
可能的问题: 路径级预训练依赖高质量3D环境模型和高精度多径标注,真实系统获取成本高;与更近期的信道基础模型缺少横向对比,说服力打折扣;码本机制在发射机位置频繁变化时不友好。
主要参考文献
[1] MultiPathFormer: Towards a Foundation Model for Multipath Wireless Propagation. arXiv:2608.05076v1.
[2] WiFo: Wireless Foundation Model for channel prediction(论文引用[16])
[3] Large Wireless Model (LWM):基于掩码信道建模的无线基础模型(论文引用[18])
[4] WirelessGPT: 面向感知任务的无线基础模型(论文引用[19])
[5] CsiNet: 大规模MIMO信道压缩与重建(论文引用[31])
*本文仅代表个人理解及观点,不构成任何论文审核或者项目落地推荐意见,具体以相关组织评审结果为准。欢迎就论文内容交流探讨,理性发言哦~ 想了解更多原文细节的小伙伴,可以点击 "阅读原文", 查看更多原论文细节哦!