← 返回 PaperDaily 视觉与图像

CMU+Apple提出RayRoPE:多视图位置编码终于统一了

多视图Transformer最怕什么?不是算力不够,而是位置编码“认不出同一块内容”。RayRoPE直接把patch绑到射线上,再让模型自己猜深度、补不确定性,结果就是:既要几何一致,又要多频细节,还能保持SE(3)不变。Apple Research这篇,属于把老问题拆开后重新装对了。🤨

CMU+Apple提出RayRoPE:多视图位置编码终于统一了
原论文信息如下:
论文标题:
RayRoPE: Projective Ray Positional Encoding for Multi-view Attention

发表日期: 2026年01月

发表单位: Carnegie Mellon University, Apple

原文链接: https://arxiv.org/pdf/2601.15275

项目链接: https://rayrope.github.io/

演示链接: https://rayrope.github.io/assets/web-teaser.mp4

demo_gif
图:方法动画演示。射线投影、深度预测和不确定性建模被串成一条线,位置编码不再只是“记坐标”,而是开始“理解场景几何”。
如果把多视图注意力比作一群人隔着不同窗户看同一个房间,传统位置编码常常像是在门口贴标签:谁从哪扇窗看过来、坐标是多少,记得倒是清楚,但不一定认得出“这是不是同一个角落”。RayRoPE的思路更狠一点:不盯着平面坐标打转,而是直接把patch写成一条射线段,再投到查询视角里做相对编码。这样一来,同一块内容在不同图里更容易对上号,注意力也更容易沿着真实三维关系去算,而不是被全局坐标系带偏。
这篇论文最有意思的地方在于,它没有把“位置编码”当成一个纯粹的附属件,而是把它抬到了多视图理解的核心位置。结果也很直接:在新视图合成、立体深度估计和3DGS重建这些任务上,RayRoPE都能稳定压过现有方案,而且额外开销并不夸张。对于真正做3D视觉系统的人来说,这种“更懂几何、还不太贵”的改法,才算是能落地的好改法。
图2:RayRoPE整体框架图
图2:RayRoPE整体框架。每个patch先被表示成射线段,再预测深度和不确定性,随后投影到查询相机坐标系里做相对位置编码,最后把编码施加到注意力的查询、键、值和输出上。
图1:多视图位置编码的四个目标
图1:多视图位置编码的四个目标。既要SE(3)不变,又要保证同一patch在不同视图里编码一致,还要能随场景几何变化,并且保留多频率相似性。
下面这类方法其实都在同一个坑里打转:单图像里,二维坐标很好用;一旦变成多视图,patch不再属于一个固定平面坐标系,老办法就容易“认脸不认人”。RayRoPE要解决的,就是这个多视图Transformer最别扭的基础问题——如何给来自不同相机、不同视角、甚至不同裁剪区域的token,找到一个既统一又不失几何意义的位置表示。
从论文的定义看,RayRoPE盯住的是四件事:第一,注意力结果不能依赖全局坐标系;第二,同一块patch跨视图观察时,编码要一致;第三,编码最好能跟场景几何挂钩,看到同一个三维点时应该更像;第四,像普通RoPE那样,不同频率的通道也要能表达不同尺度的空间关系。说人话就是:既要“认得出”,也要“算得准”,还不能把高频细节一脚踢飞。
原论文里对比得很直接:传统绝对位置编码太死板,换个视角就容易失真;基于相机姿态的相对编码虽然解决了坐标系问题,却往往只记“相机之间的关系”,没有真正把“这个patch在三维空间里到底落在哪”说清楚。RayRoPE的妙处就在这里,它不是简单给相机加标签,而是把patch对应的射线段放进查询视角里重新编码,让相对关系和场景几何一起进场。
图:新视图合成对比结果
图:新视图合成对比结果。左到右依次是Ground Truth、Plücker、GTA、PRoPE和RayRoPE,可以很直观看到RayRoPE在细节锐度和三维一致性上的优势。
图:方法动画演示与新视图合成对比。前者解释“怎么做”,后者展示“做得怎么样”。一个讲机制,一个讲结果,配在一起正好能看出RayRoPE不是靠玄学赢的,而是把位置编码这件事重新按几何逻辑梳理了一遍。

从多视图到统一编码:RayRoPE如何弥补位置编码的鸿沟

多视图Transformer最烦的,不是“看不见”,而是“看见了也对不上号”。单张图里,patch 的位置还能老老实实用二维坐标记住;一旦换成多相机、多视角,token 来自不同图片,甚至不同裁剪区域,原来那套“左上角、右下角”的思路立刻失灵。RayRoPE 盯住的,就是这个基础但很要命的问题:如何给多视图 token 一个既统一、又能保住三维几何意义的位置表示。
论文先把目标说得很清楚:多视图位置编码最好同时满足四件事,分别是 SE(3) 不变性唯一性几何自适应性多频率相似性。说人话就是:注意力不能被全局坐标系带偏,同一块内容跨视角要认得出来,编码还得跟场景深度结构挂钩,同时不能把高频细节也一并抹平。
图1:多视图位置编码的四个目标
图1:多视图位置编码的四个目标。RayRoPE 想要的不是单纯“记坐标”,而是让注意力在不同视角、不同频率、不同几何关系下都能保持稳定。
这篇工作的关键不是“再发明一个编码名字”,而是把现有方案的短板拆开看。绝对位置编码(APE,Absolute Positional Encoding,绝对位置编码)能记住图像内部坐标,却没法自然处理多视图;相对位置编码(RPE,Relative Positional Encoding,相对位置编码)能缓解一部分问题,但多数做法只记相机姿态,或者再补一层二维 RoPE,结果往往又把“同一块 patch 跨图一致”这件事搞丢了。RayRoPE 的思路更直接:不把 patch 当成平面上的点,而是当成一条射线上的位置。
这里先补一个基础概念。多视图任务里的一个 patch,背后其实对应相机中心发出的一条 射线。如果只知道射线方向,就知道“往哪看”,但不知道“看到了多远”;如果再知道深度,就能把这个 patch 约束到射线上的某个三维点。RayRoPE 正是把这个“射线 + 深度”的组合,变成位置编码的基本单位。

SE(3)不变性与几何适应性:RayRoPE的核心创新

RayRoPE 先做了一件看似朴素、其实很关键的事:把图像 patch 表示成一段射线段 x = (c, pd),其中 c 是相机中心,pd 是射线在深度 d 处的三维点。这样一来,同一 patch 跨视图观察时,本质上对应的是同一条几何关系,而不是某个图片角落里的像素编号。
但只用“射线”还不够。射线本身在全局坐标系里会随着相机摆放方式变化而变化,这会让注意力对“世界怎么摆”过于敏感。RayRoPE 的第二步,是把射线投影到查询视角的相机坐标系里,再在这个查询帧中计算编码。这样,注意力只依赖于相对相机关系,而不是依赖某个任意的全局坐标系。论文里把这点称为 SE(3) 不变性,其中 SE(3) 指的是三维空间中的刚体变换,也就是平移加旋转。
图2:RayRoPE整体框架
接下来是更有意思的一层:深度不是预先给定的,而是让 token 自己预测。论文在每个注意力层上加了一个线性层,从 token 特征里回归出深度 d。没有额外监督,模型自己学。这个设计很像让每个 patch 在脑子里问一句:“我看到的这个东西,到底离我多远?”
这一步的价值在于,位置编码不再只是静态标签,而开始和场景几何互动。比如一个 patch 如果确实对着同一个三维点,它在编码空间里就应该更接近;如果只是“看起来像”,但实际上看到的是不同深度的两个点,编码就不该强行贴在一起。这个差别看上去微妙,做新视图合成时却很要命,因为高频细节和三维一致性都靠它撑着。
图3:RayRoPE作用于注意力及效率分析
图3:RayRoPE如何接入注意力,以及它的效率代价。左图说明深度和不确定性如何从 token 特征中预测出来;右图说明额外计算并没有把速度拖垮,整体开销仍然很克制。
论文还补了一个很工程化的细节:不确定性。深度预测再聪明,也不可能每次都一锤定音。于是 RayRoPE 让模型同时预测一个 σ,用来表示深度区间的不确定范围,再对这个区间上的 RoPE 做期望计算。这里的 RoPE 是 Rotary Positional Encoding,旋转位置编码,它的核心是用不同频率的旋转去编码位置关系。RayRoPE 没有丢掉这个多频率优势,而是把它搬到了多视图几何里。
这招挺聪明。高频通道对位置变化很敏感,深度估错一点就容易抖;加入不确定性后,编码不会死盯单点,而是会在一个范围里“平均一下”,相当于给注意力上了个稳压器。既保留几何信息,又避免深度噪声把编码搞炸,属于很典型的“数学上不花哨,工程上很实用”。

无监督深度涌现:注意力如何“学会”看场景结构

RayRoPE 最值得细看的地方,不是“预测深度”这四个字,而是它没有用深度监督。也就是说,模型并不是先被喂一堆深度标签,再去学一个辅助任务;它是在新视图合成、立体深度估计这些主任务里,自己把深度结构“长”出来的。这个现象,论文里称为 emergent depth,可以理解为“几何理解在注意力里自己冒出来了”。
图5:预测深度与不确定性的演化
图5:预测深度与不确定性的演化。左图显示,深度误差越大,不确定性通常也越高;右图显示,随着层数加深,深度图越来越像样,不确定性则逐渐下降。
这个结果很重要,因为它说明 RayRoPE 的深度不是装饰品。前几层特征还比较模糊时,不确定性大;到了后几层,特征逐渐稳定,深度估计也开始和真实结构对齐。换句话说,模型不是一上来就“假装知道”,而是先承认自己不太确定,再慢慢把场景结构捋顺。这个过程对多视图注意力很友好,因为注意力本来就擅长在上下文中逐步修正判断。
论文还做了消融实验来证明这不是“玄学联动”。去掉不确定性,性能会掉;去掉深度预测,几何自适应没了,性能也掉;去掉多频率编码,细节和相似性表达能力下降,性能继续掉;连 value 和 output 上的编码也拿掉,效果还会再差一点。这个结果的意思很朴素:RayRoPE 不是靠某一个小技巧撑起来的,而是几个设计点一起咬合,缺一个都不完整。
图6:分布外鲁棒性
图6:分布外鲁棒性。即便测试时参考视图数量变化,或者换到训练时没见过的数据集,RayRoPE 依然能保持优势。
这点对工程落地尤其关键。很多方法在固定设置下看着很强,一旦参考视图数变了、场景类别变了,性能就开始“表演性失真”。RayRoPE 在分布外评测里还能稳住,说明它学到的不是某个数据集上的投机模式,而是更通用的几何关系。对于真要做系统的人来说,这比单点刷分更有意义。

全面超越:RayRoPE在新视图合成与下游任务中的亮眼表现

论文先在新视图合成上验证 RayRoPE,把它接到 LVSM 这类多视图生成框架里,和 Plücker raymap、GTA、PRoPE 这些位置编码方案正面对比。结果不是“略有提升”,而是多个数据集上都稳定更好,尤其在 RE10K 上的 LPIPS 有大约 24% 相对改进。LPIPS 越低越好,说明感知质量更接近真实图像。
表1:新视图合成主结果对比
表1:新视图合成主结果对比。RayRoPE 在 CO3D、Objaverse 和 RE10K 上都优于现有位置编码方案,小模型和大模型都成立。
从图像质量上看,RayRoPE 的优势不是“更锐一点点”这么简单,而是更容易保持三维一致性。对比图里,基线方法在纹理边缘、重复结构和遮挡区域常常会糊成一团,RayRoPE 则更像是沿着真实几何把细节补出来。尤其在参考视角覆盖较少时,这种差异更明显,因为模型不能靠偷看太多邻近信息,只能靠位置编码去推断结构。
图4:新视图合成定性对比
图4:新视图合成定性对比。RayRoPE 生成的结果更有三维一致性,细节也更稳,不容易出现“看着像,但其实不对”的伪细节。
更有意思的是,RayRoPE 还能吃进已知深度信息。论文做了一个实验:如果参考视图本来就有深度图,那就直接把预测深度替换成真实深度。结果表明,RayRoPE 能自然利用这类额外几何信息,而且收益比没有深度时更大。这个细节说明它不是“只会瞎猜深度”,而是一个真正能接住几何先验的编码框架。
表3:已知深度条件下的新视图合成
表3:已知深度条件下的新视图合成。RayRoPE 可以直接利用真实深度,说明它对几何先验是“兼容”的,而不是“排斥”的。
除了新视图合成,论文还把 RayRoPE 放进了立体深度估计和 3DGS 重建这些任务里。立体深度估计里,它接到 UniMatch 的跨图注意力上,能得到更准的深度预测;3DGS 重建里,它接到 TokenGS 之类的框架中,也能让最终渲染更稳。虽然这些任务的目标不完全一样,但它们都依赖同一件事:多视图 token 之间的关系要算对。RayRoPE 正好卡在这个公共接口上。
表2:消融实验结果
表2:消融实验结果。去掉不确定性、深度预测、多频率编码或 value/output 编码,性能都会下降,说明各个模块不是摆设。
图7:立体深度估计的三维点重投影对比
图7:立体深度估计的三维点重投影对比。RayRoPE 的深度结果更准确,因此重建出来的三维点也更贴合真实结构。
图9:TokenGS定性结果
图9:TokenGS定性结果。接入 RayRoPE 后,3DGS 的渲染质量更稳,说明这种位置编码对重建类任务同样有效。
图10:EscherNet定性结果
图10:EscherNet定性结果。对于条件生成类多视图模型,RayRoPE 也能帮助生成更一致、更自然的目标视图。

即插即用:RayRoPE架构如何赋能多视图Transformer

RayRoPE 另一个很讨喜的地方,是它没有把自己做成“只能在特定模型里跑”的定制件。论文明确强调,它是一个可以直接接入多视图注意力模块的 即插即用方案。只要模型本来就在处理带相机信息的多视图 token,就能把 RayRoPE 接进去。
工程上,它的实现也不算离谱。虽然每个 token 都要预测深度和不确定性,还要按查询视角做投影编码,但注意力本身本来就是 token 数量驱动的主耗时,RayRoPE 只是多了一层很轻的几何计算。论文给出的效率分析显示,相比 PRoPE,训练时大约只增加 4% 开销,推理时大约增加 13% 开销。这个代价换来的是跨数据集、跨任务、跨视图数的稳定提升,性价比并不差。
图11:不同参考视图数量下的鲁棒性
图11:不同参考视图数量下的鲁棒性。即使测试时参考视图数变多或变少,RayRoPE 也能保持优势,说明它没有把训练时的视图配置当成死规则。
如果把这篇论文放到更大的脉络里看,它其实在回答一个老问题:多视图 Transformer 到底该怎么“记位置”?以前很多方法把答案写成“记相机”或者“记像素”;RayRoPE 给出的答案更像是“记射线、记深度、记不确定性,再在查询视角里统一起来”。这套逻辑很顺,也更接近三维世界本来的样子。
项目整体效果展示视频
项目整体效果展示视频:可以先看这个演示,再回头看方法细节,会更容易理解 RayRoPE 为什么不是“换个编码名字”,而是在重写多视图注意力的几何接口。
方法详细动画
方法详细动画:射线投影、深度预测和不确定性建模串起来之后,位置编码不再只是“记坐标”,而是开始“理解场景几何”。

龙迷三问

下面是龙哥对于大家可能的一些问题的解答:

这篇论文到底解决了什么问题?它解决的是多视图 Transformer 里“位置到底怎么编码”这个基础难题。RayRoPE 不是只记二维坐标,而是把 patch 写成射线段,再投到查询视角里做相对编码,所以能同时兼顾跨视图一致性、SE(3) 不变性和几何适应性。

RayRoPE 里的深度和不确定性是什么意思?深度 d 表示 patch 对应的三维点落在射线上的位置,不确定性 σ 则表示这个深度估计有多“虚”。模型不是硬猜一个点,而是预测一个范围,再对这个范围里的 RoPE 做期望,避免深度误差把高频编码搞得太抖。

为什么它在新视图合成里更有效?因为新视图合成最怕几何关系错位。RayRoPE 把位置编码和三维结构绑在一起,既能让同一内容跨视图保持更一致的表示,又能在遮挡、稀疏视角和高频纹理区域里保住细节,所以综合指标更稳,视觉结果也更像真的。

如果你还有哪些想要了解的,欢迎在评论区留言或者讨论~

龙哥点评

论文创新性分数:★★★★☆

把“位置编码”从平面坐标推进到射线段、查询视角投影和不确定性期望,这个思路很完整,也很像真正为多视图场景量身定做的方案。

实验合理度:★★★★☆

对新视图合成、立体深度估计、3DGS 重建都做了验证,还补了消融和分布外测试,证据链比较扎实。唯一的遗憾是主要展示仍集中在多视图注意力框架内,跨更多架构的验证还可以继续扩。

学术研究价值:★★★★★

它补的是多视图 Transformer 的基础设施问题,不是只修一个任务的小补丁。这个方向对后续 3D 视觉建模、相机条件生成和几何感知注意力都有持续价值。

稳定性:★★★★☆

有不确定性建模,说明作者已经在考虑深度预测噪声,不是把几何当成“拍脑袋常量”。从结果看鲁棒性也不错,但极端场景下深度估计本身仍可能成为瓶颈。

适应性以及泛化能力:★★★★☆

分布外视图数变化、跨数据集测试都能稳住,泛化表现不错。要是未来能再覆盖更多相机模型和更复杂动态场景,适应性会更强。

硬件需求及成本:★★★★☆

相对基线只增加少量开销,训练和推理都还算克制。对多视图系统来说,这种额外成本属于“能接受,而且值”。

复现难度:★★★☆☆

方法本身不算复杂,但要把多视图框架、相机参数和深度投影细节都接对,还是有一定工程门槛。好在论文给了比较清楚的模块划分,复现不至于无从下手。

产品化成熟度:★★★★☆

作为多视图感知、重建和生成系统的基础模块,已经有不错的产品化潜力。真正落地时还要看相机标定质量、深度噪声和任务时延预算,但方向是对的。

可能的问题:核心收益仍依赖深度预测质量,极端稀疏视角或低纹理场景下可能会受限;另外,更多任务上的长期稳定性还需要更大范围验证。


主要参考文献

Yu Wu, Minsik Jeon, Jen-Hao Rick Chang, Oncel Tuzel, Shubham Tulsiani. RayRoPE: Projective Ray Positional Encoding for Multi-view Attention. arXiv:2601.15275, 2026.
Project Page: https://rayrope.github.io/
Paper: https://arxiv.org/pdf/2601.15275
Demo Video: https://rayrope.github.io/assets/web-teaser.mp4

*本文仅代表个人理解及观点,不构成任何论文审核或者项目落地推荐意见,具体以相关组织评审结果为准。欢迎就论文内容交流探讨,理性发言哦~ 想了解更多原文细节的小伙伴,可以点击"阅读原文",查看更多原论文细节哦!       

end
欢迎加入龙哥读论文粉丝群,扫描下方二维码或者添加龙哥助手微信号加群:kangjinlonghelper。一定要备注:研究方向+地点+学校/公司+昵称(如 图像处理+上海+清华+龙哥),根据格式备注,可更快被通过且邀请进群。
『龙哥读论文』微信群目前包含:图像处理、大模型及智能体、自动驾驶及机器人、AI医疗及AI金融5个群
想一起聊多视图、3D重建、Transformer和落地细节的,直接来群里狠狠干货🤘
wechat_helperdianzan
转发文章 微博 X LinkedIn Facebook
龙哥读论文 · PaperDaily

本文基于龙哥读论文 PaperDaily 数据库整理,结合论文原文与工程视角进行解读。