← 返回 PaperDaily
视觉与图像
上海交大蚂蚁新方法:连续推理狂飙32%
多模态大模型最烦的,不是不会想,而是训练时偷看答案、推理时却只能裸奔。AMVL直接把这个“作弊窗口”堵上,用双向KL同时管住先验和后验,思路很硬,实验也够实在。
龙哥读论文
阅读 3
查看原文
🐉 龙哥读论文知识星球来了!公众号每日8篇拆解不够看?星球无上限更AI领域论文、资讯、招聘、招博、开源代码,一站式干货,每日2分钟刷完即赚!👇扫码加入「龙哥读论文」知识星球,前沿干货、实用资源一站式拿捏~
龙哥推荐理由:
多模态大模型最烦的,不是不会想,而是训练时偷看答案、推理时却只能裸奔。AMVL直接把这个“作弊窗口”堵上,用双向KL同时管住先验和后验,思路很硬,实验也够实在。
原论文信息如下:
大模型推理也卡在“语言瓶颈”了?
多模态大模型最常见的尴尬,不是“看不懂”,而是“看懂了也说不准”。一旦中间推理被迫塞进离散文本里,很多视觉细节就像被压缩成一张糊掉的截图:能说个大概,但一到空间关系、细粒度属性、复杂图形推理,模型就开始跑偏。
这篇论文盯上的就是这个老问题:语言空间瓶颈。直白点说,模型不是不会想,而是被迫用“文字脑回路”去处理本该在连续视觉空间里完成的推理。于是作者提出 AMVL,中文可以理解成非对称互变分学习(Asymmetric Mutual Variational Learning),核心目标就是:别让推理过程总被离散 token 拖后腿。
如果把传统 CoT 想成“边想边说”,那 AMVL 更像“先在脑子里想清楚,再决定怎么说”。不同的是,这里的“脑子”不是文字草稿,而是一段连续向量序列。听起来有点玄,其实思路很朴素:复杂视觉推理本来就不该硬翻译成自然语言,直接在连续空间里做中间计算,信息损失会少很多。
从变分推理看LLM的答案泄露“后门”
AMVL 的真正切口,不是“连续 latent”这四个字本身,而是它抓住了一个很容易被忽略的训练陷阱:训练时的后验看得到答案,推理时的先验看不到。这就像考试时先翻答案再做题,做出来的草稿当然漂亮,但真上考场就容易翻车。
论文把这个问题叫做answer leakage,中文就是“答案泄露”。这里需要顺手解释一个关键术语:KL 散度,全称是 Kullback-Leibler divergence,中文通常译作相对熵。它衡量的是两个概率分布有多不像。AMVL 用了两个方向的 KL:一个管先验去贴近后验,一个管后验别乱跑。
论文的分析很有意思:标准 ELBO(Evidence Lower Bound,证据下界)本来是变分学习的老办法,但在这里会把“带答案的后验”强行蒸馏给“没答案的先验”。问题是,后验一旦偷偷利用了答案信息,先验就会被带偏,学到一套推理时根本用不上的 latent 结构。换句话说,模型训练时学会了“看后门”,上线时却只能走正门,当然容易卡壳。
这也是 AMVL 和很多“只做单向对齐”的方法最本质的区别。单纯让先验追后验,等于只修路不管车;后验如果继续往答案捷径上狂奔,先验照样被污染。AMVL 的做法更像交通管制:一边让先验向后验学习,一边用反向 KL 限制后验别乱穿插队,双向一起管,才不至于把 latent 空间搞成大型事故现场。
双向KL校准:让先验和后验“双向奔赴”
AMVL 的核心设计并不复杂,甚至有点“老实”:在输入和答案之间插入若干个 latent token,用它们的隐藏状态去参数化两个分布。一个是推理时真正会用到的先验 pθ(Z|x),只看输入;一个是训练时才能看到的后验 qϕ(Z|x,y),输入和答案都看。
这里的“非对称”很关键。它不是两个平等同学互相抄作业,而是两个职责完全不同的角色:先验负责上线,后验负责训练。所以不能简单把它们当作普通 mutual learning。论文的做法是:前向 KL 让先验去贴近后验学到的 latent,反向 KL 让后验别离先验太远。两条线一起收,latent 空间才不会飘。
实现上,AMVL 也没有把系统搞得特别重。它直接基于 Qwen2.5-VL-7B-Instruct 做改造,视觉编码器冻结,语言骨干和变分模块联合训练。latent 维度默认 512,token 数默认 8 个。这个配置的味道很工程化:别贪多,先把连续推理槽位做稳,再谈更复杂的扩展。
论文还特意强调了 stop-gradient 设计,也就是某些损失只更新一侧参数,避免两边一起乱抖。这个细节很像调音台:不是所有旋钮都一起拧到最大,而是该让谁动、谁别动,要分清楚。不然双向 KL 还没来得及救场,训练就先把自己拧成麻花了。
一张图看懂AMVL:在连续空间里“想象”和“推理”
如果把整个流程压缩成一句话,那就是:训练时让模型在连续 latent 里“看答案想问题”,推理时只靠先验“凭题想答案”。AMVL 不是把答案喂给模型,而是借答案把 latent 空间校准得更靠谱。
这套流程的关键,不在“连续”本身,而在“连续空间到底学成什么样”。如果 latent 空间被答案信息污染,推理时就会失真;如果 latent 空间太保守,又会把有用的中间表示压扁。AMVL 的双向 KL 就是在这两个极端之间找平衡:既别太野,也别太怂。
从工程角度看,这种设计还有一个好处:它没有要求额外标注中间推理步骤,也没有要求人工定义 latent 应该学什么。相比那些必须靠重构损失、对齐损失去“手工雕刻”中间状态的方法,AMVL 更像让模型自己在任务驱动下发现中间表示,少一点人类拍脑袋,多一点概率建模的自洽。
SOTA实证:复杂推理狂飙32%,OOD泛化也稳了
实验部分基本把 AMVL 的价值说透了:它不是只在某一个小任务上“碰巧赢了”,而是在多个视觉推理基准上都能稳定抬分。尤其是 BLINK 这种偏视觉认知和空间逻辑的任务集,最能暴露模型到底是真会推理,还是只会背模板。
和离散推理方法比,AMVL 的优势并不神秘:离散 CoT 再怎么写得像“思维链”,本质还是文本序列,容易把视觉结构说散;而连续 latent 不需要每一步都翻译成语言,保留了更多空间和属性信息。和已有连续推理方法比,AMVL 的优势也很明确:它不是只靠手工监督去“规定 latent 应该长什么样”,而是通过双向 KL 让 latent 自己学出更适合推理的形状。
看到这里,最让人放心的是消融实验没有翻车。表3显示,只有前向 KL 或只有反向 KL 都不够,单打独斗都只能部分缓解问题;把两者合起来,尤其是先前向、后反向的训练顺序,效果最好。这个结果很符合直觉:先让先验学会“像后验”,再让后验别跑偏,顺序对了,训练才不乱。
理论算力与未来展望:新范式的第一步
AMVL 的价值,不只是多拿了几个 benchmark 分数,更重要的是它把一个长期存在、但常被忽略的问题讲清楚了:连续推理不是“加几个 latent token”就完事,关键是训练和推理的分布必须对得上。否则,模型学出来的 latent 再漂亮,也可能只是训练阶段的幻觉。
从理论上看,论文把“答案泄露”解释成 prior contamination,这一点很有启发性。它提醒后续工作:别只盯着最终准确率,先看看 latent 空间是不是被训练信号污染了。很多方法看起来效果不错,但一旦推理条件变了,性能就掉得很快,本质上往往是训练时学到的表示不够干净。
从工程上看,AMVL 也算比较克制:它没有引入特别夸张的额外模块,训练主干仍然是一个成熟的多模态大模型,变分头也保持轻量。换句话说,这不是那种“论文里很美,代码里很重”的方案。只要后续能把训练稳定性、温度采样鲁棒性和更大规模任务上的收益继续做实,这条路是有希望落地到真实多模态推理系统里的。
但也要泼一点冷水:AMVL 目前仍然主要验证在既定基准上,离“通用多模态推理底座”还有距离。连续 latent 的可解释性、跨任务迁移、以及在更复杂交互式场景中的稳定性,后面都还要继续打磨。现在更像是把门打开了一条缝,证明“这路能走”;至于能不能一路修成高速公路,还得看后续工作。
龙迷三问
这篇论文到底解决了什么问题?它解决的是多模态大模型“训练时看答案、推理时没答案”导致的分布不一致问题。AMVL 通过双向 KL 把先验和后验同时校准,尽量避免答案泄露把推理空间带偏。
前向 KL 和反向 KL 分别在干什么?前向 KL 主要让推理时用的先验去贴近训练时学到的后验表示;反向 KL 则约束后验别跑到先验完全覆盖不到的区域,减少训练时偷答案形成的捷径。
latent token 和普通文本 token 有什么区别?普通文本 token 是离散符号,必须“说出来”;latent token 是连续向量槽位,主要负责中间计算,不必直接变成文字。这就是它能绕开语言瓶颈的关键。
如果你还有哪些想要了解的,欢迎在评论区留言或者讨论~
龙哥点评
论文创新性分数:★★★★☆。把“答案泄露”形式化成先验污染,再用双向 KL 去堵这个口子,思路不算花哨,但切得很准。
实验合理度:★★★★☆。基线选得比较完整,既比离散推理,也比连续 latent 推理,消融还把训练目标、latent 配置、stop-gradient 都测了,比较像一篇认真做实验的论文。
学术研究价值:★★★★☆。它不只是涨分,更重要的是把连续多模态推理里的 train-inference mismatch 讲清楚了,对后续 latent reasoning 研究很有启发。
稳定性:★★★☆☆。从消融和分布外结果看,稳定性比很多 demo 型方法强,但毕竟还是新范式,离大规模生产环境的长期稳定还有距离。
适应性以及泛化能力:★★★☆☆。在多项视觉推理基准上有效,OOD 也有收益,但目前主要还是围绕视觉问答和图形推理场景,通用性还需要更多验证。
硬件需求及成本:★★★☆☆。基于 7B 多模态骨干,训练成本不算低,但变分头本身比较轻量,没有把系统复杂度拉爆,算是可接受。
复现难度:★★★☆☆。方法结构清楚,数学也给得足,但真正复现好需要把 KL 调度、stop-gradient 和 latent 采样细节都对齐,还是有点门槛。
产品化成熟度:★★★☆☆。适合做多模态推理增强模块或研究原型,离稳定商用还需要更多任务覆盖、鲁棒性验证和成本优化。
可能的问题:方法抓住了 train-inference mismatch,但对更复杂任务的长程推理、交互式场景和跨模态迁移,还没完全证明“连续 latent 一招通吃”。
主要参考文献
[1] Shijie Li, Yilin Gao, Siyuan Yang, Tieyuan Chen, Chaofan Gan, Zhihao He, Zicheng Zhao, Yuyu Guo, Weiyao Lin, Hang Yu. Multimodal Continuous Reasoning via Asymmetric Mutual Variational Learning. arXiv:2607.00461v1, 2026.
[2] 原文链接:https://arxiv.org/pdf/2607.00461v1.pdf
*本文仅代表个人理解及观点,不构成任何论文审核或者项目落地推荐意见,具体以相关组织评审结果为准。欢迎就论文内容交流探讨,理性发言哦~ 想了解更多原文细节的小伙伴,可以点击"阅读原文",查看更多原论文细节哦!

欢迎加入龙哥读论文粉丝群,
扫描下方二维码或者添加龙哥助手微信号加群:kangjinlonghelper。
一定要备注:研究方向+地点+学校/公司+昵称(如 图像处理+上海+清华+龙哥),根据格式备注,可更快被通过且邀请进群。
『龙哥读论文』微信群目前包含:图像处理、大模型及智能体、自动驾驶及机器人、AI医疗及AI金融5个群
双向KL把“会答题”与“答得稳”绑在一起,想继续看这类能落地、能解释、还不太空转的论文,来群里一起拆。

