← 返回 PaperDaily
视觉与图像
连续latent太难训?DLR首次改用离散token
连续潜变量推理最大的毛病,不是“不聪明”,而是“说不清、管不住、训不稳”。这篇上海交大的 DLR 直接把潜在状态离散化,还借了渲染压缩的思路,算是把推理模型从黑箱里往外拽了一把。
龙哥读论文
阅读 3
查看原文
🐉 龙哥读论文知识星球来了!公众号每日8篇拆解不够看?星球无上限更AI领域论文、资讯、招聘、招博、开源代码,一站式干货,每日2分钟刷完即赚!👇扫码加入「龙哥读论文」知识星球,前沿干货、实用资源一站式拿捏~
龙哥推荐理由:
连续潜变量推理最大的毛病,不是“不聪明”,而是“说不清、管不住、训不稳”。这篇上海交大的 DLR 直接把潜在状态离散化,还借了渲染压缩的思路,算是把推理模型从黑箱里往外拽了一把。
原论文信息如下:
连续潜变量推理这条路,最大的问题不是“算不动”,而是“说不清”。模型把思考过程塞进一串连续向量里,表面上像是在省 token,实际上常常把训练、对齐和解释性一起拖下水:监督不好挂、奖励不好分、出错不好查,最后还容易学成一团“看起来很忙、其实很虚”的隐状态。上海交通大学和同济大学这篇 DLR,干脆把这团雾气掰成了明确的离散 token,思路很直接:既然语言模型天生擅长处理离散符号,那就别让它在连续空间里硬演“玄学推理”。
连续推理的“黑箱”之痛
先把背景说人话。大模型推理想省钱,常见做法是少吐字、少生成中间过程,把“思考”压到隐空间里。问题在于,连续潜变量虽然省了输出长度,却把一个本来很顺手的离散符号问题,硬改成了连续控制问题。连续空间没有清晰边界,训练时很容易出现表示塌缩、轨迹漂移、局部错误累积,监督也不好做:教师强制训练时没有天然的 token 对齐点,强化学习时过程奖励也难精确分配。
这里顺手解释两个缩写。CoT 是 Chain-of-Thought,中文通常叫“思维链”,指模型把中间推理步骤显式写出来。SFT 是 Supervised Fine-Tuning,即监督微调;RL 是 Reinforcement Learning,强化学习。DLR 的厉害之处,不是把这几个词换个名字,而是让离散 latent 能直接接上这些成熟训练范式。
DLR:用离散标记重塑潜在推理
DLR 全称是 Discrete Latent Reasoning,中文可以理解成“离散潜在推理”。它不是简单地把推理压缩,而是把“推理过程”本身变成一串可学习、可分配奖励、可解码的离散 token。这样一来,模型的中间思考就不再是看不见摸不着的连续向量,而是有明确边界的潜在词汇表。
这里的思路有个很妙的地方:它不是从零发明一个新训练框架,而是尽量贴着现有语言模型的习惯来改。离散 token 天然适合自回归训练,过程奖励也能按步计算,甚至还能像普通词一样做格式约束。相比连续 latent 那种“说不清每一步在干嘛”的状态,DLR 把每一步都变成了可检查、可对齐、可回放的对象。
从渲染到量化:DLR的潜在码本构建
DLR 的第一步不是直接量化文本,而是先把文本思维链渲染成图像。这个动作看起来像“多此一举”,实则有工程上的现实理由:图像压缩可以把长文本中的局部结构、顺序关系和版面信息一起打包进视觉特征里,随后再通过视觉编码器提取高密度表示。论文借鉴了 DeepSeek-OCR2 的渲染压缩思路,本质上是在利用视觉通道做一次高带宽中转。
然后进入真正的关键:向量量化。简单说,就是拿连续特征去“对号入座”,找到最接近的码字,把它替换成一个离散 id。论文里还不是随便量化,而是先用聚类做 warm start,避免一上来 codebook 全部挤成同一个坑里,随后再用随机扰动和直通估计器稳定训练。这个设计很像给离散码本先发一张“初始座位表”,免得模型还没学会走路就先摔成一坨。
论文还强调了一个很实用的约束:离散 token 不光要“省”,还要“能还原”。所以码本训练时,除了量化损失,还配了一个 OCR 解码器去重建原始文本。也就是说,这些离散 latent 不是纯粹的压缩符号,而是要能被解码回语义上可读的推理步骤。这个要求很关键,不然码本学出来一堆神秘编号,最后只能叫“压缩”,不能叫“推理”。
这部分最值得记住的一句话是:DLR 不是把连续 latent 简单离散化,而是把离散码字设计成“可恢复的语义单元”。这就让它从一个压缩技巧,升级成了一个真正能参与训练、解释和控制的推理表示。
三阶段训练:让LLM学会用“潜语言”思考
码本做好之后,真正的难点才开始:怎么让大模型接受这套新词汇,而且不是“背单词”,而是会拿它来推理。DLR 的训练流程分成三段,逻辑非常顺:先对齐语义,再教它做题,最后用奖励把它往正确方向拽。
第一阶段叫潜在-文本对齐,作用是把新引入的 latent token 拉到原来文本词表的语义空间附近。这个阶段冻结大模型主体,只训练轻量投影层,避免一上来就把整个模型训练歪。第二阶段是潜在监督微调,让模型在有答案的任务上学会自己生成 latent 轨迹。第三阶段是潜在强化学习,利用最终答案奖励和过程奖励去进一步打磨 latent policy。这里的过程奖励很关键,因为它不是只看结果对不对,而是看中间推理有没有“像样”。
论文里还有一个很聪明的设计:训练时用辅助解码器把 latent 轨迹翻回文本,再交给冻结的评估模型判断过程是否合理。这样做的好处是,奖励不只是盯着最终答案,还能照顾中间步骤是否和语义一致。换句话说,模型不是只学会“蒙对答案”,而是被迫学会“走一条像样的路”。
实验验证:高压缩率下的性能与可解释性双赢
实验部分最核心的看点其实就两个:一是压缩率高到离谱,二是性能没有跟着崩。论文在五个推理基准和两类模型系列上验证了 DLR,覆盖了 Qwen3-VL 和 LLaMA-3 等不同骨干。对做推理模型的人来说,这比单点 SOTA 更有意义,因为它说明方法不是“挑模型挑任务的偶然好运”。
龙迷三问
这篇论文到底解决了什么问题?它主要解决的是连续 latent 推理“不好训、不稳定、看不懂”这三个老毛病。DLR 不是继续在连续空间里修修补补,而是把中间推理状态直接离散化,让训练、奖励和解释都能回到语言模型最擅长的符号世界。
图里的“潜在 token”和普通文本 token 有什么区别?普通文本 token 是人能直接读懂的词,潜在 token 是模型内部使用的离散推理单位。它们不一定直接对应自然语言中的某个词,但通过辅助解码器可以恢复出语义上可读的推理步骤,所以它们更像“压缩后的思维片段”。
为什么要先渲染成图像,再做量化?因为渲染后的图像可以把长思维链压成更密集的视觉特征,视觉编码器再把这些特征变成适合量化的表示。这样做能借到视觉压缩的“高带宽中转”优势,比直接在文本连续空间里硬压更容易保住结构信息。
如果你还有哪些想要了解的,欢迎在评论区留言或者讨论~
龙哥点评
论文创新性分数:★★★★☆。把连续 latent 直接离散化,并且还能接上 SFT 和 RL,这个思路很实在,不是小修小补。
DLR 真正的新意在于“离散 token 不是终点,而是训练接口”。这个角度比单纯压缩思维链更进一步。
实验合理度:★★★★☆。对比了多种连续 latent 基线,还做了码本大小、训练阶段、编码器和解码方式的消融,基本能支撑主结论。
不过部分 baseline 来自不同工作,训练细节未必完全同构,严格公平性还是得看完整附录和复现代码。
学术研究价值:★★★★☆。它给 latent reasoning 提供了一个更可解释的离散范式,对后续做可控推理、过程奖励和压缩表示都有启发。
这类工作未必马上产品化,但对“推理表示怎么设计”这个问题很有研究价值。
稳定性:★★★☆☆。离散锚点确实比连续 latent 稳,但仍然依赖码本质量、解码器和训练阶段配合,链条不短。
一旦码本学歪,后面所有阶段都会跟着受影响。
适应性以及泛化能力:★★★★☆。从 1B 到 8B、从 LLM 到 LMM 都能跑,说明框架适配性不错。
但它主要还是在数学推理类任务里验证,跨到更复杂的开放域推理,还需要更多证据。
硬件需求及成本:★★★☆☆。训练用了 8×H100,码本构建和多阶段训练都不算轻。
推理端 token 数少,成本会降;但训练成本和工程复杂度并不低,离“轻量化”还有距离。
复现难度:★★★☆☆。代码开源是加分项,但涉及渲染、视觉编码、量化、三阶段训练和 RL,复现链条还是偏长。
对工程团队来说,难点不在“跑通一个模型”,而在“稳定跑通整条流水线”。
产品化成熟度:★★★☆☆。在需要省 token、可审计推理的场景里有潜力,比如教育、辅助推理、内部工具。
但要真上生产,还得解决码本维护、异常恢复、跨任务迁移和安全可控的问题。
可能的问题:思路漂亮,但训练链条长、依赖组件多,离“简单稳妥的通用方案”还有一步;更大范围任务上的收益也还需要继续验证。
主要参考文献
[1] Shuochen Chang, Qingyang Liu, Shaobo Wang, Bingjie Gao, Qianli Ma, Haonan Zhao, Yibo Miao, Yulin Sun, Zelin Peng, Jiangtong Li, Li Niu. Why Struggle with Continuous Latents? Interpretable Discrete Latent Reasoning via Rendered Compression. arXiv:2606.29712v1, 2026.
[2] 代码仓库:github.com/Miraclecsc/Discrete-Latent-Reasoning
连续潜变量再快,也得先把“脑内小作文”压成离散token。想看更多这种能落地、能复现、能省算力的论文拆解,欢迎加入龙哥读论文星球和微信群,少走弯路,多看门道。扫描二维码,直接上车。

欢迎加入龙哥读论文粉丝群,
扫描下方二维码或者添加龙哥助手微信号加群:kangjinlonghelper。
一定要备注:研究方向+地点+学校/公司+昵称(如 图像处理+上海+清华+龙哥),根据格式备注,可更快被通过且邀请进群。
『龙哥读论文』微信群目前包含:图像处理、大模型及智能体、自动驾驶及机器人、AI医疗及AI金融5个群

