← 返回 PaperDaily 视觉与图像

连续latent太难训?DLR首次改用离散token

连续潜变量推理最大的毛病,不是“不聪明”,而是“说不清、管不住、训不稳”。这篇上海交大的 DLR 直接把潜在状态离散化,还借了渲染压缩的思路,算是把推理模型从黑箱里往外拽了一把。

连续latent太难训?DLR首次改用离散token
🐉 龙哥读论文知识星球来了!
公众号每日8篇拆解不够看?星球无上限更AI领域论文、资讯、招聘、招博、开源代码,一站式干货,每日2分钟刷完即赚!
👇扫码加入「龙哥读论文」知识星球,前沿干货、实用资源一站式拿捏~ xingqiu_header

龙哥推荐理由:
连续潜变量推理最大的毛病,不是“不聪明”,而是“说不清、管不住、训不稳”。这篇上海交大的 DLR 直接把潜在状态离散化,还借了渲染压缩的思路,算是把推理模型从黑箱里往外拽了一把。


原论文信息如下:
论文标题:
Why Struggle with Continuous Latents? Interpretable Discrete Latent Reasoning via Rendered Compression
发表日期:
2026年06月
发表单位:
Shanghai Jiao Tong University; Tongji University
原文链接:
https://arxiv.org/pdf/2606.29712v1.pdf
开源代码链接:
github.com/Miraclecsc/Discrete-Latent-Reasoning
连续潜变量推理这条路,最大的问题不是“算不动”,而是“说不清”。模型把思考过程塞进一串连续向量里,表面上像是在省 token,实际上常常把训练、对齐和解释性一起拖下水:监督不好挂、奖励不好分、出错不好查,最后还容易学成一团“看起来很忙、其实很虚”的隐状态。上海交通大学和同济大学这篇 DLR,干脆把这团雾气掰成了明确的离散 token,思路很直接:既然语言模型天生擅长处理离散符号,那就别让它在连续空间里硬演“玄学推理”。
封面
封面图对应论文的整体方法:先把思维链渲染成图像,再把图像压成离散潜在 token,最后让模型在“自然语言 + 潜语言”混合词表里继续做自回归推理。这个方向听起来有点像把脑内小剧场做成了“可读字幕”,但它解决的是很现实的工程痛点。

连续推理的“黑箱”之痛

先把背景说人话。大模型推理想省钱,常见做法是少吐字、少生成中间过程,把“思考”压到隐空间里。问题在于,连续潜变量虽然省了输出长度,却把一个本来很顺手的离散符号问题,硬改成了连续控制问题。连续空间没有清晰边界,训练时很容易出现表示塌缩、轨迹漂移、局部错误累积,监督也不好做:教师强制训练时没有天然的 token 对齐点,强化学习时过程奖励也难精确分配。
图1:连续潜在推理的中间状态与离散符号监督不匹配,导致训练瓶颈、推理动态不稳定和可解释性差。本文通过在推理过程中引入离散潜在 token 作为锚点,支持标准自回归训练和可控潜在推理。
图1把这个矛盾讲得很直白:连续 latent 的中间状态,和离散监督天然不对付。前者像一团流体,后者像一格一格的台阶;台阶上走路很稳,流体里游泳就很看运气。DLR 的核心判断就是:既然推理最终还是要被语言模型学习、校正、奖励,那中间状态最好也变成能“点名”的离散单位。
这里顺手解释两个缩写。CoTChain-of-Thought,中文通常叫“思维链”,指模型把中间推理步骤显式写出来。SFTSupervised Fine-Tuning,即监督微调;RLReinforcement Learning,强化学习。DLR 的厉害之处,不是把这几个词换个名字,而是让离散 latent 能直接接上这些成熟训练范式。

DLR:用离散标记重塑潜在推理

DLR 全称是 Discrete Latent Reasoning,中文可以理解成“离散潜在推理”。它不是简单地把推理压缩,而是把“推理过程”本身变成一串可学习、可分配奖励、可解码的离散 token。这样一来,模型的中间思考就不再是看不见摸不着的连续向量,而是有明确边界的潜在词汇表。
图2:DLR 总体框架。上半部分将思维链渲染成图像,用基于 DeepSeek-OCR2 的视觉压缩器编码,并结合 OCR 解码器学习随机向量量化的潜在码本,得到可语义恢复的离散 latent token。下半部分把学到的潜在词汇投影到语言模型词表空间,通过潜在-文本对齐、监督微调和强化学习训练增强后的潜在语言模型。
图2是整篇论文最关键的一张图。上面那条线负责“造词”:把思维链渲染成图片,再用视觉压缩器提特征,最后通过向量量化把连续特征变成离散码字。下面那条线负责“教模型说这种新语言”:把这些潜在 token 并入原有词表,让模型像做普通 next-token prediction 一样去生成它们。说白了,就是先造一套“潜语言字典”,再逼大模型学会用这套字典做题。
这里的思路有个很妙的地方:它不是从零发明一个新训练框架,而是尽量贴着现有语言模型的习惯来改。离散 token 天然适合自回归训练,过程奖励也能按步计算,甚至还能像普通词一样做格式约束。相比连续 latent 那种“说不清每一步在干嘛”的状态,DLR 把每一步都变成了可检查、可对齐、可回放的对象。

从渲染到量化:DLR的潜在码本构建

DLR 的第一步不是直接量化文本,而是先把文本思维链渲染成图像。这个动作看起来像“多此一举”,实则有工程上的现实理由:图像压缩可以把长文本中的局部结构、顺序关系和版面信息一起打包进视觉特征里,随后再通过视觉编码器提取高密度表示。论文借鉴了 DeepSeek-OCR2 的渲染压缩思路,本质上是在利用视觉通道做一次高带宽中转。
然后进入真正的关键:向量量化。简单说,就是拿连续特征去“对号入座”,找到最接近的码字,把它替换成一个离散 id。论文里还不是随便量化,而是先用聚类做 warm start,避免一上来 codebook 全部挤成同一个坑里,随后再用随机扰动和直通估计器稳定训练。这个设计很像给离散码本先发一张“初始座位表”,免得模型还没学会走路就先摔成一坨。
论文还强调了一个很实用的约束:离散 token 不光要“省”,还要“能还原”。所以码本训练时,除了量化损失,还配了一个 OCR 解码器去重建原始文本。也就是说,这些离散 latent 不是纯粹的压缩符号,而是要能被解码回语义上可读的推理步骤。这个要求很关键,不然码本学出来一堆神秘编号,最后只能叫“压缩”,不能叫“推理”。
图3:潜在词汇表大小 K 对推理性能的影响。图4:latent 到文本解码案例。放大查看效果更清晰。
图3和图4放在一起看,信息量很足。图3说明码本不是越大越好:从 2.5K 到 10K,性能明显上升,说明容量够了才能装下足够丰富的推理语义;但继续扩大到 40K,收益开始变平甚至略降,说明码本太大也会让训练和利用率变差。图4则更直观,解码出来的 latent chain 往往能抓住数学逻辑主干,虽然偶尔会把人名、单位这类细节“脑补错”,但核心推理路径基本是对的。
这部分最值得记住的一句话是:DLR 不是把连续 latent 简单离散化,而是把离散码字设计成“可恢复的语义单元”。这就让它从一个压缩技巧,升级成了一个真正能参与训练、解释和控制的推理表示。

三阶段训练:让LLM学会用“潜语言”思考

码本做好之后,真正的难点才开始:怎么让大模型接受这套新词汇,而且不是“背单词”,而是会拿它来推理。DLR 的训练流程分成三段,逻辑非常顺:先对齐语义,再教它做题,最后用奖励把它往正确方向拽。
图3:训练阶段组合的消融实验。勾选项表示是否启用阶段1(潜在-文本对齐)、阶段2(潜在监督微调)、阶段3(潜在强化学习)以及阶段3中的过程对齐奖励。最后一行是完整配置。
先看图3对应的消融。去掉对齐阶段,性能会掉一截;去掉 SFT,模型几乎直接“学不会”;去掉 RL,效果也会退化;再把过程奖励拿掉,准确率继续下降。这个结论很朴素,但也很重要:DLR 不是靠某一个花哨模块撑起来的,而是三段训练一起把离散 latent 的语义、生成和优化都接通了。
第一阶段叫潜在-文本对齐,作用是把新引入的 latent token 拉到原来文本词表的语义空间附近。这个阶段冻结大模型主体,只训练轻量投影层,避免一上来就把整个模型训练歪。第二阶段是潜在监督微调,让模型在有答案的任务上学会自己生成 latent 轨迹。第三阶段是潜在强化学习,利用最终答案奖励和过程奖励去进一步打磨 latent policy。这里的过程奖励很关键,因为它不是只看结果对不对,而是看中间推理有没有“像样”。
论文里还有一个很聪明的设计:训练时用辅助解码器把 latent 轨迹翻回文本,再交给冻结的评估模型判断过程是否合理。这样做的好处是,奖励不只是盯着最终答案,还能照顾中间步骤是否和语义一致。换句话说,模型不是只学会“蒙对答案”,而是被迫学会“走一条像样的路”。
图4:DLR 各阶段训练配置的详细设置。Trainable Modules 列出了每个阶段更新的参数,其余参数保持冻结。符号“−”表示不适用。
图4把每一阶段到底更新哪些参数写得很清楚,这对复现尤其友好。工程上最怕的就是“论文里说三阶段,代码里三十个开关”,最后谁也说不清到底是哪个模块起作用。DLR 至少在训练分工上比较克制:先稳住语义,再放开 backbone,最后做策略优化,顺序不乱。

实验验证:高压缩率下的性能与可解释性双赢

实验部分最核心的看点其实就两个:一是压缩率高到离谱,二是性能没有跟着崩。论文在五个推理基准和两类模型系列上验证了 DLR,覆盖了 Qwen3-VL 和 LLaMA-3 等不同骨干。对做推理模型的人来说,这比单点 SOTA 更有意义,因为它说明方法不是“挑模型挑任务的偶然好运”。
表1:在四个小学阶段推理基准上,Qwen3-4B(LLM)和 Qwen3-VL-4B-Instruct(LMM)的实验结果。* 表示 Pass@1 显著优于第二好的潜在推理方法(p < 0.05)。基线结果来自 CoLaR 或 RoT。
表1先看结论:DLR 在四个小学阶段算术基准上,基本把“又准又短”这件事做到了。比如在 Qwen3-4B 上,DLR Full 的平均准确率达到 62.9%,而平均推理长度只有 5.4 个 token;对比显式 CoT 的 105.1 个 token,压缩比例非常夸张。更关键的是,在 GSM-Hard 这类更容易把连续 latent 搞漂的 OOD 任务上,DLR 仍然能稳住,说明离散锚点确实在抑制错误累积。
表2:Qwen3-VL 在三种规模下的 MATH-500 实验结果。DLR 与不带 CoT 的 SFT、显式 SFT-CoT 以及渲染 CoT 基线 RoT 进行比较。
表2更能说明问题:模型规模从 2B 到 8B 时,DLR 的收益是持续增长的。8B 上 Full 版达到 54.0%,而且 latent 轨迹长度仍然只有约 29 个 token 左右。和显式 CoT 动辄三百多个 token 的输出相比,这不是“稍微省一点”,而是把推理成本压到了另一个量级。更难得的是,RoT 这类渲染式连续方法在扩到大模型后收益开始变得不稳定,而 DLR 的曲线更像一个正常能扩展的方法。
表5:在四个小学阶段推理基准上,LLaMA-3.2-1B(LLM)和 Qwen3-VL-2B-Instruct(LMM)的主要结果。* 表示 Pass@1 显著优于第二好的潜在推理方法(p < 0.05)。基线结果来自 CoLaR 或 RoT。
表5补了一刀:DLR 不只是大模型能玩,小模型也能受益。LLaMA-3.2-1B 和 Qwen3-VL-2B 上,DLR 依然能在压缩和准确率之间找到比较好的平衡。这说明方法不是靠“模型够大所以随便学学”,而是确实把潜在表示的训练方式改对了。
表6:用于潜在码本构建的视觉编码器与压缩设置消融。比较了 DeepSeek-OCR2 的 DeepEncoder V2 与 Qwen3-VL 原生 ViT,并在默认和高压缩设置下评估。各变体共享同一 Qwen3-VL-4B 骨干,结果均为阶段2 latent SFT 后的表现(不含 RL)。#L 表示离散 latent token 轨迹的平均长度,越小代表压缩率越高。
表6说明,码本构建阶段的视觉编码器选择并不是装饰品。DeepSeek-OCR2 的 DeepEncoder V2 在压缩和效果之间更稳,原生 ViT 也能用,但在高压缩设置下更容易牺牲性能。这个结果挺符合直觉:如果前端压缩没把结构信息保住,后面再怎么离散化都只是“把噪声编码得更整齐”。
表7:Qwen3-VL-4B-Instruct 上 latent 解码的消融,报告于阶段3 RL 检查点。动态解码与主结果一致;强制提前停止的变体会在固定步数截断 latent 阶段。
表7进一步说明,latent 解码不是随便截断就行。动态解码和主结果一致,说明模型确实学到了“该停的时候停”;但如果强行提前结束 latent 阶段,效果会受影响。这也从侧面证明,DLR 的潜在 token 不是多余装饰,而是推理链条里的有效信息载体。

龙迷三问

下面是龙哥对于大家可能的一些问题的解答:

这篇论文到底解决了什么问题?它主要解决的是连续 latent 推理“不好训、不稳定、看不懂”这三个老毛病。DLR 不是继续在连续空间里修修补补,而是把中间推理状态直接离散化,让训练、奖励和解释都能回到语言模型最擅长的符号世界。

图里的“潜在 token”和普通文本 token 有什么区别?普通文本 token 是人能直接读懂的词,潜在 token 是模型内部使用的离散推理单位。它们不一定直接对应自然语言中的某个词,但通过辅助解码器可以恢复出语义上可读的推理步骤,所以它们更像“压缩后的思维片段”。

为什么要先渲染成图像,再做量化?因为渲染后的图像可以把长思维链压成更密集的视觉特征,视觉编码器再把这些特征变成适合量化的表示。这样做能借到视觉压缩的“高带宽中转”优势,比直接在文本连续空间里硬压更容易保住结构信息。

如果你还有哪些想要了解的,欢迎在评论区留言或者讨论~

龙哥点评

论文创新性分数:★★★★☆。把连续 latent 直接离散化,并且还能接上 SFT 和 RL,这个思路很实在,不是小修小补。

DLR 真正的新意在于“离散 token 不是终点,而是训练接口”。这个角度比单纯压缩思维链更进一步。

实验合理度:★★★★☆。对比了多种连续 latent 基线,还做了码本大小、训练阶段、编码器和解码方式的消融,基本能支撑主结论。

不过部分 baseline 来自不同工作,训练细节未必完全同构,严格公平性还是得看完整附录和复现代码。

学术研究价值:★★★★☆。它给 latent reasoning 提供了一个更可解释的离散范式,对后续做可控推理、过程奖励和压缩表示都有启发。

这类工作未必马上产品化,但对“推理表示怎么设计”这个问题很有研究价值。

稳定性:★★★☆☆。离散锚点确实比连续 latent 稳,但仍然依赖码本质量、解码器和训练阶段配合,链条不短。

一旦码本学歪,后面所有阶段都会跟着受影响。

适应性以及泛化能力:★★★★☆。从 1B 到 8B、从 LLM 到 LMM 都能跑,说明框架适配性不错。

但它主要还是在数学推理类任务里验证,跨到更复杂的开放域推理,还需要更多证据。

硬件需求及成本:★★★☆☆。训练用了 8×H100,码本构建和多阶段训练都不算轻。

推理端 token 数少,成本会降;但训练成本和工程复杂度并不低,离“轻量化”还有距离。

复现难度:★★★☆☆。代码开源是加分项,但涉及渲染、视觉编码、量化、三阶段训练和 RL,复现链条还是偏长。

对工程团队来说,难点不在“跑通一个模型”,而在“稳定跑通整条流水线”。

产品化成熟度:★★★☆☆。在需要省 token、可审计推理的场景里有潜力,比如教育、辅助推理、内部工具。

但要真上生产,还得解决码本维护、异常恢复、跨任务迁移和安全可控的问题。

可能的问题:思路漂亮,但训练链条长、依赖组件多,离“简单稳妥的通用方案”还有一步;更大范围任务上的收益也还需要继续验证。


主要参考文献

[1] Shuochen Chang, Qingyang Liu, Shaobo Wang, Bingjie Gao, Qianli Ma, Haonan Zhao, Yibo Miao, Yulin Sun, Zelin Peng, Jiangtong Li, Li Niu. Why Struggle with Continuous Latents? Interpretable Discrete Latent Reasoning via Rendered Compression. arXiv:2606.29712v1, 2026.
[2] 代码仓库:github.com/Miraclecsc/Discrete-Latent-Reasoning

连续潜变量再快,也得先把“脑内小作文”压成离散token。想看更多这种能落地、能复现、能省算力的论文拆解,欢迎加入龙哥读论文星球和微信群,少走弯路,多看门道。扫描二维码,直接上车。

end
欢迎加入龙哥读论文粉丝群,扫描下方二维码或者添加龙哥助手微信号加群:kangjinlonghelper。一定要备注:研究方向+地点+学校/公司+昵称(如 图像处理+上海+清华+龙哥),根据格式备注,可更快被通过且邀请进群。
『龙哥读论文』微信群目前包含:图像处理、大模型及智能体、自动驾驶及机器人、AI医疗及AI金融5个群
wechat_helperdianzan
转发文章 微博 X LinkedIn Facebook
龙哥读论文 · PaperDaily

本文基于龙哥读论文 PaperDaily 数据库整理,结合论文原文与工程视角进行解读。