← 返回 PaperDaily
大模型与智能体
让冻结LLM学会“脑内潜思”:循环潜思维LRT,符号推理暴涨26.7个点
当思维链还在“一字一句”硬凹推理时,这篇论文直接让冻结的LLM在“脑内”用向量打草稿。仅训练1130万参数,就在符号推理上把零样本思维链拉高26.7个点,推理延迟还更低。是时候重新审视“推理必须说出口”这个前提了。
龙哥读论文
发布于 2026-09-05 00:31:07
阅读 1
查看原文
原论文信息如下:
先问个问题:当你在解一道数学题时,如果必须把每一步思考都大声念出来,是不是反而容易卡壳?大模型现在面临的正是这个窘境。主流的思维链技术强迫模型把推理过程用文字“念”出来,但人类真正的灵感迸发,往往发生在无声的潜意识里。这篇来自Emory University等机构的最新论文,就想让大模型学会这种“脑内潜思”。
思维链的局限,在于它把推理困在了离散的词汇空间里。每一步都必须从词表中选词,生成过程不仅缓慢,而且一旦某一步出错,错误就会像多米诺骨牌一样向后传播。更关键的是,要引导模型生成高质量的思维链,往往需要先准备一大堆人工标注的推理轨迹作为范本。
所以,研究者们开始思考:能不能让模型在一个不需要“说话”的空间里思考?这就是连续空间推理的初衷。大模型在处理信息时,内部会形成一个个高维向量,这些向量承载着丰富的语义,远非几个离散的词汇可以比拟。如果能直接在向量层面进行推理,是不是就能绕过那些口头表达的瓶颈?
但难题也随之而来:这些“思维向量”应该怎么算?逻辑步骤如何在这些数字里体现?这正是本文要攻克的核心问题。
面对上述挑战,本文提出了Latent Recurrent Thoughts (LRT)框架。它的思路很直接:既然现成的大模型懂得词法语法,那就让它保持冻结,专门负责“说话”;再训练一个微型网络,在后台负责“思考”和“打草稿”。
任务专用提议器 :这是一个小型的双向Transformer编码器,专门为当前任务家族定制。它读取问题x,输出一组K个基础潜向量L(0)。相比之前使用通用大模型做提议器的方法,这种专用小模型能生成更贴合解码器输入流形的初始猜想,计算成本也更低,仅约420万参数。
循环精化器 :这是LRT的大脑,采用了TRM的循环思路。它拥有两个循环状态——快速暂存状态z_L和慢速整合状态z_H。精化器会将基础潜向量作为外部信号,反复循环更新这两组状态。最关键的是,它预测的是一个残差Δ,而不是直接重新生成潜向量。最终的精化潜向量L* = L(0) + Δ。这种残差学习策略可以让优化过程更稳定,并保持与原始问题的锚定。更酷的是,这个精化器仅约700万参数,却可以通过循环展开实现很深的推理链,而无需增加参数量。
两个模块加起来一共1130万个可训练参数,只占那个80亿参数大模型的0.14%。训练时也只用了最终答案的交叉熵作为监督信号,完全不需要任何推理轨迹。
为了公平对比,论文设计了一个非常严谨的实验方案:所有方法都使用同一个冻结的Qwen3-8B解码器、相同的提示词、相同的数据集和训练预算,唯一不同的就是潜变量模块本身。
实验涵盖了两大类任务,可谓冰火两重天。符号推理任务 (Countdown-4和数独)考验的是纯粹的逻辑计算能力,没有自然语言作为辅助;而自然语言推理任务 (HumanEval、MBPP、StrategyQA)则是SoftCoT等方法的传统主场。
实验结果的对比非常震撼。在零样本思维链设置下,Qwen3-8B在Countdown-4上的解决率仅有30.0%。而LRT直接将这一数字拉高到了56.7%,提升了将近一倍。更让人惊讶的是,此前被看好的SoftCoT和EBM-CoT方法,在这个任务上却双双“翻车”,效果甚至不如不让模型思考、直接给出答案。这正好印证了论文开头提到的观点:在非自然语言的任务上,用通用模型生成的思维向量不仅没帮助,反而会带偏大模型。
在数独任务上,LRT的49.2%同样大幅领先于零样本思维链的23.9%,甚至超过了专门为符号解码训练的MGDM扩散模型。在自然语言任务上,LRT同样表现神勇,在HumanEval上达到37.8%,超出EBM-CoT约13个百分点。这种“全能”表现让其平均分达到了54.1%,显着高于其他冻结解码器方案。
更细粒度的机制性消融实验也很有说服力。若将提议器换成通用模型,无论精化器有多强,性能都难以突破。反之,若只保留专用提议器而不加循环精化器,平均分从47.9掉到37.2。这说明两者是缺一不可的黄金搭档。
看到这里,不少人心里肯定会犯嘀咕:这会不会只是那个循环精化器 TRM 在单打独斗,而那个80B的大模型仅仅是个传话筒?论文作者也好奇这个问题,于是做了一组很巧妙的机械论分析。
结论很有意思:如果单独让TRM去解Countdown-4,它的正确率只有可怜的1.2%,甚至不如瞎蒙。但如果把TRM提出的状态扔给一个不理解任务的模型去解码,效果同样不佳。这说明了计算是分布式进行的——循环精化器负责提供结构化的计算轨迹,但需要解码器这样的“宿主”来理解和表达。此外,论文还将解码器从Qwen3-8B换成了Llama-3.1-8B,整体性能出现了明显变化,进一步印证了这是“双剑合璧”的结果。
论文的亮点毋庸置疑,但其局限性也需要坦诚面对。LRT目前仍是“一任务一训练”,每个任务家族都需要训练专用的提议器和精化器,并非开箱即用的通用推理模型。在数独这样的约束满足问题上,它49%的准确率离专业求解器接近100%的表现还有很大差距。不过,作者也坦诚地指出,LRT的定位是在小推理成本下,成为冻结解码器的“助推器”,而不是去挑战那些不计代价的测试时缩放方法。
该工作的出现,为大模型推理开辟了一个新视角:也许推理并非一定要“说出来”。未来的研究或许会探索如何让这些潜思维模块具备更强的跨任务泛化能力,甚至直接学习一种通用的“思维语言”,让垂类模型的开发不再需要动辄数千亿参数的全面微调。这不仅是一个技术上的进步,也让我们重新思考语言与思维的关系——边界之外,或许正是下一片蓝海。
龙迷三问
这篇论文到底在解决什么问题? 微软等机构提出LRT,让冻结的8B大模型通过11.2M小网络进行循环潜空间推理。在无需推理轨迹的情况下,Countdown-4和数独求解率较零样本思维链提升26.7和25.3个百分点,平均性能达到54.1。
这篇工作最值得看的点是什么? LRT在5个基准上平均54.1,远超SoftCoT(29.5)和EBM-CoT(33.5);在Countdown-4上56.7 vs 30.0(zero-shot CoT),Sudoku上49.2 vs 23.9;在自然语言任务上也全面领先。
这篇工作的边界或风险在哪里? 优点:1)提出任务专用proposer+循环refiner的组合,解决通用proposer在符号推理上失效的问题;2)循环refiner通过有界残差修正实现深度计算解耦,参数效率高;3)实验设计严谨,控制变量清晰。缺点:1)每任务族需单独训练模块,非通用零样本方法;2)Sudoku上远不如从零训练的专用符号求解器;3)机制分析多为相关性证据,缺乏因果证明。
如果你还有哪些想要了解的,欢迎在评论区留言或者讨论~
龙哥点评 论文创新性分数: ★★★★☆
提出LRT框架,用任务专用proposer生成基础潜变量,再用基于TRM的循环refiner通过多次有界残差修正迭代精化潜变量,最后注入冻结LLM解码答案。
实验合理度: ★★★★☆
Countdown-4和Sudoku精确求解率,HumanEval和MBPP pass@1,StrategyQA准确率。
学术研究价值: ★★★★☆
提出LRT框架,用任务专用proposer生成基础潜变量,再用基于TRM的循环refiner通过多次有界残差修正迭代精化潜变量,最后注入冻结LLM解码答案;更关键的是问题定义是否可复用到同类任务。
稳定性: ★★★☆☆
现有材料未提供充分的极端条件、重复运行或扰动测试,稳定性暂按中性评价。
适应性以及泛化能力: ★★★☆☆
现有材料未完整展示跨数据集、跨场景或分布外实验,泛化能力仍需进一步验证。
硬件需求及成本: ★★★☆☆
推理时约1-2 TFLOP/样本,45次refiner循环(7M参数)加单次8B解码器前向;相对zero-shot CoT延迟约0.34倍。
复现难度: ★★★☆☆
https://github.com/czl-david/latent-recurrent-thoughts
产品化成熟度: ★★★☆☆
论文验证以研究实验为主,真实部署中的时延、成本、维护和异常场景仍需补充验证。
可能的问题: ;2)循环refiner通过有界残差修正实现深度计算解耦,参数效率高;3)实验设计严谨,控制变量清晰。缺点:1)每任务族需单独训练模块,非通用零样本方法;2)Sudoku上远不如从零训练的专用符号求解器;3)机制分析多为相关性证据,缺乏因果证明。
*本文仅代表个人理解及观点,不构成任何论文审核或者项目落地推荐意见,具体以相关组织评审结果为准。欢迎就论文内容交流探讨,理性发言哦~ 想了解更多原文细节的小伙伴,可以点击 "阅读原文", 查看更多原论文细节哦!