← 返回 PaperDaily
大模型与智能体
MIT新作:7步解数独的流推理模型
这篇论文最有意思的地方,不是又造了一个“更会猜答案”的模型,而是把离散流模型硬生生改造成了会自我验证、会自我修正的推理器。数独上 7 次前向传播到 99.2%,还把 OOD 难题一起带飞,值得细看。
龙哥读论文
阅读 3
查看原文
🐉 龙哥读论文知识星球来了!公众号每日8篇拆解不够看?星球无上限更AI领域论文、资讯、招聘、招博、开源代码,一站式干货,每日2分钟刷完即赚!
👇扫码加入「龙哥读论文」知识星球,前沿干货、实用资源一站式拿捏~
龙哥推荐理由:
这篇论文最有意思的地方,不是又造了一个“更会猜答案”的模型,而是把离散流模型硬生生改造成了会自我验证、会自我修正的推理器。数独上 7 次前向传播到 99.2%,还把 OOD 难题一起带飞,值得细看。
原论文信息如下:
揭秘AI推理新范式:流模型也能“自我反思”并修正错误
这篇论文最有意思的地方,不是把数独“硬算”出来,而是让流模型学会了一个很像人类的动作:先给答案,再回头看一眼,发现不对就继续改。听起来像废话,做起来可一点不废。因为在结构化推理任务里,真正难的往往不是“生成一个看起来像答案的东西”,而是“生成一个全局一致、经得起检查的答案”。
论文里先把问题说得很直白:离散流模型以前在文本生成上看着还行,但一碰数独、斑马谜题这种结构化推理任务,就容易“自信地胡说八道”。更扎心的是,它不是不会生成,而是会生成一堆看似合理、实际错误的解。于是作者换了个思路:既然模型老爱犯错,那就别只把它当生成器,也把它当审题老师。
这里的关键概念是离散流模型。它不是自回归那种一个 token 一个 token 往外吐,而是把离散序列映射到连续空间里,通过若干步去噪和积分,最后再解码回离散 token。论文里把这个过程改造成了一个“有记忆的迭代系统”:每一步都把上一步的预测作为条件输入,让模型一边生成、一边修正,像在不断把答案往稳定点上拽。
这就引出了全文最核心的直觉:正确答案是稳定不动点。如果一个候选解被重新加噪、再重新求解后还能回到自己,那它大概率是“稳”的;反过来,错误答案常常一扰动就散。这个想法不新鲜,但作者的厉害之处在于:不是拿它当比喻,而是把它变成了可计算、可训练、可测试时扩展的机制。
“不动点”思想:如何让AI自己判断答案对不对?
先把人话讲透:如果一个模型每次看到同一个答案,都会稳定回到同一个结果,那这个答案就像站在“吸引子”里;如果一扰动就跑偏,那它就不稳。论文把这种现象叫作固定点稳定性(fixed-point stability)。
论文里有个很关键的操作叫self-conditioning,中文可以理解成“自我条件化”或“自我喂回”。它的英文全称就是 self-conditioning,意思是把模型上一步的预测 logits 再喂给下一步。这样一来,模型不再是每步都从零开始瞎猜,而是带着“刚才我以为自己想到了什么”的记忆继续修正。这个设计很朴素,但在迭代推理里特别实用。
更妙的是,作者没有只盯着“能不能生成”,而是直接问:“模型自己能不能判断自己生成的东西稳不稳?”于是他们把一个完成的候选解重新加噪,再让模型重新解一遍,观察它是否回到原答案。这个过程得到的分数可以理解为一种内部一致性检测:如果重解后变化很小,说明这个答案更像稳定解;如果变化很大,说明这个答案可能只是“看起来像对的”。
这套思路的妙处在于,它不需要外部验证器。模型自己既负责出题,也负责阅卷。听上去有点像让选手自己批卷子,但在数独这种可检查任务里,稳定性确实能提供很强的判别信号。论文里甚至把这个信号做成了测试时扩展的核心:不是只采一个答案,而是采很多个候选,再保留那些“自己都认可自己”的答案。
FLOWDPO:让模型自主“排雷”,远离自信的错误
光靠测试时反复试,当然能把准确率堆上去,但代价也很明显:算力烧得像开了暖气。于是作者开始动训练阶段的脑筋,提出了FLOWDPO。这个缩写的英文全称是 Flow Direct Preference Optimization,中文可以理解为“流模型直接偏好优化”。它借用了 DPO(Direct Preference Optimization,直接偏好优化)的思想,但不是拿人类偏好数据,而是拿模型自己挖出来的错误答案当负样本。
这一步的思路很“损”,也很有效:先让当前模型自己采样出一些错误解,再把这些错误解和金标准答案做成偏好对,训练模型更偏向正确答案、远离那些它自己最容易犯的错。和普通交叉熵相比,FLOWDPO不是泛泛地提高正确 token 的概率,而是直接点名“这个错答案,别再信它了”。对结构化推理来说,这种定点打击往往比全局平均用力更管用。
论文还做了一个很重要的细化:偏好损失不是压整个序列,而是只盯住“错的那些格子”。这就像改卷子时不去重写整张卷面,只改导致错误的关键题。原因也很朴素:很多负样本和金答案其实大部分位置都一样,真正决定对错的只有少数几个单元。如果把整串都拿去对比,反而会和原本的监督信号打架。
这一段的本质,是把“验证信号”反过来训练成“生成偏好”。也就是说,模型先通过稳定性学会识别坏答案,再通过偏好优化学会少走进那些坏盆地。这个闭环设计挺漂亮:不是单纯把模型训得更大,而是把模型的错误分布改得更聪明。
效率碾压八倍:仅靠7步计算攻克数独难题
真正让这篇工作从“概念不错”变成“工程上有点东西”的,是效率。论文最亮眼的数字之一,是在数独任务上只用大约 7 次前向传播,就达到了 99.2% 的解题率;而作者对比的强 masked-diffusion 基线要到 57 次前向传播才能到同样水平。这个差距不是“快一点”,而是算力账单直接瘦身一大圈。
为什么能省这么多步?因为它不是盲目多采样,而是在“更容易收敛”的轨道上走。self-conditioning 让每一步都接着上一步修;自我验证则负责在不稳定时及时刹车重来。两者叠加后,模型不再像没头苍蝇一样重复撞墙,而更像沿着盆地边缘往中心滚。对这类可检查任务来说,这种迭代比纯暴力搜索更像正经解法。
不过也得说句实话:这里的效率优势是建立在任务结构非常清晰、答案可以被严格验证的前提上。数独是天然适合这种方法的,因为对错一眼可判,稳定性也好定义。换到开放式自然语言问答,情况就没这么舒服了——答案边界模糊,稳定点未必等于正确点,这套方法的“神勇”会打折。
从数独到OOD难题:泛化能力落地检验
这篇论文另一个值得看的点,是它没有只在训练分布里自嗨。作者专门测了更难的 OOD(out-of-distribution,分布外) 数独,也就是 SUDOKU-EXTREME。这个测试集训练时没见过,难度更高,属于“你以为你会了,其实只是背过题型”的那种考法。
结果挺有意思:即便没有在这个分布上训练,模型仍然能靠测试时扩展把准确率顶上去,说明稳定性信号不是只对训练集“背答案”,而是真的捕捉到了任务结构。不过也要注意,OOD 变强不等于通用推理能力已经解决。这里的任务依然是可验证、闭合、规则明确的。它证明的是“在这类任务上,流模型可以通过自我验证做得很强”,不是说它已经能替代所有推理模型。
更直白一点:这篇工作真正打通的是“生成—验证鸿沟”。模型能认出稳定解,说明它脑子里确实有点结构感;再把这个信号拿去训练和测试时扩展,效果就被放大了。这个逻辑是通的,而且实验也基本支撑得住。
重审论文:顶会评审视角下的亮点与局限
如果按顶会评审的眼光看,这篇工作最强的点不在“又换了一个模型骨架”,而在把同一个信号同时用于生成、验证和训练。这件事很完整:先发现稳定性信号,再把它变成测试时筛选器,最后再用 FLOWDPO 把模型推向更优的固定点。方法链条是闭合的,不是拼装式改进。
但局限也很清楚。第一,这套方法对“答案可检查”的任务特别友好,换到开放式推理、长文本生成,稳定点和正确答案的关系就没这么简单。第二,测试时扩展虽然能涨点,但本质上是在花计算换稳定性,预算不够的时候未必划算。第三,FLOWDPO 依赖模型自己挖负样本,说明它的效果和基础模型初始能力强相关,底子太差时未必能挖出足够有用的错。
所以这篇论文最值得被记住的,不是“数独 99.2%”这个孤立数字,而是它把流模型从“会生成”往“会反省”推了一步。这个方向很像给模型装了一个小型内省回路:先猜、再看、再改、再筛。对结构化推理来说,这比单纯堆大模型更像一条可持续路线。
龙迷三问
这篇论文到底解决了什么问题?它解决的是“流模型会生成,但不一定会推理”的问题。作者把离散流模型改造成会自我验证、会自我修正的推理器,让模型既能出答案,也能判断答案稳不稳。
self-conditioning 和 FLOWDPO 分别是什么意思?self-conditioning 就是把模型上一步的预测再喂回下一步,让它边生成边修正;FLOWDPO 是 Flow Direct Preference Optimization,中文可理解为流模型直接偏好优化,用模型自己采样出来的错误答案当负样本,训练它远离这些错误盆地。
为什么说“不动点”很重要?因为在这篇论文里,正确答案往往对应一个稳定不动点:重新加噪、再求解后还能回到自己。这个性质让模型可以把“稳定性”当成内部验证信号,从而在测试时筛掉很多看似自信、实际错误的解。
如果你还有哪些想要了解的,欢迎在评论区留言或者讨论~
龙哥点评
论文创新性分数:★★★★☆
不是凭空造一个新模型,而是把离散流模型的“稳定性”变成推理、验证和训练三位一体的机制,思路很完整,且有明确新意。
实验合理度:★★★★☆
对数独、OOD 数独和斑马谜题都做了验证,还给了消融实验,能支撑核心结论;但任务类型仍偏结构化,可泛化边界需要更大范围验证。
学术研究价值:★★★★☆
对“生成—验证鸿沟”和“不动点推理”给出了很清晰的实验路径,值得后续在更多可验证任务上继续扩展。
稳定性:★★★☆☆
在数独这类任务上稳定性很强,但对开放式推理和复杂自然语言任务,稳定点是否仍等于正确点,还需要额外验证。
适应性以及泛化能力:★★★☆☆
对 OOD 数独和斑马谜题有不错泛化,但本质还是规则明确的结构化推理,离“通吃所有推理任务”还有距离。
硬件需求及成本:★★★☆☆
单次效率进步明显,但测试时扩展和重启仍要花计算;如果预算紧,收益会被成本稀释。
复现难度:★★★☆☆
方法逻辑清楚,但涉及自我验证、重启、FLOWDPO 和负样本挖掘,工程链条不算短;若代码和配置不全,复现会有门槛。
产品化成熟度:★★★☆☆
适合规则明确、可自动验算的推理场景;要做成通用产品,还得补上更强的错误检测、成本控制和更广泛任务验证。
可能的问题:方法很聪明,但适用边界偏窄;对开放式任务的“稳定性=正确性”假设未必成立,算力开销也会限制落地速度。
主要参考文献
Alec Helbling, Andrey Bryutkin, Mauro Martino, Nima Dehmamy, Hendrik Strobelt. Flow Reasoning Models: Scaling Reasoning Through Iterative Self-Refinement. arXiv:2606.30347, 2026.
arXiv 原文链接:https://arxiv.org/pdf/2606.30347v1.pdf
欢迎加入龙哥读论文粉丝群,
扫描下方二维码或者添加龙哥助手微信号加群:kangjinlonghelper。
一定要备注:研究方向+地点+学校/公司+昵称(如 图像处理+上海+清华+龙哥),根据格式备注,可更快被通过且邀请进群。
想跟进离散流、推理模型、测试时扩展这些硬核方向,进群就对了。