← 返回 PaperDaily 大模型与智能体

MIT新作:7步解数独的流推理模型

这篇论文最有意思的地方,不是又造了一个“更会猜答案”的模型,而是把离散流模型硬生生改造成了会自我验证、会自我修正的推理器。数独上 7 次前向传播到 99.2%,还把 OOD 难题一起带飞,值得细看。

MIT新作:7步解数独的流推理模型
🐉 龙哥读论文知识星球来了!
公众号每日8篇拆解不够看?星球无上限更AI领域论文、资讯、招聘、招博、开源代码,一站式干货,每日2分钟刷完即赚! 👇扫码加入「龙哥读论文」知识星球,前沿干货、实用资源一站式拿捏~ xingqiu_header

龙哥推荐理由:
这篇论文最有意思的地方,不是又造了一个“更会猜答案”的模型,而是把离散流模型硬生生改造成了会自我验证、会自我修正的推理器。数独上 7 次前向传播到 99.2%,还把 OOD 难题一起带飞,值得细看。


原论文信息如下:
论文标题:
FLOW REASONING MODELS: SCALING REASONING THROUGH ITERATIVE SELF-REFINEMENT
发表日期:
2026年06月
发表单位:
Georgia Tech, MIT, MIT-IBM Computing Research Lab, IBM Research
原文链接:
https://arxiv.org/pdf/2606.30347v1.pdf

揭秘AI推理新范式:流模型也能“自我反思”并修正错误

这篇论文最有意思的地方,不是把数独“硬算”出来,而是让流模型学会了一个很像人类的动作:先给答案,再回头看一眼,发现不对就继续改。听起来像废话,做起来可一点不废。因为在结构化推理任务里,真正难的往往不是“生成一个看起来像答案的东西”,而是“生成一个全局一致、经得起检查的答案”。
图1:流推理模型把正确答案看成稳定不动点,自我修正后还能继续自我验证。
图1:流推理模型把正确答案看成稳定不动点,自我修正后还能继续自我验证。左边是“稳定盆地”与“错误盆地”的直观图;中间是把上一步预测喂回模型的自我条件化(self-conditioning);右边则是把“自我验证”接到测试时扩展上,靠模型自己的稳定性信号筛答案。
论文里先把问题说得很直白:离散流模型以前在文本生成上看着还行,但一碰数独、斑马谜题这种结构化推理任务,就容易“自信地胡说八道”。更扎心的是,它不是不会生成,而是会生成一堆看似合理、实际错误的解。于是作者换了个思路:既然模型老爱犯错,那就别只把它当生成器,也把它当审题老师。
这里的关键概念是离散流模型。它不是自回归那种一个 token 一个 token 往外吐,而是把离散序列映射到连续空间里,通过若干步去噪和积分,最后再解码回离散 token。论文里把这个过程改造成了一个“有记忆的迭代系统”:每一步都把上一步的预测作为条件输入,让模型一边生成、一边修正,像在不断把答案往稳定点上拽。
这就引出了全文最核心的直觉:正确答案是稳定不动点。如果一个候选解被重新加噪、再重新求解后还能回到自己,那它大概率是“稳”的;反过来,错误答案常常一扰动就散。这个想法不新鲜,但作者的厉害之处在于:不是拿它当比喻,而是把它变成了可计算、可训练、可测试时扩展的机制。

“不动点”思想:如何让AI自己判断答案对不对?

先把人话讲透:如果一个模型每次看到同一个答案,都会稳定回到同一个结果,那这个答案就像站在“吸引子”里;如果一扰动就跑偏,那它就不稳。论文把这种现象叫作固定点稳定性(fixed-point stability)。
图4:重新加噪后再求解,正确单元和错误单元会表现出明显不同的稳定性。
图4:重新加噪后再求解,正确单元和错误单元会表现出明显不同的稳定性。正确单元的重解偏差接近零,错误单元则会明显漂移,这个信号后来直接被拿来当“自我验证器”。
论文里有个很关键的操作叫self-conditioning,中文可以理解成“自我条件化”或“自我喂回”。它的英文全称就是 self-conditioning,意思是把模型上一步的预测 logits 再喂给下一步。这样一来,模型不再是每步都从零开始瞎猜,而是带着“刚才我以为自己想到了什么”的记忆继续修正。这个设计很朴素,但在迭代推理里特别实用。
更妙的是,作者没有只盯着“能不能生成”,而是直接问:“模型自己能不能判断自己生成的东西稳不稳?”于是他们把一个完成的候选解重新加噪,再让模型重新解一遍,观察它是否回到原答案。这个过程得到的分数可以理解为一种内部一致性检测:如果重解后变化很小,说明这个答案更像稳定解;如果变化很大,说明这个答案可能只是“看起来像对的”。
这套思路的妙处在于,它不需要外部验证器。模型自己既负责出题,也负责阅卷。听上去有点像让选手自己批卷子,但在数独这种可检查任务里,稳定性确实能提供很强的判别信号。论文里甚至把这个信号做成了测试时扩展的核心:不是只采一个答案,而是采很多个候选,再保留那些“自己都认可自己”的答案。

FLOWDPO:让模型自主“排雷”,远离自信的错误

光靠测试时反复试,当然能把准确率堆上去,但代价也很明显:算力烧得像开了暖气。于是作者开始动训练阶段的脑筋,提出了FLOWDPO。这个缩写的英文全称是 Flow Direct Preference Optimization,中文可以理解为“流模型直接偏好优化”。它借用了 DPO(Direct Preference Optimization,直接偏好优化)的思想,但不是拿人类偏好数据,而是拿模型自己挖出来的错误答案当负样本。
图5:FLOWDPO把模型自己的自信错误压下去,让正确答案的盆地更深。
图5:FLOWDPO把模型自己的自信错误压下去,让正确答案的盆地更深。左边是基础模型,正确答案只是很多候选中的一个弱峰;右边是经过 FLOWDPO 后,正确答案更集中,错误盆地被明显压低。
这一步的思路很“损”,也很有效:先让当前模型自己采样出一些错误解,再把这些错误解和金标准答案做成偏好对,训练模型更偏向正确答案、远离那些它自己最容易犯的错。和普通交叉熵相比,FLOWDPO不是泛泛地提高正确 token 的概率,而是直接点名“这个错答案,别再信它了”。对结构化推理来说,这种定点打击往往比全局平均用力更管用。
论文还做了一个很重要的细化:偏好损失不是压整个序列,而是只盯住“错的那些格子”。这就像改卷子时不去重写整张卷面,只改导致错误的关键题。原因也很朴素:很多负样本和金答案其实大部分位置都一样,真正决定对错的只有少数几个单元。如果把整串都拿去对比,反而会和原本的监督信号打架。
图6:生成和验证之间存在明显鸿沟,训练后这个鸿沟被明显缩小。
图6:生成和验证之间存在明显鸿沟,训练后这个鸿沟被明显缩小。左边说明模型其实很会“认错”,但不太会“少犯错”;右边则显示,加入 FLOWDPO 和 self-conditioning 后,一次生成的正确率被明显拉高。
这一段的本质,是把“验证信号”反过来训练成“生成偏好”。也就是说,模型先通过稳定性学会识别坏答案,再通过偏好优化学会少走进那些坏盆地。这个闭环设计挺漂亮:不是单纯把模型训得更大,而是把模型的错误分布改得更聪明。

效率碾压八倍:仅靠7步计算攻克数独难题

真正让这篇工作从“概念不错”变成“工程上有点东西”的,是效率。论文最亮眼的数字之一,是在数独任务上只用大约 7 次前向传播,就达到了 99.2% 的解题率;而作者对比的强 masked-diffusion 基线要到 57 次前向传播才能到同样水平。这个差距不是“快一点”,而是算力账单直接瘦身一大圈
表2:在相同模型规模下,Flow Reasoning Model 用更少前向传播达到与强基线相当的数独准确率。
表2:在相同模型规模下,Flow Reasoning Model 用更少前向传播达到与强基线相当的数独准确率。这里的核心不是单次采样更“玄学”,而是 self-conditioning 加上验证重启,把每次尝试都尽量推向稳定解。
为什么能省这么多步?因为它不是盲目多采样,而是在“更容易收敛”的轨道上走。self-conditioning 让每一步都接着上一步修;自我验证则负责在不稳定时及时刹车重来。两者叠加后,模型不再像没头苍蝇一样重复撞墙,而更像沿着盆地边缘往中心滚。对这类可检查任务来说,这种迭代比纯暴力搜索更像正经解法。
不过也得说句实话:这里的效率优势是建立在任务结构非常清晰、答案可以被严格验证的前提上。数独是天然适合这种方法的,因为对错一眼可判,稳定性也好定义。换到开放式自然语言问答,情况就没这么舒服了——答案边界模糊,稳定点未必等于正确点,这套方法的“神勇”会打折。

从数独到OOD难题:泛化能力落地检验

这篇论文另一个值得看的点,是它没有只在训练分布里自嗨。作者专门测了更难的 OOD(out-of-distribution,分布外) 数独,也就是 SUDOKU-EXTREME。这个测试集训练时没见过,难度更高,属于“你以为你会了,其实只是背过题型”的那种考法。
图3:自我验证让测试时扩展在数独、分布外数独和斑马谜题上都能推进性能上限。
图3:自我验证让测试时扩展在数独、分布外数独和斑马谜题上都能推进性能上限。左边是训练后单次就很强;中间是分布外任务上靠多轮重启把准确率顶上去;右边说明这套方法并不只会做数独,对斑马谜题也能起作用。
表1:在分布外数独上,测试时自我验证和重启能够把准确率继续推高。
表1:在分布外数独上,测试时自我验证和重启能够把准确率继续推高。基础模型和 FRM 都能随着轮数增加逼近高准确率,但 FRM 在低预算下更省步数,说明训练阶段的改造确实让模型更会“少走弯路”。
结果挺有意思:即便没有在这个分布上训练,模型仍然能靠测试时扩展把准确率顶上去,说明稳定性信号不是只对训练集“背答案”,而是真的捕捉到了任务结构。不过也要注意,OOD 变强不等于通用推理能力已经解决。这里的任务依然是可验证、闭合、规则明确的。它证明的是“在这类任务上,流模型可以通过自我验证做得很强”,不是说它已经能替代所有推理模型。
更直白一点:这篇工作真正打通的是“生成—验证鸿沟”。模型能认出稳定解,说明它脑子里确实有点结构感;再把这个信号拿去训练和测试时扩展,效果就被放大了。这个逻辑是通的,而且实验也基本支撑得住。

重审论文:顶会评审视角下的亮点与局限

如果按顶会评审的眼光看,这篇工作最强的点不在“又换了一个模型骨架”,而在把同一个信号同时用于生成、验证和训练。这件事很完整:先发现稳定性信号,再把它变成测试时筛选器,最后再用 FLOWDPO 把模型推向更优的固定点。方法链条是闭合的,不是拼装式改进。
表8:FLOWDPO 的逐步消融显示,错误单元支持、硬负样本和 EMA 参考都在起作用。
表8:FLOWDPO 的逐步消融显示,错误单元支持、硬负样本和 EMA 参考都在起作用。这个表很关键,因为它说明提升不是“玄学组合拳”,而是每个设计都有贡献,尤其是只盯错误单元这一点,收益非常明显。
但局限也很清楚。第一,这套方法对“答案可检查”的任务特别友好,换到开放式推理、长文本生成,稳定点和正确答案的关系就没这么简单。第二,测试时扩展虽然能涨点,但本质上是在花计算换稳定性,预算不够的时候未必划算。第三,FLOWDPO 依赖模型自己挖负样本,说明它的效果和基础模型初始能力强相关,底子太差时未必能挖出足够有用的错。
所以这篇论文最值得被记住的,不是“数独 99.2%”这个孤立数字,而是它把流模型从“会生成”往“会反省”推了一步。这个方向很像给模型装了一个小型内省回路:先猜、再看、再改、再筛。对结构化推理来说,这比单纯堆大模型更像一条可持续路线。

龙迷三问

下面是龙哥对于大家可能的一些问题的解答:

这篇论文到底解决了什么问题?它解决的是“流模型会生成,但不一定会推理”的问题。作者把离散流模型改造成会自我验证、会自我修正的推理器,让模型既能出答案,也能判断答案稳不稳。

self-conditioning 和 FLOWDPO 分别是什么意思?self-conditioning 就是把模型上一步的预测再喂回下一步,让它边生成边修正;FLOWDPO 是 Flow Direct Preference Optimization,中文可理解为流模型直接偏好优化,用模型自己采样出来的错误答案当负样本,训练它远离这些错误盆地。

为什么说“不动点”很重要?因为在这篇论文里,正确答案往往对应一个稳定不动点:重新加噪、再求解后还能回到自己。这个性质让模型可以把“稳定性”当成内部验证信号,从而在测试时筛掉很多看似自信、实际错误的解。

如果你还有哪些想要了解的,欢迎在评论区留言或者讨论~

龙哥点评

论文创新性分数:★★★★☆

不是凭空造一个新模型,而是把离散流模型的“稳定性”变成推理、验证和训练三位一体的机制,思路很完整,且有明确新意。

实验合理度:★★★★☆

对数独、OOD 数独和斑马谜题都做了验证,还给了消融实验,能支撑核心结论;但任务类型仍偏结构化,可泛化边界需要更大范围验证。

学术研究价值:★★★★☆

对“生成—验证鸿沟”和“不动点推理”给出了很清晰的实验路径,值得后续在更多可验证任务上继续扩展。

稳定性:★★★☆☆

在数独这类任务上稳定性很强,但对开放式推理和复杂自然语言任务,稳定点是否仍等于正确点,还需要额外验证。

适应性以及泛化能力:★★★☆☆

对 OOD 数独和斑马谜题有不错泛化,但本质还是规则明确的结构化推理,离“通吃所有推理任务”还有距离。

硬件需求及成本:★★★☆☆

单次效率进步明显,但测试时扩展和重启仍要花计算;如果预算紧,收益会被成本稀释。

复现难度:★★★☆☆

方法逻辑清楚,但涉及自我验证、重启、FLOWDPO 和负样本挖掘,工程链条不算短;若代码和配置不全,复现会有门槛。

产品化成熟度:★★★☆☆

适合规则明确、可自动验算的推理场景;要做成通用产品,还得补上更强的错误检测、成本控制和更广泛任务验证。

可能的问题:方法很聪明,但适用边界偏窄;对开放式任务的“稳定性=正确性”假设未必成立,算力开销也会限制落地速度。


主要参考文献

Alec Helbling, Andrey Bryutkin, Mauro Martino, Nima Dehmamy, Hendrik Strobelt. Flow Reasoning Models: Scaling Reasoning Through Iterative Self-Refinement. arXiv:2606.30347, 2026.
arXiv 原文链接:https://arxiv.org/pdf/2606.30347v1.pdf

end
欢迎加入龙哥读论文粉丝群,扫描下方二维码或者添加龙哥助手微信号加群:kangjinlonghelper。一定要备注:研究方向+地点+学校/公司+昵称(如 图像处理+上海+清华+龙哥),根据格式备注,可更快被通过且邀请进群。想跟进离散流、推理模型、测试时扩展这些硬核方向,进群就对了。
wechat_helper dianzan
转发文章 微博 X LinkedIn Facebook
龙哥读论文 · PaperDaily

本文基于龙哥读论文 PaperDaily 数据库整理,结合论文原文与工程视角进行解读。