← 返回 PaperDaily 大模型与智能体

Apple最新实测:1.7B流模型4步生成,文本质量直追自回归

自回归模型统治语言建模多年,但Apple这次把连续流模型直接干到了1.7B参数、2.1T tokens的规模,自蒸馏后只需4步推理就能生成高质量文本。这是CFM路线迄今最大规模的实证,值得所有关注非自回归生成的人仔细看看。

Apple最新实测:1.7B流模型4步生成,文本质量直追自回归
原论文信息如下:
论文标题:
Scaling Categorical Flow Maps
发表日期:
2026年05月
论文作者:
Oscar Davis, Anastasiia Filippova, Pierre Ablin, Victor Turrisi, Amitis Shidani, Marco Cuturi, Louis Béthune
发表单位:
Apple, University of Oxford
原文链接:
https://arxiv.org/pdf/2605.07820

语言模型的世界里,自回归(AR)已经称王太久了。从GPT到LLaMA,从左到右一个个蹦token的范式统治了整个行业。但这条路有两个天生的痛点:推理速度慢——生成一个token就要跑一次前向;以及难以并行——第N个token必须等前面N-1个都算完。
扩散模型和流匹配在图像、音频等连续模态上大杀四方,学术界一直在想:能不能把这套本事搬到离散的文本上来?过去几年,离散扩散(discrete diffusion)确实取得了一些进展,但那些方法大多在离散网格上演化,没法直接用连续模态那套成熟的工具,比如引导(guidance)、分布倾斜(tilting)和加速采样。
近两年,一条新路线开始崭露头角——Categorical Flow Maps(CFM),核心思路是:把离散文本的one-hot编码放到连续空间里,用高斯噪声到数据的连续插值来做流匹配,再通过流图(flow map)学习实现少步采样。之前的CFM工作已经在中小规模上验证了可行性,但都在1B参数以下,能不能像自回归那样scale到几十亿参数、几万亿token,一直是个悬而未决的大问号。
Apple和牛津大学这次直接把这个问号拉直了:训练了一个1.7B参数的流匹配模型,吃下2.1T tokens,再通过自蒸馏变成CFM,只需要4次函数评估(NFE)就能生成多样化、高质量的文本,token熵逼近数据分布本身。同时,论文还推导了半离散设定下的ELBO(证据下界),让CFM也能在标准语言模型基准上打分,并且开源了部分训练洞察。这是CFM路线迄今最大规模的实证,也是连续状态生成在语言模型规模上的一次正面宣言。

语言模型的"光速"生成:CFM如何用4步追上自回归?

先给不熟悉CFM的读者补个背景。流匹配(Flow Matching)的核心思想,是学习一个随时间变化的向量场,把噪声分布平滑地"运输"到数据分布。采样时,沿着这个向量场积分就能生成数据。标准做法需要很多步积分(几百上千次函数评估)才能保证质量。
流图匹配(Flow Map Matching)则更进一步:不学单时间点的向量场,而是学一个"跳跃函数",直接从任意时间点s跳到另一个时间点t。理想情况下,学好的流图可以一步(或很少几步)把噪声映射到数据。CFM把这一套搬到了离散token的连续表示上——每个token对应单纯形(simplex)的一个顶点,模型在连续空间里演化,最后用argmax解码回离散token。
图2:Categorical Flow Maps在单纯形上的示意图,每个顶点对应一个token。ODE轨迹连续地将带噪的x0向数据运输。流图X0,1(x0)一步走完整条路径。
图2:Categorical Flow Maps在单纯形上的示意图,每个顶点对应一个token。ODE轨迹连续地将带噪的x0向数据运输。流图X0,1(x0)一步走完整条路径。
Apple这篇论文的目标很直接:把CFM从实验室玩具scale到LLM级别。他们训练了一个1.7B参数的流模型,在Nemotron预训练数据集上吃了2.1T tokens,然后用自蒸馏把上千步的推理压缩到4步。为了找到最优配置,他们先在400M参数的代理模型上做了350+组超参数实验,再把这些经验迁移到大模型上。这种方法论本身就值得学习——大规模训练不可能盲目试错,小规模代理是必由之路。

从1.7B参数到2.1T tokens:CFM大规模训练的工程突破

大模型训练的工程量级,CFM这条路并不轻松。论文里给出了一个关键痛点:CFM需要物化完整的L×|V|连续状态轨迹矩阵。在1.7B规模下,上下文长度L=2048,词表大小|V|约10万,也就是说每一步前向都要处理2048×100000的logit矩阵。论文坦诚地说,这个瓶颈是靠256张H100硬扛下来的。
预训练配置如下:1.7B参数、2.1T tokens、256张H100、每GPU batch size为10、上下文2048。自蒸馏阶段则是200k步、64张H100、batch size为6。这种资源消耗,一般团队确实玩不起,但也说明Apple在这条路线上是认真的。
架构上采用AdaLN-Zero调制的Transformer,旋转位置编码,SwiGLU MLP和RMSNorm,基本是当前扩散Transformer的主流配置。模型接受带噪的单纯形表示x∈R^(L×K)作为输入,同时注入两个标量时间条件(s,t),通过正弦编码嵌入、经AdaLN-Zero注入网络。s=t时就是标准去噪器,s≠t时学习完整的双时间流图。
训练过程中的一个关键技巧是"随机反掩码"(random unmasking):模型默认只训练生成完整无条件序列,但下游任务通常需要条件生成(给定prompt续写)。他们借鉴Dieleman等人的做法,以一定概率p随机保留文本前缀作为条件,前缀长度从均匀分布U[1,L/d]中采样。这个看似简单的trick对MAUVE⋆指标影响巨大——没有它,MAUVE⋆几乎为零。
在超参数选择上,他们先做了一轮30配置的粗筛(调度混合λ、自适应损失权重r、前缀概率p),再做了一轮324配置的细筛。结果发现:学习率和权重衰减是主要驱动力,而p、d、λ在窄范围内都很鲁棒。调度最优值在λ≈0.75附近,纯误差解码(λ=1)反而会崩溃。自适应损失权重(r=0.5)能一致地改善Gen PPL,但轻微损害MAUVE⋆,存在token级质量和分布级保真度之间的权衡。
图4:调度λ、自适应损失权重r和干净前缀概率p的消融实验:生成困惑度和MAUVE⋆分数随λ的变化。
图4:调度λ、自适应损失权重r和干净前缀概率p的消融实验:生成困惑度和MAUVE⋆分数随λ的变化。
图5:各超参数对Gen PPL(上)和MAUVE⋆(下)的边际效应,在所有其他变量上取平均(324个配置)。阴影区域表示±1标准差。学习率和权重衰减是主要驱动因素;p、d和λ在收窄范围内鲁棒。
图5:各超参数对Gen PPL(上)和MAUVE⋆(下)的边际效应,在所有其他变量上取平均(324个配置)。阴影区域表示±1标准差。学习率和权重衰减是主要驱动因素;p、d和λ在收窄范围内鲁棒。

自蒸馏的艺术:如何把1000步压缩成4步?

预训练的流模型虽然质量不错,但推理要跑上千步,完全没有实用价值。自蒸馏(self-distillation)阶段就是把"慢思考"压缩成"快反应"的关键。
这个过程的本质是:用一个已经训练好的教师模型(预训练的流模型),去教学生模型(流图)学会直接从任意时间点跳到终点。学生模型虽然在架构上和教师一样,但它额外接收两个时间条件(s,t),学的是"跳跃"而非"一步步走"。
论文里探索了两种自蒸馏目标:PSD(Progressive Self-Distillation,渐进式自蒸馏)和ESD(Eulerian-logit Self-Distillation,欧拉logit自蒸馏)。PSD的核心是在(s,u,t)三个时间点上做一致性约束:从s跳到u再从u跳到t,应该等于直接从s跳到t。ESD则是在logit层面做蒸馏,需要计算雅可比,计算开销很大。
在短跑10k步的消融实验中,他们对比了三种散度(forward KL、reverse KL、JSD)和两种时间采样分布(uniform、logit-normal)。结果很有意思:reverse KL导致几乎所有训练都发散,而ESD在大规模上也出现了模式坍缩或MAUVE⋆退化,最终只能舍弃ESD、专注于PSD。这个"踩坑"记录对后来者非常珍贵——不是所有理论上漂亮的目标函数在scale上去之后还好用。
图6:PSD自蒸馏10k步消融:散度选择对MAUVE⋆和Gen PPL的边际效应,按时间采样分布取平均。
图6:PSD自蒸馏10k步消融:散度选择对MAUVE⋆和Gen PPL的边际效应,按时间采样分布取平均。
最终选择PSD + forward KL和PSD + JSD两种配置进行完整的200k步蒸馏。效果怎么样?看下图。
图1:(左)Gen PPL与NFE的关系。(右)Token熵与NFE的关系。灰色带状区域表示数据分布的token熵。圆圈点上方提供了短期定性样本,反映该NFE区间的生成质量。自蒸馏使得在显著更少的函数评估下实现高质量、多样化的生成成为可能。
图1:(左)Gen PPL与NFE的关系。(右)Token熵与NFE的关系。灰色带状区域表示数据分布的token熵。圆圈点上方提供了短期定性样本,反映该NFE区间的生成质量。自蒸馏使得在显著更少的函数评估下实现高质量、多样化的生成成为可能。
在1024步时,未蒸馏的流模型Gen PPL达到58.66,AR基线是45.33,差距不算太大。但蒸馏后的CFM在4步时MAUVE⋆就有显著提升,未蒸馏模型在1-2步时几乎坍缩,而流图模型依然保持多样性。图8更直观地展示了这一差距。
图8:MAUVE⋆与NFE的关系。在低NFE区间,蒸馏和未蒸馏模型之间存在显著差距。
图8:MAUVE⋆与NFE的关系。在低NFE区间,蒸馏和未蒸馏模型之间存在显著差距。
从条件生成的角度看,蒸馏模型的∆ PPL在少步区间改善显著,1步时未蒸馏模型直接坍缩(输出退化文本),而蒸馏模型依然能产出有意义的文本。4步时的蒸馏模型∆ PPL甚至比128步的未蒸馏模型更低。
图9:∆ PPL(条件生成)与NFE的关系。未蒸馏模型在1 NFE时产生坍缩输出。
半离散ELBO:给连续流模型一把"评分尺"
少步生成的文本质量有目共睹,但怎么用标准语言模型基准来客观评估CFM,还是一个棘手的问题。自回归模型可以直接输出每个token的条件概率,连乘起来就是整个序列的似然,拿去给选择题选项打分毫无压力。但流模型给出的是一条连续空间中的轨迹,并不直接产出离散token的概率。
为了补上这块短板,论文推导了一个半离散设定下的ELBO(Evidence Lower Bound,证据下界)。它的核心思路是:把某个离散token x的似然,写成流模型在终点时刻落在x对应的单纯形顶点邻域内的概率。噪声分布是连续的、数据分布是离散的,"半离散"这个词正是由此而来。
公式(4.1):半离散ELBO。左侧为负对数似然,右侧为插值路径上加权交叉熵损失的期望加上终点处的交叉熵项。
这个公式里,左边是负对数似然,右边是在插值路径上对交叉熵损失做一个带权重的时间积分,再在轨迹终点额外加一项交叉熵。直观理解就是:把整个去噪过程中模型犯的错误按时间累积起来,作为似然的一个上界。这个上界不需要像连续归一化流那样求散度积分,省去了大量计算开销。对于1.7B规模的大模型,这一点至关重要。
表1:基于似然基准上的零样本准确率(%)。†为Sahoo等(2026a)的模型(1.7B参数,相同数据和算力预算)。∗为外部先前工作。CFM似然通过MC ELBO估算。每列最佳非AR结果以粗体显示。
表1:基于似然基准上的零样本准确率(%)。†为Sahoo等(2026a)的模型(1.7B参数,相同数据和算力预算)。∗为外部先前工作。CFM似然通过MC ELBO估算。每列最佳非AR结果以粗体显示。
有了这把"评分尺",论文在6个常见的多项选择问答(MCQA)基准上对CFM做了零样本评估。结果不出意料但耐人寻味:CFM的准确率在所有基准上明显高于随机猜测,与Eso-LM(插值方法)处于同一水平,但略低于MDLM(掩码扩散)等直接以ELBO为训练目标的离散扩散方法,与自回归基线更是还有一段距离。
仔细想想,这个差距其实并不意外。离散扩散方法从训练第一天起就在优化ELBO,而CFM的第二阶段是在做自蒸馏,优化目标是少步生成质量,不是似然。能在这种"不务正业"的前提下拿到不输Eso-LM的成绩,说明CFM学到的分布没有跑偏。当然,ELBO的紧度目前还是个未知数,这个分数大概率是被低估的。

超参数迁移的陷阱:为什么Complete(d)P在CFM上失灵?

大模型训练中有一个很诱人的想法:在400M的小模型上把超参数调好,然后用零样本超参数迁移(zero-shot hyperparameter transfer)直接推断出1.7B模型的最优超参数,免去在大模型上反复试错的巨额成本。Complete(d)P就是这样一种理论驱动的迁移方法,它的核心思想是让模型宽度、深度、批量大小等变量按特定规律等比缩放,使得不同规模下模型的最优超参数保持一致。
这套方法在标准Transformer上屡试不爽,但这次在CFM上碰了壁。论文尝试将时间条件层当作隐藏层来适配Complete(d)P,在400M规模上搜索了最佳超参数,再迁移到1.7B规模。结果如下图所示:迁移后的超参数训练出的模型,交叉熵损失从头到尾都比直接在大模型上手动调参要高。
图14:有无Complete(d)P超参数迁移的CE训练损失对比(批量大小1,280,128张H100)。迁移后的超参数导致损失持续偏高。
图14:有无Complete(d)P超参数迁移的CE训练损失对比(批量大小1,280,128张H100)。迁移后的超参数导致损失持续偏高。
问题出在CFM的架构上。它额外引入了以AdaLN-Zero方式注入的时间条件层,而现有的超参数迁移理论根本没有把这种结构纳入考量。论文把时间层硬塞进"隐藏层"的框架里,结果并不理想。这个失败的尝试本身就是一个很有价值的信号:CFM这类带连续时间条件的架构,可能需要一套全新的超参数迁移理论。论文建议设计"时间条件版的μP",这为后续研究留了一个明确的坑位。

未来展望:连续状态生成能否取代自回归?

这篇论文的意义,不止于把CFM的规模上限从1B推到1.7B。它真正打开了一扇门:连续状态生成在LLM尺度上是可行的,并且在少步生成场景下已经展现出了实用价值。那接下来的问题就是——这条路能走多远?
图31:NFE=4时跨方法生成质量对比。
图31:NFE=4时跨方法生成质量对比。
短期来看,CFM最现实的应用场景是对延迟敏感的大规模文本生成。自回归模型生成一个token需要一次前向,而CFM在4步之内就能完成整段文本的生成,理论上可以把端到端延迟降低一到两个数量级。对于实时交互、批量内容生产这类场景,这个优势是致命的。但同时也要冷静看到,目前CFM在标准MCQA基准上的分数还明显落后于自回归模型,且训练成本高得吓人——预训练用256张H100,自蒸馏还要再烧64张H100,这不是一般团队玩得起的游戏。
从中期看,连续空间带来的"引导"(guidance)、"倾斜"(tilting)和奖励微调工具一旦在CFM上落地,将赋予非自回归生成前所未有的可控性。比如,通过分布倾斜让模型在采样时偏向某个主题或风格,这在自回归框架里需要额外训练或复杂的采样策略,而在连续流动框架里可能只需修改向量场。这可能是CFM最值得期待的方向。
长期来看,如果连续状态生成真的成为语言建模的主流范式之一,那么语音、图像、视频、文本这些模态将共享同一套连续流动的数学工具。到那时,"多模态"将不再需要为不同模态单独设计架构。这个愿景虽然还远,但Apple这篇论文至少证明了一件事:起点已经画下,路是走得通的。

龙迷三问

下面是龙哥对于大家可能的一些问题的解答:
这篇论文到底在解决什么问题?Apple与牛津大学联合提出1.7B参数Categorical Flow Maps(CFM),在2.1T tokens上预训练后经自蒸馏,仅需4步推理即可生成高质量文本,维持近数…
这篇工作最值得看的点是什么?在1024步推理时Gen PPL达到58.66(AR基线为45.33);MAUVE⋆在8步时已达0.88超过AR基线0.7;自蒸馏后在4步推理时生成质量和多样性显著提升,token熵接近数据分布水平。
这篇工作的边界或风险在哪里?优点:1)首次将CFM扩展到17亿参数、2.1T tokens的大规模;2)通过自蒸馏实现4步以内的高质量生成;3)提出半离散ELBO支持似然评估。缺点:1)内存开销大,需要物化L×V的logit矩阵;2)ESD在大规模训练不稳定;3)零…
如果你还有哪些想要了解的,欢迎在评论区留言或者讨论~

龙哥点评

论文创新性分数:★★★☆☆

CFM框架本身不是这篇论文首创的,但它把规模推到了1.7B/2.1T的新高度,并首次为CFM推导了半离散ELBO,同时系统记录了大规模训练中遇到的工程陷阱,这些增量贡献是实打实的。

实验合理度:★★★★☆

在400M代理规模上做了350+组超参数消融,在1.7B上与自回归、掩码扩散、均匀扩散等多个基线在同等算力和数据下对比,实验设计相当扎实。扣掉一星是因为ESD失败的归因分析不够深入,只是笼统归为梯度估计高方差。

学术研究价值:★★★★☆

这是CFM路线迄今最大规模的公开实证,为后续研究者提供了一个可信的基准:哪些超参数有效、哪些坑不能踩、自蒸馏应该选什么目标。论文没有回避失败案例,这种坦诚在顶会论文里越来越难得了。

稳定性:★★★☆☆

蒸馏完成后的CFM在1~4步的少步生成中表现稳定,token熵能维持在数据分布附近,这点值得肯定。但训练过程依赖大量启发式技巧(自适应损失权重、随机反掩码、调度混合),稍有不慎就会训练发散或模式坍缩。

适应性以及泛化能力:★★★☆☆

论文的评估集中在文本续写和MCQA上,尚未展示指令跟随、代码生成、多轮对话等更复杂的泛化场景。此外,上下文长度和词表大小增加时,内存开销线性增长,这限制了它在超长文本和大词表场景下的适应性。

硬件需求及成本:★★☆☆☆

预训练烧了256张H100,自蒸馏另需64张H100,加上2.1T tokens的数据量,对大多数实验室和公司来说门槛非常高。论文自己也承认,L×|V|的logit矩阵开销是靠硬件硬扛下来的。

复现难度:★★☆☆☆

论文没有给出开源代码和模型权重,只提供了详细的超参数配置和训练动态描述。即便按图索骥,也需要数百张H100级别的算力才能完整复现实验,对一般团队来说几乎没有复现的可能。

产品化成熟度:★★☆☆☆

虽然4步生成的文本已经有不错的多样性和连贯性,但Gen PPL和MCQA分数和自回归基线还有明显差距,直接产品化会拉低用户体验。更现实的路径是先在专用低延迟场景中做受限部署,同时继续提升少步生成质量。

可能的问题:论文对ESD失败的解释停留在"不稳定"层面,缺少量化分析;半离散ELBO的紧度未经验证,表1的分数可能偏低;自蒸馏只做了200k步,更长的蒸馏训练是否还能带来提升,文中没有给出答案。


主要参考文献

[1] Roos et al. Scaling Categorical Flow Maps. arXiv preprint arXiv:2605.07820, 2026.
[2] Lee et al. Flow Map Matching for Discrete Text Generation. 2026.
[3] Potaptchik et al. Discrete Flow Maps: Few-Step Text Generation via Self-Distillation. 2026.
[4] Sahoo et al. Diffusion Models for Language Modeling at Scale. 2026.
[5] Boffi et al. Flow Map Matching: A Mathematical Framework for Consistency Models. 2025.
[6] Mlodozeniec et al. Complete(d)P: Hyperparameter Transfer for Transformers. 2025.

*本文仅代表个人理解及观点,不构成任何论文审核或者项目落地推荐意见,具体以相关组织评审结果为准。欢迎就论文内容交流探讨,理性发言哦~ 想了解更多原文细节的小伙伴,可以点击"阅读原文",查看更多原论文细节哦!       

end
从千步蒸馏到四步生成,CFM这次是真·提速。想跟上连续流模型的最新进展?欢迎加入龙哥读论文粉丝群,扫描下方二维码或者添加龙哥助手微信号加群:kangjinlonghelper。一定要备注:研究方向+地点+学校/公司+昵称(如 大模型+上海+清华+龙哥),根据格式备注,可更快被通过且邀请进群。
『龙哥读论文』微信群目前包含:图像处理、大模型及智能体、自动驾驶及机器人、AI医疗及AI金融5个群
wechat_helper dianzan

*本文仅代表个人理解及观点,不构成任何论文审核或者项目落地推荐意见,具体以相关组织评审结果为准。欢迎就论文内容交流探讨,理性发言哦~ 想了解更多原文细节的小伙伴,可以点击"阅读原文",查看更多原论文细节哦!       

转发文章 微博 X LinkedIn Facebook
龙哥读论文 · PaperDaily

本文基于龙哥读论文 PaperDaily 数据库整理,结合论文原文与工程视角进行解读。