语言模型的"光速"生成:CFM如何用4步追上自回归?
从1.7B参数到2.1T tokens:CFM大规模训练的工程突破
自蒸馏的艺术:如何把1000步压缩成4步?
超参数迁移的陷阱:为什么Complete(d)P在CFM上失灵?
未来展望:连续状态生成能否取代自回归?
龙迷三问
龙哥点评
论文创新性分数:★★★☆☆
CFM框架本身不是这篇论文首创的,但它把规模推到了1.7B/2.1T的新高度,并首次为CFM推导了半离散ELBO,同时系统记录了大规模训练中遇到的工程陷阱,这些增量贡献是实打实的。实验合理度:★★★★☆
在400M代理规模上做了350+组超参数消融,在1.7B上与自回归、掩码扩散、均匀扩散等多个基线在同等算力和数据下对比,实验设计相当扎实。扣掉一星是因为ESD失败的归因分析不够深入,只是笼统归为梯度估计高方差。学术研究价值:★★★★☆
这是CFM路线迄今最大规模的公开实证,为后续研究者提供了一个可信的基准:哪些超参数有效、哪些坑不能踩、自蒸馏应该选什么目标。论文没有回避失败案例,这种坦诚在顶会论文里越来越难得了。稳定性:★★★☆☆
蒸馏完成后的CFM在1~4步的少步生成中表现稳定,token熵能维持在数据分布附近,这点值得肯定。但训练过程依赖大量启发式技巧(自适应损失权重、随机反掩码、调度混合),稍有不慎就会训练发散或模式坍缩。适应性以及泛化能力:★★★☆☆
论文的评估集中在文本续写和MCQA上,尚未展示指令跟随、代码生成、多轮对话等更复杂的泛化场景。此外,上下文长度和词表大小增加时,内存开销线性增长,这限制了它在超长文本和大词表场景下的适应性。硬件需求及成本:★★☆☆☆
预训练烧了256张H100,自蒸馏另需64张H100,加上2.1T tokens的数据量,对大多数实验室和公司来说门槛非常高。论文自己也承认,L×|V|的logit矩阵开销是靠硬件硬扛下来的。复现难度:★★☆☆☆
论文没有给出开源代码和模型权重,只提供了详细的超参数配置和训练动态描述。即便按图索骥,也需要数百张H100级别的算力才能完整复现实验,对一般团队来说几乎没有复现的可能。产品化成熟度:★★☆☆☆
虽然4步生成的文本已经有不错的多样性和连贯性,但Gen PPL和MCQA分数和自回归基线还有明显差距,直接产品化会拉低用户体验。更现实的路径是先在专用低延迟场景中做受限部署,同时继续提升少步生成质量。可能的问题:论文对ESD失败的解释停留在"不稳定"层面,缺少量化分析;半离散ELBO的紧度未经验证,表1的分数可能偏低;自蒸馏只做了200k步,更长的蒸馏训练是否还能带来提升,文中没有给出答案。
主要参考文献
*本文仅代表个人理解及观点,不构成任何论文审核或者项目落地推荐意见,具体以相关组织评审结果为准。欢迎就论文内容交流探讨,理性发言哦~ 想了解更多原文细节的小伙伴,可以点击"阅读原文",查看更多原论文细节哦!
从千步蒸馏到四步生成,CFM这次是真·提速。想跟上连续流模型的最新进展?欢迎加入龙哥读论文粉丝群,扫描下方二维码或者添加龙哥助手微信号加群:kangjinlonghelper。一定要备注:研究方向+地点+学校/公司+昵称(如 大模型+上海+清华+龙哥),根据格式备注,可更快被通过且邀请进群。
『龙哥读论文』微信群目前包含:图像处理、大模型及智能体、自动驾驶及机器人、AI医疗及AI金融5个群
『龙哥读论文』微信群目前包含:图像处理、大模型及智能体、自动驾驶及机器人、AI医疗及AI金融5个群
*本文仅代表个人理解及观点,不构成任何论文审核或者项目落地推荐意见,具体以相关组织评审结果为准。欢迎就论文内容交流探讨,理性发言哦~ 想了解更多原文细节的小伙伴,可以点击"阅读原文",查看更多原论文细节哦!