← 返回 PaperDaily
大模型与智能体
Cornell新方法SPS:状态和预测分家更强
Transformer 一直把“记忆”和“预测”塞进同一条链路里,像让一个人一边背台词一边写剧本。康奈尔这篇论文直接把两件事拆开,结果是更低损失、更好泛化,而且推理几乎不涨成本,思路很硬。
龙哥读论文
阅读 3
查看原文
🐉 龙哥读论文知识星球来了!公众号每日8篇拆解不够看?星球无上限更AI领域论文、资讯、招聘、招博、开源代码,一站式干货,每日2分钟刷完即赚!👇扫码加入「龙哥读论文」知识星球,前沿干货、实用资源一站式拿捏~
龙哥推荐理由:
Transformer 一直把“记忆”和“预测”塞进同一条链路里,像让一个人一边背台词一边写剧本。康奈尔这篇论文直接把两件事拆开,结果是更低损失、更好泛化,而且推理几乎不涨成本,思路很硬。
原论文信息如下:
一分为二:Transformer的“左右互搏”之痛
Transformer 看起来很强,实际干活时却有点“身兼数职”的尴尬:同一个隐藏状态,既要负责当前这一步该预测什么,又要负责把信息存起来,给后面步骤继续用。这就像让一个人一边背台词,一边当导演,还得顺手记账,能不累吗?
这篇论文抓住的,就是这个看似自然、实则别扭的结构性问题。作者把它概括成一个很直接的判断:“预测”和“状态”这两件事,硬塞进同一条计算链路里,会互相抢资源。 于是,模型虽然还能跑,但不一定跑得最省、最准、最稳。
这里先把缩写说清楚。SPS 是 State-Prediction Separation,中文就是状态-预测分离。论文的核心不是换一个更花哨的注意力名字,而是非常朴素地问一句:如果把“存状态”和“做预测”拆开,语言模型会不会更会学?
状态-预测分离(SPS)Transformer:为每个角色开辟专属通道
SPS 的做法并不复杂,甚至有点“工程味儿”:它在每个输入 token 后面插入一个额外的 token。这样一来,序列不再是“一个位置干两份活”,而是变成了两个位置分工协作——输入 token 先把状态往前传, token 再专门负责吐出下一词的概率分布。
论文里最关键的一点,是它不是简单“加长上下文”那么粗暴。作者保留了一个持久状态流和一个预测流:前者的 KV cache 会长期保留,后者只在一个小窗口内短暂存在,过了窗口就丢掉。这样,模型既能给当前预测留出专门的“思考位”,又不会把缓存撑得太大。
这里要顺手解释一个工程背景。LLM 推理时,KV cache 是把历史 token 的 key/value 存下来,后续 token 直接复用,不用每次重算。传统 Transformer 里,这份 cache 既服务当前预测,也服务后续记忆;SPS 则把它拆成“长期保留的输入状态”和“短期存在的预测状态”。说白了,就是把“永久档案”和“临时草稿”分开放,别混在一个文件夹里翻到头秃。
作者还做了两个对照基线来验证“到底是分离有用,还是只是多算了一步有用”。一个叫 2X MEMORY,它保留更多 信息,相当于单纯加缓存;另一个叫 DELAYED STATE,它也多走一步计算,但不真正把状态和预测拆开。结果后面会看到,SPS 不是靠“多塞点算力”蒙出来的,而是靠角色分离本身在起作用。
模型骨架也没有搞得太花:预归一化 Transformer、RMSNorm、SwiGLU、RoPE(Rotary Positional Embeddings,旋转位置编码)、权重共享的输出层,基本都属于当前语言模型的常规配置。也就是说,作者没有靠“换一套更强骨架”来偷分,而是尽量把变量控制住,只改“状态和预测怎么分工”这一件事。
效果炸裂:数据效率翻倍,算力成本几乎不变
这篇论文最有杀伤力的地方,不是“略有提升”,而是几乎全线更好,而且代价并不夸张。作者在 53M 到 1.678B 五个规模上做了预训练,SPS 在每个规模上都拿到了更低的验证损失。更重要的是,它并不是靠多吃很多数据换来的,而是在相同或接近的训练预算下,学得更省。
这里的 NLL 是 Negative Log-Likelihood,中文一般叫负对数似然。它越低,说明模型对真实下一个 token 的预测越自信、越准确。对语言模型来说,这基本就是“考试分数”。
更让人舒服的是,SPS 不是“训练更好但推理更贵”的那种伪升级。作者测了单卡 H100 上的吞吐和峰值显存,发现它的持久 KV cache 基本和标准 Transformer 一样大,推理吞吐也只是在一个很小的范围内波动。换句话说,好处主要吃在训练和泛化上,推理成本没有被大幅抬高。这在工程上很重要,因为很多论文的“提升”最后都死在部署成本上。
更直白一点说,SPS 的成绩像是把“每个 token 都要兼职”的老制度改成了“专人专岗”的新制度:训练时更省数据,泛化时更能打,推理时又没明显加税。对于现在越来越贵的高质量数据和越来越卷的预训练预算,这种改法确实很有现实意义。
深入剖析:为什么分离状态和预测能带来如此大的提升?
这篇论文最值得看的,不只是结果,而是它怎么证明“分离”真的有用。作者没有只甩一个 loss 曲线就完事,而是进一步分析了梯度流向和持久状态的重要性。这一步很关键,因为如果不能解释“为什么”,那就容易沦为一个很会跑分的黑箱。
先看训练阶段。标准 Transformer 里,一个位置的隐藏状态同时接收两类梯度:一类来自当前 token 的下一词预测,另一类来自后面很多位置对它的“回流需求”。这两类梯度都要挤在同一个表示里,模型自然会有点左右互搏。SPS 的设计则把这两类梯度尽量分流:输入流更偏向承载未来损失的状态信息, 流更偏向承担当前预测任务。
再看推理阶段。作者把持久状态限制成一个小窗口,观察损失会掉多少。结果发现,SPS 一旦失去窗口外的持久状态,性能掉得比 DELAYED STATE 更明显,说明它确实学到了更依赖长期记忆的表示,而不是只靠短程局部信息糊弄过去。换句话说,SPS 的输入流不只是“被训练去存”,而是真的把有用信息存住了。
论文里还有一个很聪明的对照:REVERSE SPS,也就是把“谁负责持久、谁负责预测”对调。结果它在某些窗口下还能凑合,但在小窗口时明显更脆。这个对照其实说明了一个很朴素的道理:不是“分离”这两个字本身神奇,而是“把输入状态长期保留、把预测状态短期化”这套分工更合理。
从方法论上看,这篇工作最大的价值不是提出了一个特别复杂的新模块,而是把一个长期存在、但常被默认忽略的矛盾摆到了台面上:一个隐藏状态同时服务“当前预测”和“未来记忆”时,确实会互相打架。SPS 的贡献,就是用非常直接的结构改动,把这种打架尽量变成分工。
当然,这也不是没有代价。SPS 的训练计算更重,因为每个输入都要多走一个预测步骤;虽然推理开销控制得不错,但训练资源更紧张的团队,还是得掂量一下。它目前也主要在单一高质量语料上验证,后续如果换成更杂、更脏、更偏任务混合的数据,收益是否同样稳定,还得继续看。
总结与展望:从“被迫兼职”到“专人专岗”的语言模型新范式
如果只用一句话概括这篇论文,那就是:Transformer 不是不能更强,而是很多时候把“记忆”和“预测”塞进同一份表示里,白白浪费了结构红利。 SPS 的价值,在于它把这个老问题重新定义成一个可以被实验验证、可以被工程实现、也可以被继续扩展的设计方向。
从行业角度看,这种思路很适合当前的大模型现实:高质量数据越来越贵,算力越来越紧,谁能让每个 token 多学一点,谁就更有竞争力。SPS 没有把故事讲成“魔法结构一招制胜”,而是老老实实证明了一件事——更合理的职责划分,本身就是性能来源。这比很多“堆层数、堆宽度、堆花活”的方案更像真的在做模型设计。
不过,SPS 也留下了几个很现实的问题。第一,训练时多出来的预测步骤会不会在更大规模上继续吃掉收益?第二,如果把预测流和状态流进一步做成不同参数,收益会不会更大,还是会把系统复杂度搞炸?第三,在多模态、长上下文、检索增强等场景里,这种“分离”还能不能保持同样的解释力?这些问题都值得继续挖。
这篇论文还有一个很好的地方:它没有停留在“提出想法”,而是把消融、梯度分析、窗口限制、反转结构都做了一遍,尽量把可能的伪相关排掉。对于一篇主张“结构分离”的工作来说,这种证据链是必要的,不然很容易被质疑成“多加一步就赢了”的普通加算力故事。作者这次至少把这条路堵得比较严实。
龙迷三问
这篇论文到底解决了什么问题?它解决的是语言模型里一个很隐蔽但很真实的结构冲突:同一个隐藏状态既要负责当前词的预测,又要负责把状态传给未来 token。SPS 的做法是把这两件事拆开,让输入流负责长期状态,让 流负责下一词预测。
SPS、DELAYED STATE、2X MEMORY 有什么区别?SPS 是真正把“状态”和“预测”分流;DELAYED STATE 只是多加一步计算,但不真正分离职责;2X MEMORY 则是把 也长期保留,相当于单纯加缓存。实验结果表明,真正起作用的是分离,不是单纯加算力或加记忆。
为什么它能提升数据效率?因为模型不用再拿同一份表示同时干两种相互冲突的活。输入流可以更专注地积累长期状态,预测流可以更专注地完成当前输出,梯度也更容易各走各路。结果就是模型更快学会、用更少 token 达到更好的验证损失。
如果你还有哪些想要了解的,欢迎在评论区留言或者讨论~
龙哥点评
论文创新性分数:★★★★☆ 不是凭空造新词,而是把“状态/预测冲突”这个长期存在的问题结构化解决了,思路扎实,改动也干净。
实验合理度:★★★★☆ 预训练规模、消融基线、窗口分析、梯度分析都做了,证据链比较完整,至少没有靠一张曲线讲神话。
学术研究价值:★★★★☆ 这类“结构职责拆分”的想法对语言模型机制研究很有启发,能继续往更大规模和更复杂任务扩展。
稳定性:★★★☆☆ 训练收益清楚,但训练计算增加;推理稳定性不错,不过离“随手上生产”还差一层更大范围验证。
适应性以及泛化能力:★★★★☆ 在多个规模、多个下游任务和分布外语料上都能看到收益,泛化信号是比较强的。
硬件需求及成本:★★★☆☆ 推理成本基本可控,但训练阶段多一步计算,资源紧张时不算轻松。
复现难度:★★★☆☆ 代码已开源是加分项,但涉及定制 attention mask 和高效 kernel,工程复现还是有点门槛。
产品化成熟度:★★★☆☆ 适合做研究型增强和中长期架构尝试,离大规模通用产品落地还需要更多数据和场景验证。
可能的问题:训练开销增加明显,收益主要在预训练阶段;如果未来数据分布变化较大,分离结构是否始终占优,还需要更广泛验证。
主要参考文献
Monea, G., Godey, N., Brantley, K., & Artzi, Y. The State-Prediction Separation Hypothesis. arXiv:2607.01218v1, 2026.
SPS 开源代码:https://github.com/lil-lab/sps
*本文仅代表个人理解及观点,不构成任何论文审核或者项目落地推荐意见,具体以相关组织评审结果为准。欢迎就论文内容交流探讨,理性发言哦~ 想了解更多原文细节的小伙伴,可以点击"阅读原文",查看更多原论文细节哦!

欢迎加入龙哥读论文粉丝群,
扫描下方二维码或者添加龙哥助手微信号加群:kangjinlonghelper。
一定要备注:研究方向+地点+学校/公司+昵称(如 图像处理+上海+清华+龙哥),根据格式备注,可更快被通过且邀请进群。
『龙哥读论文』微信群目前包含:图像处理、大模型及智能体、自动驾驶及机器人、AI医疗及AI金融5个群

