← 返回 PaperDaily 大模型与智能体

Cornell新方法SPS:状态和预测分家更强

Transformer 一直把“记忆”和“预测”塞进同一条链路里,像让一个人一边背台词一边写剧本。康奈尔这篇论文直接把两件事拆开,结果是更低损失、更好泛化,而且推理几乎不涨成本,思路很硬。

Cornell新方法SPS:状态和预测分家更强
🐉 龙哥读论文知识星球来了!
公众号每日8篇拆解不够看?星球无上限更AI领域论文、资讯、招聘、招博、开源代码,一站式干货,每日2分钟刷完即赚!
👇扫码加入「龙哥读论文」知识星球,前沿干货、实用资源一站式拿捏~ xingqiu_header

龙哥推荐理由:
Transformer 一直把“记忆”和“预测”塞进同一条链路里,像让一个人一边背台词一边写剧本。康奈尔这篇论文直接把两件事拆开,结果是更低损失、更好泛化,而且推理几乎不涨成本,思路很硬。


原论文信息如下:
论文标题:
The State-Prediction Separation Hypothesis
发表日期:
2026年07月
发表单位:
Cornell University; Harvard University
原文链接:
https://arxiv.org/pdf/2607.01218v1.pdf
开源代码链接:
https://github.com/lil-lab/sps
项目链接:
https://github.com/lil-lab/sps

一分为二:Transformer的“左右互搏”之痛

Transformer 看起来很强,实际干活时却有点“身兼数职”的尴尬:同一个隐藏状态,既要负责当前这一步该预测什么,又要负责把信息存起来,给后面步骤继续用。这就像让一个人一边背台词,一边当导演,还得顺手记账,能不累吗?
这篇论文抓住的,就是这个看似自然、实则别扭的结构性问题。作者把它概括成一个很直接的判断:“预测”和“状态”这两件事,硬塞进同一条计算链路里,会互相抢资源。 于是,模型虽然还能跑,但不一定跑得最省、最准、最稳。
图1:标准 Transformer 与状态-预测分离 Transformer 的对比
图1:标准 Transformer 与状态-预测分离 Transformer 的对比。上半部分是传统做法:同一份隐藏状态同时承担记忆和预测。下半部分是本文提出的 SPS(State-Prediction Separation,状态-预测分离)结构:输入 token 的状态负责长期记忆, token 负责下一词预测,两条通道各司其职。
这里先把缩写说清楚。SPSState-Prediction Separation,中文就是状态-预测分离。论文的核心不是换一个更花哨的注意力名字,而是非常朴素地问一句:如果把“存状态”和“做预测”拆开,语言模型会不会更会学?

状态-预测分离(SPS)Transformer:为每个角色开辟专属通道

SPS 的做法并不复杂,甚至有点“工程味儿”:它在每个输入 token 后面插入一个额外的 token。这样一来,序列不再是“一个位置干两份活”,而是变成了两个位置分工协作——输入 token 先把状态往前传, token 再专门负责吐出下一词的概率分布。
论文里最关键的一点,是它不是简单“加长上下文”那么粗暴。作者保留了一个持久状态流和一个预测流:前者的 KV cache 会长期保留,后者只在一个小窗口内短暂存在,过了窗口就丢掉。这样,模型既能给当前预测留出专门的“思考位”,又不会把缓存撑得太大。
这里要顺手解释一个工程背景。LLM 推理时,KV cache 是把历史 token 的 key/value 存下来,后续 token 直接复用,不用每次重算。传统 Transformer 里,这份 cache 既服务当前预测,也服务后续记忆;SPS 则把它拆成“长期保留的输入状态”和“短期存在的预测状态”。说白了,就是把“永久档案”和“临时草稿”分开放,别混在一个文件夹里翻到头秃。
作者还做了两个对照基线来验证“到底是分离有用,还是只是多算了一步有用”。一个叫 2X MEMORY,它保留更多 信息,相当于单纯加缓存;另一个叫 DELAYED STATE,它也多走一步计算,但不真正把状态和预测拆开。结果后面会看到,SPS 不是靠“多塞点算力”蒙出来的,而是靠角色分离本身在起作用。
模型骨架也没有搞得太花:预归一化 Transformer、RMSNorm、SwiGLU、RoPE(Rotary Positional Embeddings,旋转位置编码)、权重共享的输出层,基本都属于当前语言模型的常规配置。也就是说,作者没有靠“换一套更强骨架”来偷分,而是尽量把变量控制住,只改“状态和预测怎么分工”这一件事。
图4:不同预测窗口大小下 SPS、DELAYED STATE 与 REVERSE SPS 的表现
图4:不同预测窗口大小下 SPS、DELAYED STATE 与 REVERSE SPS 的表现。结果显示,SPS 在“小但非零”的窗口下最好,而且在每个窗口设置上都优于 REVERSE SPS,说明“预测流”和“状态流”的具体分配方式并不是随便换换都行。

效果炸裂:数据效率翻倍,算力成本几乎不变

这篇论文最有杀伤力的地方,不是“略有提升”,而是几乎全线更好,而且代价并不夸张。作者在 53M 到 1.678B 五个规模上做了预训练,SPS 在每个规模上都拿到了更低的验证损失。更重要的是,它并不是靠多吃很多数据换来的,而是在相同或接近的训练预算下,学得更省。
图2:SPS 在每个规模上都训练更快、损失更低
图2:SPS 在每个规模上都训练更快、损失更低。上图看的是随训练 token 增长的验证负对数似然(NLL),下图看的是随 GPU 小时增长的验证 NLL。两张图都说明同一件事:SPS 更早进入“学会了”的状态,训练曲线压得更低。
这里的 NLLNegative Log-Likelihood,中文一般叫负对数似然。它越低,说明模型对真实下一个 token 的预测越自信、越准确。对语言模型来说,这基本就是“考试分数”。
更让人舒服的是,SPS 不是“训练更好但推理更贵”的那种伪升级。作者测了单卡 H100 上的吞吐和峰值显存,发现它的持久 KV cache 基本和标准 Transformer 一样大,推理吞吐也只是在一个很小的范围内波动。换句话说,好处主要吃在训练和泛化上,推理成本没有被大幅抬高。这在工程上很重要,因为很多论文的“提升”最后都死在部署成本上。
表2:SPS 在主要指标上优于所有基线,同时内存和吞吐接近标准 Transformer
表2:SPS 在主要指标上优于所有基线,同时内存和吞吐接近标准 Transformer。这里能看到几个很关键的事实:一是验证损失稳定下降,二是跨域泛化也在提升,三是推理吞吐没有崩,峰值显存也几乎不变。这样的结果,比单纯“训练分数更低”更像一篇能落地的工作。
表3:四个分布外语料和五个零样本任务的展开结果
表3:四个分布外语料和五个零样本任务的展开结果。作者把综合指标拆开后,能看到 SPS 不只是“在训练集上更会背”,而是对 WikiText、C4、Books3、GovReport 这些分布外语料,以及 ARC-Easy、HellaSwag、PIQA、SciQ、LAMBADA 这些零样本任务,都有一致收益。平均下来,零样本准确率大约提升 2 到 3 个百分点,这个幅度在大模型预训练里已经不算小打小闹了。
图3:SPS 在下游任务上的一致增益
图3:SPS 在下游任务上的一致增益。随着模型规模变大,收益没有消失,反而更稳定。这个现象挺有意思:很多结构改动在小模型上看起来有效,规模一大就露馅;SPS 这次反而越往大走越稳,说明它碰到的是比较底层的结构矛盾,而不是某个小技巧的偶然红利。
更直白一点说,SPS 的成绩像是把“每个 token 都要兼职”的老制度改成了“专人专岗”的新制度:训练时更省数据,泛化时更能打,推理时又没明显加税。对于现在越来越贵的高质量数据和越来越卷的预训练预算,这种改法确实很有现实意义。

深入剖析:为什么分离状态和预测能带来如此大的提升?

这篇论文最值得看的,不只是结果,而是它怎么证明“分离”真的有用。作者没有只甩一个 loss 曲线就完事,而是进一步分析了梯度流向持久状态的重要性。这一步很关键,因为如果不能解释“为什么”,那就容易沦为一个很会跑分的黑箱。
先看训练阶段。标准 Transformer 里,一个位置的隐藏状态同时接收两类梯度:一类来自当前 token 的下一词预测,另一类来自后面很多位置对它的“回流需求”。这两类梯度都要挤在同一个表示里,模型自然会有点左右互搏。SPS 的设计则把这两类梯度尽量分流:输入流更偏向承载未来损失的状态信息, 流更偏向承担当前预测任务。
图5(a):不同位置上未来损失梯度在各流中的分布
图5(a):不同位置上未来损失梯度在各流中的分布。图里能看出,SPS 的输入流持续承接更多来自未来位置的梯度,而预测流则更“专注眼前”。这说明它不是把同一份表示硬掰成两半,而是真正让梯度根据功能进入不同通道。
再看推理阶段。作者把持久状态限制成一个小窗口,观察损失会掉多少。结果发现,SPS 一旦失去窗口外的持久状态,性能掉得比 DELAYED STATE 更明显,说明它确实学到了更依赖长期记忆的表示,而不是只靠短程局部信息糊弄过去。换句话说,SPS 的输入流不只是“被训练去存”,而是真的把有用信息存住了。
图5(b):限制持久状态窗口后,不同方法的损失退化
图5(b):限制持久状态窗口后,不同方法的损失退化。SPS 的曲线整体更高,说明它对窗口外状态更敏感,也就是更依赖真正的长期记忆。这个结果很有说服力,因为它把“训练时梯度分流”和“推理时确实用上了长期状态”连成了一条闭环。
论文里还有一个很聪明的对照:REVERSE SPS,也就是把“谁负责持久、谁负责预测”对调。结果它在某些窗口下还能凑合,但在小窗口时明显更脆。这个对照其实说明了一个很朴素的道理:不是“分离”这两个字本身神奇,而是“把输入状态长期保留、把预测状态短期化”这套分工更合理。
从方法论上看,这篇工作最大的价值不是提出了一个特别复杂的新模块,而是把一个长期存在、但常被默认忽略的矛盾摆到了台面上:一个隐藏状态同时服务“当前预测”和“未来记忆”时,确实会互相打架。SPS 的贡献,就是用非常直接的结构改动,把这种打架尽量变成分工。
当然,这也不是没有代价。SPS 的训练计算更重,因为每个输入都要多走一个预测步骤;虽然推理开销控制得不错,但训练资源更紧张的团队,还是得掂量一下。它目前也主要在单一高质量语料上验证,后续如果换成更杂、更脏、更偏任务混合的数据,收益是否同样稳定,还得继续看。

总结与展望:从“被迫兼职”到“专人专岗”的语言模型新范式

如果只用一句话概括这篇论文,那就是:Transformer 不是不能更强,而是很多时候把“记忆”和“预测”塞进同一份表示里,白白浪费了结构红利。 SPS 的价值,在于它把这个老问题重新定义成一个可以被实验验证、可以被工程实现、也可以被继续扩展的设计方向。
从行业角度看,这种思路很适合当前的大模型现实:高质量数据越来越贵,算力越来越紧,谁能让每个 token 多学一点,谁就更有竞争力。SPS 没有把故事讲成“魔法结构一招制胜”,而是老老实实证明了一件事——更合理的职责划分,本身就是性能来源。这比很多“堆层数、堆宽度、堆花活”的方案更像真的在做模型设计。
不过,SPS 也留下了几个很现实的问题。第一,训练时多出来的预测步骤会不会在更大规模上继续吃掉收益?第二,如果把预测流和状态流进一步做成不同参数,收益会不会更大,还是会把系统复杂度搞炸?第三,在多模态、长上下文、检索增强等场景里,这种“分离”还能不能保持同样的解释力?这些问题都值得继续挖。
这篇论文还有一个很好的地方:它没有停留在“提出想法”,而是把消融、梯度分析、窗口限制、反转结构都做了一遍,尽量把可能的伪相关排掉。对于一篇主张“结构分离”的工作来说,这种证据链是必要的,不然很容易被质疑成“多加一步就赢了”的普通加算力故事。作者这次至少把这条路堵得比较严实。

龙迷三问

下面是龙哥对于大家可能的一些问题的解答:

这篇论文到底解决了什么问题?它解决的是语言模型里一个很隐蔽但很真实的结构冲突:同一个隐藏状态既要负责当前词的预测,又要负责把状态传给未来 token。SPS 的做法是把这两件事拆开,让输入流负责长期状态,让 流负责下一词预测。

SPS、DELAYED STATE、2X MEMORY 有什么区别?SPS 是真正把“状态”和“预测”分流;DELAYED STATE 只是多加一步计算,但不真正分离职责;2X MEMORY 则是把 也长期保留,相当于单纯加缓存。实验结果表明,真正起作用的是分离,不是单纯加算力或加记忆。

为什么它能提升数据效率?因为模型不用再拿同一份表示同时干两种相互冲突的活。输入流可以更专注地积累长期状态,预测流可以更专注地完成当前输出,梯度也更容易各走各路。结果就是模型更快学会、用更少 token 达到更好的验证损失。

如果你还有哪些想要了解的,欢迎在评论区留言或者讨论~

龙哥点评

论文创新性分数:★★★★☆ 不是凭空造新词,而是把“状态/预测冲突”这个长期存在的问题结构化解决了,思路扎实,改动也干净。

实验合理度:★★★★☆ 预训练规模、消融基线、窗口分析、梯度分析都做了,证据链比较完整,至少没有靠一张曲线讲神话。

学术研究价值:★★★★☆ 这类“结构职责拆分”的想法对语言模型机制研究很有启发,能继续往更大规模和更复杂任务扩展。

稳定性:★★★☆☆ 训练收益清楚,但训练计算增加;推理稳定性不错,不过离“随手上生产”还差一层更大范围验证。

适应性以及泛化能力:★★★★☆ 在多个规模、多个下游任务和分布外语料上都能看到收益,泛化信号是比较强的。

硬件需求及成本:★★★☆☆ 推理成本基本可控,但训练阶段多一步计算,资源紧张时不算轻松。

复现难度:★★★☆☆ 代码已开源是加分项,但涉及定制 attention mask 和高效 kernel,工程复现还是有点门槛。

产品化成熟度:★★★☆☆ 适合做研究型增强和中长期架构尝试,离大规模通用产品落地还需要更多数据和场景验证。

可能的问题:训练开销增加明显,收益主要在预训练阶段;如果未来数据分布变化较大,分离结构是否始终占优,还需要更广泛验证。


主要参考文献

Monea, G., Godey, N., Brantley, K., & Artzi, Y. The State-Prediction Separation Hypothesis. arXiv:2607.01218v1, 2026.
SPS 开源代码:https://github.com/lil-lab/sps

*本文仅代表个人理解及观点,不构成任何论文审核或者项目落地推荐意见,具体以相关组织评审结果为准。欢迎就论文内容交流探讨,理性发言哦~ 想了解更多原文细节的小伙伴,可以点击"阅读原文",查看更多原论文细节哦!       

end
欢迎加入龙哥读论文粉丝群,扫描下方二维码或者添加龙哥助手微信号加群:kangjinlonghelper。一定要备注:研究方向+地点+学校/公司+昵称(如 图像处理+上海+清华+龙哥),根据格式备注,可更快被通过且邀请进群。
『龙哥读论文』微信群目前包含:图像处理、大模型及智能体、自动驾驶及机器人、AI医疗及AI金融5个群
wechat_helperdianzan
转发文章 微博 X LinkedIn Facebook
龙哥读论文 · PaperDaily

本文基于龙哥读论文 PaperDaily 数据库整理,结合论文原文与工程视角进行解读。