← 返回 PaperDaily 大模型与智能体

华盛顿大学大模型偏好后训练:输出Token最多减少39.84%

论文方法: 长度优化低秩后训练方法(LOCUS) 原文标题: LOCUS: Task-​Aware Low-​Rank Post-​Training for Token-​Efficient Language Generation 第一署名单位: 华盛顿大学 具体领域: 大模型偏好后训练 首次公开: 2026年9月10日(arXiv v1) 原论文: htt

论文方法:长度优化低秩后训练方法(LOCUS)

原文标题:LOCUS: Task-​Aware Low-​Rank Post-​Training for Token-​Efficient Language Generation

第一署名单位:华盛顿大学

具体领域:大模型偏好后训练

首次公开:2026年9月10日(arXiv v1)

原论文:https://arxiv.org/abs/2609.11739

龙哥导读

大模型每多说一个Token,在线服务就多走一次自回归解码,也多占一份键值缓存。可偏好对齐常把“更长”误当成“更好”,于是模型学会了把一句话铺成三段。华盛顿大学提出的LOCUS不改偏好损失,而是把低秩适配器的秩、位置、层范围和训练步数变成可搜索变量:先守住内部偏好准确率,再挑输出最短的更新子空间。在论文最强的一组实验里,平均续写Token减少39.84%,内部偏好准确率没有变化;代价是需要为任务训练并筛选一批候选适配器。

真正值得问的问题不是“模型能不能被提示得简短一点”,而是:能不能在不重写偏好目标、不额外塞长度惩罚的情况下,让后训练本身落到一个更省Token的参数解上?这件事一旦成立,优化对象就从文案风格变成了部署成本。客服、搜索问答、代码助手和智能体每天生成海量文本,平均每次少几十个Token,乘上请求量之后就是可见的时延、吞吐和账单差异。

LOCUS给出的答案很克制:它没有声称找到了“简洁表达”的通用开关,也没有证明用户满意度必然不降。它证明的是,在两种约30亿参数的解码器模型、几类偏好目标和固定评估协议下,更新哪个低秩子空间,会显著改变生成长度;而这种变化不需要修改原来的偏好损失。这比单纯说“低秩微调更省参数”多走了一步:低秩结构不只是压缩工具,也成为质量—长度权衡的设计变量。

论文图1。上半部分比较采样偏好优化(SamPO)、直接偏好优化(DPO)和分布鲁棒直接偏好优化(DrDPO)的平均续写Token;下半部分是内部偏好准确率。三组Token分别减少39.84%、20.73%和25.29%,对应准确率变化为0.00、−0.01和−0.13个百分点。

先看这张总览图。绿色柱子代表低秩子空间方案,灰色柱子代表全参数分支或已发布检查点。最醒目的39.84%来自SamPO检查点上的继续适配:平均续写从132.77降到79.88个Token,内部偏好准确率保持53.52%。另外两组是更严格的同起点对照:直接偏好优化从137.67降到109.12,分布鲁棒版本从145.61降到108.79。

这里的“准确率”不是人工盲评或用户满意度,而是比较模型给优选与劣选回答的序列概率。它适合做稳定的内部诊断,但不能把“变化不超过0.13个百分点”直接翻译成“真实回答质量完全不变”。

一、偏好对齐为什么容易把模型训练得越来越啰嗦

偏好后训练通常拿到成对数据:同一个问题对应一个更受偏好的回答和一个较差回答。直接偏好优化(DPO)不再单独训练奖励模型,而是直接提高优选回答相对劣选回答的概率,同时用参考模型约束更新幅度。它的工程优点是流程短、实现清晰,因此成了常见的对齐方法。

问题在于,偏好数据里经常藏着长度相关性。更完整、更礼貌、更有解释的答案往往也更长;标注者可能在没有明确意识到时,把长度当作质量的替代信号。模型一旦抓住这条捷径,就会学到“多写通常更安全”。于是偏好分上去了,真正的信息密度却未必同步上升。

输出变长不是只影响阅读体验。自回归模型每生成一个新Token,都要再执行一次前向计算;同时,前文的键和值需要留在缓存里供后续注意力使用。回答越长,单请求完成时间越长,显存驻留越久,并发请求越容易互相挤压。对按Token计费的接口,成本更是直接写在账单上。

既有路线大致有三类。第一类在训练目标中加入长度惩罚,明确告诉模型“写太长要扣分”;第二类把长度从偏好信号里拆出来,例如长度去偏直接偏好优化(常写作LD-DPOLR-DPO);第三类像采样偏好优化(SamPO)那样,对优选和劣选序列的Token贡献做更平衡的采样或归一化。它们都在处理长度偏差,但会改变损失计算或训练配方。

LOCUS选择了另一条路:损失函数原样保留,只改变允许参数往哪里走。可以把全参数更新想成在一座巨大城市里自由找房,能走的街区很多;低秩适配则只开放少数街区。不同街区即使使用同一套评分规则,最后找到的房子也可能面积、价格和通勤距离完全不同。论文要验证的,就是某些低秩街区是否天然更容易落到“短而不明显损失偏好诊断”的解。

二、LoRA不只是省参数:它变成了可搜索的行为子空间

低秩适配(LoRA)的基本做法,是冻结原权重矩阵W₀,不直接改动其中每个元素,而是训练两个更窄的矩阵A与B,用它们的乘积表示增量。秩r越小,可训练自由度越少。传统用法关心“能不能用更少显存接近全量微调”;LOCUS更关心“不同自由度和放置位置,会把生成长度带到哪里”。

低秩更新的核心形式

W = W0 + ΔW = W0 + (α / r) · BA

W₀是冻结的原始权重,A和B是训练的小矩阵,r是低秩维度,α控制缩放。训练只更新A和B。这个公式限定了更新能经过的子空间,但它本身不保证回答变短;长度变化仍由偏好数据、目标函数、适配器位置和优化过程共同决定。

论文把一个候选配置写成五元组:秩r、缩放α、目标模块集合、目标层范围和训练检查点s。目标模块可以是查询、键、值、注意力输出或前馈网络中的线性层;层范围决定把适配器放到哪些层;检查点则把训练进行到第250、500或750步等状态也纳入选择。

LOCUS明确建立候选网格,把长度作为开发集选择指标。同样是低秩适配,秩太小可能让输出反而变长,放错模块也可能用更多参数却没有更好收益。真正的方法是在保持效用约束的前提下搜索子空间,而不是把任意一个LoRA结果包装成成功。

论文图2。第一阶段冻结骨干并使用原生偏好损失训练候选低秩适配器;第二阶段在选择集上筛出满足效用约束且最短的候选,并在有条件时用独立确认集复核;第三阶段把选中的低秩增量保留为任务适配器,或在单任务部署前合并进线性层。

图2从上到下有三层。最上层强调“目标不变”:无论底层使用直接偏好优化、分布鲁棒直接偏好优化还是SamPO,LOCUS都不加新的Token罚项。中间层才是核心:候选配置在选择集上同时测平均续写长度与内部偏好准确率,只保留效用达标者。最下层是部署形式:单任务可以合并权重,多任务可以共享冻结骨干并切换适配器。

图里“约99.72%—99.76%冻结”对应两个骨干。Pythia-2.8B的适配器约786万个参数,占模型0.2826%;Qwen2.5-3B的适配器约737万个参数,占3.09B参数的0.2383%。这些数字说明优化器需要维护的参数与状态大幅减少,但论文也明确提醒:冻结骨干仍要做前向计算和激活反向传播,不能仅凭可训练参数比例推断训练总显存、训练速度或总算力也按同样比例下降。

三、约束目标:不是追求最短,而是在合格答案里找最短

如果只把平均Token最小化,最简单的解就是马上输出结束符。这显然毫无价值。因此LOCUS先定义任务效用Q:对每个偏好样本,比较模型给优选回答和劣选回答的序列概率,判断优选回答是否得分更高,再在数据集上取平均准确率。

内部偏好效用

Qt(c) = (1 / |Dt|) · Σ I[πc(yw|x) > πc(yl|x)]

t表示任务,c表示候选子空间,x是提示,y_w与y_l分别是优选和劣选回答。指示函数I在优选回答概率更高时记1。这个指标回答的是“模型内部仍偏向哪一个”,不直接评价新生成文本是否更有帮助、更真实或更让用户满意。

然后才进入约束选择。设T是候选模型在贪心解码下的平均续写Token,Q_base是对应全参数基线或发布基线的偏好准确率,ε是允许的下降。论文把ε设为1个百分点:候选准确率不得低于基线减1个百分点;在所有合格候选中,再选平均输出最短的那个。

任务感知的受约束选择

c* = arg min Tt(c),满足 Qt(c) ≥ Qtbase − εt

这不是把长度和质量揉成一个随意加权的总分,而是先设质量底线,再优化成本。ε越小,保护越严格但可选空间越窄;ε越大,可能获得更短输出,也更容易牺牲内部偏好诊断。本文固定为1个百分点。

这种写法比“长度损失加λ倍质量损失”更容易解释。团队可以先确定业务能接受的质量回归门槛,再让搜索寻找成本最低点。但它也把难题转移到了效用指标:如果Q没有覆盖事实正确性、拒答安全、风格一致和用户满意度,那么约束再严格,也只能守住Q所看见的那一部分质量。

四、训练、选择、确认和测试,为什么必须分开

LOCUS的算法流程看起来像一次小型模型选型。先用训练集分别训练候选适配器;再在选择集上测长度与偏好效用,剔除超出1个百分点容忍范围的候选;从剩余候选里挑最短者。若任务提供独立确认集,还要再过一道门:确认集上既要比基线短,也要继续满足效用约束,否则回退到基线。

最后才到冻结测试集。这种拆分是论文可信度的重要部分,因为候选网格本身会对开发集过拟合。若在同一批样本上反复尝试秩、模块和训练步数,再直接汇报其中最漂亮的结果,读者无法判断收益来自方法还是挑数。选择集负责“挑”,确认集负责“复核”,测试集负责最终报告,角色不能混。

在Pythia的直接偏好优化分支中,论文用160,544对训练样本,从同一个全参数监督微调检查点出发,对照全参数更新与低秩更新;最终在8,552对冻结测试样本上评估。分布鲁棒分支还使用彼此分离的256样本选择集和256样本确认集。Qwen分支从160,288对训练样本出发,同样保留两份各256对的选择与确认数据,然后进入8,552对测试。

SamPO对照要单独看。它不是与全参数分支从同一个监督微调起点重新训练,而是从官方发布的Pythia-2.8B检查点继续做低秩适配,并在既定256样本评估集上比较。因此39.84%是论文最强的长度数字,但它的对照协议与DPODrDPO同起点实验不同。标题可以使用这个最大值,却不能暗示五组实验都减少了近四成。

论文图3和图4。左图展示不同训练检查点在开发集上的长度变化及最终选择;右图给出8,552个测试提示的续写长度累计分布。DPODrDPO下,中位数都降至52个Token,但长尾与长度上限命中仍需结合完整分布理解。

左侧曲线说明训练并非越久越好。右侧累计分布则显示,直接偏好优化的中位续写从100降到52,分布鲁棒版本从125降到52;触及最大长度上限的样本比例分别下降24.70%和30.98%。

这意味着收益不是只靠少数极端长回答拉低平均数,整体分布确实左移。但图也不能回答“被删掉的是什么”。它可能删掉重复解释、礼貌铺垫和模板化总结,也可能删掉某些任务需要的推理步骤。论文没有逐条人工标注删减内容,因此部署前仍需要领域评测与人工抽检。

五、主结果:五组对照分别证明了什么

Pythia-2.8B上的直接偏好优化是最干净的同起点对照之一。全参数分支平均137.67个Token,LOCUS为109.12,减少20.73%;内部偏好准确率从48.40%变为48.39%,变化−0.01个百分点。分布鲁棒版本从145.61降到108.79,减少25.29%;准确率从48.39%到48.26%,变化−0.13个百分点。

Qwen2.5-3B用于检查结果是否只属于一种模型架构。直接偏好优化从108.26降到92.16,减少14.87%,准确率变化−0.05个百分点;分布鲁棒版本从111.58降到91.97,减少17.58%,准确率变化−0.09个百分点。两个结果仍满足预设的1个百分点效用容忍条件。

论文图8。四个协议匹配对照均显示平均续写Token下降,内部偏好准确率变化介于−0.01至−0.13个百分点。Pythia更新约0.28%参数,Qwen2.5更新约0.24%参数;这些比例是可训练参数占比,不是端到端算力节省比例。

跨骨干结果的价值在于方向一致:同一个“目标不变、子空间选择”思路,在Pythia和采用分组查询注意力的Qwen架构上都有效。它降低了单一模型偶然性的风险,但样本仍只有两个约3B模型,距离通用结论还很远。

两个跨任务开发集实验也出现更短输出:安全拒答数据减少25.29%,Orca指令数据减少79.97%。但两者都只有256样本开发评估,不是独立冻结测试,因此只适合视为探索证据,不应升级为标题主结论。

六、消融告诉我们:低秩不是越低越好,范围也不是越大越好

秩消融是整篇最能防止误读的一组实验。在固定目标模块、层覆盖、缩放比例、数据和训练预算后,论文测试r=4、8、16、32。r=4不但没有缩短回答,反而让Token增加11.74%;r=8只减少2.32%;r=16减少15.95%;r=32减少25.10%。

论文图5。秩从4增加到32时,长度效果从增加11.74%转为减少25.10%;内部偏好准确率在r=4、8、16时均为45.31%,r=32升至46.88%。结果说明“参数越少越短”并不成立,必须实际搜索。

这个结果把方法的核心说得很清楚:LOCUS不是靠容量不足把模型“饿”得说不出话。若只是容量越小越容易短,r=4应该最短,但实验恰好相反。更合理的解释是,不同低秩参数化改变了优化可达的轨迹,某些子空间让偏好学习落到更紧凑的生成行为,某些子空间却不会。

模块位置消融同样反直觉。只适配查询—键—值投影减少8.09%,只适配注意力输出减少4.96%,合并适配全部注意力投影达到15.95%;只适配前馈网络减少5.75%。把所有线性层都适配后,参数从786万增加到2097万,是注意力方案的约2.7倍,Token却只减少13.88%,反而不如更小的注意力子空间。

论文图6。左侧比较Token减少比例,右侧比较可训练参数。全部线性层使用约2097万参数,却没有超过约786万参数的Attention-All配置;更大的适配范围不自动带来更好的长度—效用工作点。

这组消融对工程团队很有启发。参数高效微调常用一套固定经验配方,例如统一取某个秩、默认覆盖查询和值投影;LOCUS说明,若目标里包含输出成本,就不能只按训练损失或参数数量选配置。候选规模、模块位置和训练检查点都可能改变线上行为,应该进入回归矩阵。

七、和DPO、长度去偏DPOSamPO相比,它到底新在哪里

直接偏好优化解决的是“怎样不用显式奖励模型完成偏好学习”。它把优选与劣选回答的相对概率写进一个简洁目标,但不会自动消除数据中的长度捷径。LOCUS不替代这个目标,而是把它装进受约束的低秩搜索流程:同一损失、同一数据、同一起点,只改变全参数还是低秩子空间。

长度去偏DPO的代表思路,是估计长度对偏好得分的影响,再调整奖励或概率比较,让模型不再单纯因为答案更长就给出更高分。优势是直接瞄准偏差来源;代价是需要选择去偏形式与强度,而且目标已经不再是原始DPO。LOCUS把“是否保留原损失”作为第一原则,因而更像参数化层面的控制。

SamPO通过对长短回答的Token贡献做采样平衡,减少长度差异对散度项和优化信号的支配。它本身已经针对长度偏差设计。LOCUS在已发布SamPO检查点上继续使用原生SamPO目标训练低秩适配器,仍把平均续写从132.77降到79.88。这说明“修损失”和“选子空间”可能不是互斥路线,而是可叠加的两个层次。

分布鲁棒直接偏好优化关注参考分布偏移与样本层面的鲁棒性,不是专门为简洁生成设计。LOCUS在这一目标上也获得25.29%与17.58%的两模型降幅,说明方法并不依赖某一个长度修正目标。更准确的定位是:它为现有偏好目标增加了一个部署导向的模型选择层,而不是发明了新的偏好损失。

当然,这种优势也伴随额外成本。长度去偏方法通常围绕一个训练配方调参;LOCUS要训练多个适配器候选,并对每个候选做生成评估和偏好效用评估。单个候选只更新不到0.3%参数,但候选网格累积起来并非免费。论文没有报告完整搜索墙钟时间、总GPU小时或与一次全参数训练的总能耗比较。

八、计算与部署边界:哪些成本真的省了,哪些还没有证据

训练侧可以确认的是,可训练参数和优化器状态显著减少。对于一个d₁×d₂线性层,全参数微调暴露d₁d₂个训练变量;低秩形式暴露r(d₁+d₂)个因子参数。当r远小于矩阵维度时,这个数量差距很大。以2560×2560、r=16为例,是81,920个因子参数对6,553,600个全量参数。

可训练参数数量

NLoRA = r(d1 + d2),当 NLoRA < d1d2 时更省参数

这个等式只计算优化器直接维护的A、B因子条目。它不等于低秩更新矩阵的独立几何维度,也不包含冻结骨干的权重读取、前向计算、激活和数据管线。因此“更新0.24%参数”不能改写成“训练成本只剩0.24%”。

推理侧有两种部署方式。单任务服务可以把训练后的BA增量预先加回原线性层,推理图里不再保留单独的适配器分支。论文证明在关闭适配器随机失活、使用相同数值运算语义时,合并前后的线性层输出代数等价。此时不会因为额外适配器分支增加每步计算。

多租户服务若让一个骨干动态挂载多个任务适配器,就要保留适配器管理、显存和额外矩阵乘法。论文没有基准测试这部分开销。量化部署或不同浮点运算顺序也可能带来细小数值差异。更重要的是,论文只测了输出Token,没有测端到端首Token时延、每秒Token、批处理吞吐、峰值显存或真实云成本。

因此可以说“更短输出有望减少解码工作量和键值缓存驻留”,也可以说“合并适配器后不增加独立分支”;但不能说论文已经证明线上吞吐提升39.84%。百分比对应平均续写Token,不是吞吐率。系统收益还取决于输入长度、并发调度、批处理、模型带宽瓶颈、停止条件和服务框架。

九、论文没有解决的四个问题

第一,规模边界。实验只覆盖Pythia-2.8B与Qwen2.5-3B。更大的模型可能拥有不同的冗余、指令遵循和长度偏差,也可能对低秩位置更敏感。没有证据说明同一候选网格能直接迁移到70B级模型。

第二,解码边界。主实验使用贪心解码。真实产品常用温度采样、核采样、重复惩罚或推理预算控制;随机解码会改变长度分布,也可能改变优选—劣选概率与实际生成质量之间的对应关系。

第三,质量边界。内部偏好准确率便于协议匹配,却没有覆盖事实正确性、任务完成率、复杂推理完整度、安全拒答细粒度、人类满意度和风格稳定性。尤其当答案从176个Token降到35个Token时,必须逐任务检查它是在删冗余,还是把必要步骤也一起删了。

第四,搜索与泛化边界。候选池只有四个离散秩和较粗的模块分组;每个任务训练自己的适配器。论文没有证明在一个任务选出的子空间能让未见任务稳定变短,也没有比较连续秩分配、逐层搜索、梯度引导剪枝与更强的多目标优化。

官方arXiv页面与全文没有提供代码仓库、模型权重或项目页。能够复核的是论文公式、数据拆分、表格和官方图;训练搜索与生成结果无法低成本独立复现。准备采用该方法的团队,应在自家业务数据上建立长度、人工质量与线上时延三条共同基线。

十、龙哥点评:把输出长度从文风问题升级为系统指标

龙哥觉得,这篇论文最有价值的地方不是“LoRA又赢了一次”,而是提醒大家:后训练的参数化方式本身,也会塑造模型行为。过去团队选择低秩适配器,常只看训练显存、收敛损失和任务分;LOCUS把平均输出Token放进受约束选型,让成本第一次成为候选淘汰条件。

这个思路很适合在线产品,但简洁不等于越短越好。医疗解释、法律分析、代码审查和安全拒答本来就需要细节;若只守内部偏好准确率,模型可能用更短的模板绕过内容。产品团队应把“短”定义成去掉重复,而不是删除依据、限制和行动步骤。

工程上,LOCUS更像一套后训练验收方法,而不只是一个适配器技巧:给每个候选同时画出质量与Token成本,先设业务底线,再选成本点;确认集不过就回退;上线后继续看真实用户任务、延迟和投诉。真正可持续的降本,不是让模型闭嘴,而是让每个Token都更有用。

龙迷三问

一问:为什么不直接在提示词里写“请简洁回答”?提示词成本最低,但依赖模型遵循,遇到分布变化、复杂任务或多轮上下文时未必稳定,还会占用输入Token。LOCUS把倾向写进任务适配后的参数解,目标是让默认行为更短;两者也可以联合使用,但要分别评估。

二问:更新不到0.3%参数,是否意味着普通显卡也能轻松训练?不能这样推。优化器状态确实更小,但冻结的30亿参数骨干仍参与前向与反向传播,序列长度、批大小和激活保存仍决定显存。论文使用一张80GB A100,并没有给出消费级显卡复现结论。

三问:39.84%能直接换算成39.84%的费用或时延下降吗?不能。它是特定SamPO分支、特定数据和贪心解码下的平均续写Token降幅。若输出Token在账单中占主导,费用会接近按比例下降;但端到端时延还包含排队、预填充、调度和网络,吞吐还受批处理与显存带宽影响。

总结

LOCUS把一个看似简单的问题做成了严谨的受约束选择:保留原生偏好目标,冻结骨干,在秩、缩放、模块、层和检查点构成的候选空间里,先筛掉效用不达标者,再选平均续写最短的适配器,并尽可能用独立确认集阻止挑数。

主结果表明,在两个约3B骨干上,协议匹配的DPODrDPO分支减少14.87%—25.29%平均续写Token,内部偏好准确率变化不超过0.13个百分点;在发布的SamPO检查点上继续适配,最大降幅为39.84%,准确率变化0.00个百分点。适配器只更新约0.24%—0.28%参数。

这些证据足以说明“子空间会影响长度”,也足以让推理成本敏感的团队认真测试;但还不足以证明大模型、采样解码和真实线上满意度都能复制同样收益。最稳妥的结论是:偏好后训练不必只在损失函数上做文章,参数更新空间本身也是一根可以调节成本与行为的杠杆。

原论文:https://arxiv.org/abs/2609.11739

官方HTML全文:https://arxiv.org/html/2609.11739v1

官方PDFhttps://arxiv.org/pdf/2609.11739v1.pdf

文中技术图均来自论文官方arXiv HTML/PDF,图注依据原文重述。

本文基于龙哥读论文PaperDaily数据库及PaperMinerMCP进行汇总整理。

本文仅代表对论文的技术解读,不构成对模型质量、服务成本或商业部署效果的保证;完整实验条件与限定请以原论文为准。

转发文章 微博 X LinkedIn Facebook
龙哥读论文 · PaperDaily

本文基于龙哥读论文 PaperDaily 数据库整理,结合论文原文与工程视角进行解读。

LONGGE AI COMMUNITY

把每天读到的论文,变成长期积累

加入「龙哥读论文」知识星球,持续获取 AI 论文、资讯、开源项目、招聘与研究思路。

加入龙哥读论文微信群:添加微信 kangjinlonghelper,备注“研究方向 + 地点 + 学校/公司 + 昵称”。

龙哥读论文知识星球二维码 微信扫码加入知识星球