← 返回 PaperDaily 大模型与智能体

告别一步梯度短视!中科大让LoRA全面反超只需多走64步

微调大模型,LoRA 省显存但总差口气?中科大新方法 LoRA-GA² 表示:只盯一步梯度确实容易“短视”,多走几步、看看真实的微调轨迹,GLUE 直接反超全量微调,显存还一分不多花。

告别一步梯度短视!中科大让LoRA全面反超只需多走64步
原论文信息如下:
论文标题:
LoRA-GA²: Low Rank Adaptation with Multi-step Gradient Adaptive Alignment
发表日期: 2026年8月
发表单位: 中国科学技术大学(第一作者单位)
原文链接: https://arxiv.org/pdf/2608.19800v1.pdf

大模型微调,让人又爱又恨。全量微调显存占用太高,于是 LoRA 这类参数高效微调方法成了救命稻草。但 LoRA 有个老毛病:跟全量微调比,性能总是差那么一截。过去三年,各路学者想了各种办法,有搞自适应剪枝的 AdaLoRA,有搞非对称学习率的 LoRA+,还有一批走「梯度对齐」路线的,比如 LoRA-GA、GoRA、RaLoRA。这些方法有一个共同点:它们都站在预训练权重的初始点上,看一眼这一时刻的梯度,然后用这个「一步梯度」的信息去初始化低秩矩阵或者分配秩。

问题来了:一步梯度真的够吗?

这就像你第一次走进一家新公司,只根据工位上看到的第一眼印象,就决定未来三年怎么发展。真正的微调过程是一个动态轨迹,权重在一步一步地移动,梯度方向也在不断变化。只看起点那一刻的梯度,本质上是一种「短视」。可如果像 LoRA-Pro 那样每一步都去对齐低秩更新和全量更新,又得改优化器、加显存、拖慢训练,工业界根本受不了。

那有没有办法,既不增加显存,又能拿到多步梯度信息?中科大的这篇新论文 LoRA-GA² 给出了一个很聪明的答案。

为什么 LoRA 会「差口气」?先理解梯度压缩视角

要理解 LoRA-GA² 的做法,得先换一个视角看 LoRA。论文里提出了一个更犀利的观点:LoRA 本质上是一个梯度压缩器。

什么意思?在标准的 LoRA 训练中,如果固定 A 矩阵、只训练 B 矩阵,那么 T 步之后的有效更新可以写成:

ΔW_T ≈ -η(α/r)² Σ_{t=1}^{T} G_t A₀ᵀ A₀

这个公式说明,LoRA 的每次更新,其实都是把全量梯度 G_t 通过一个固定的压缩算子 A₀ᵀA₀ 投影到低秩子空间里。也就是说,低秩适配器能学多好,完全取决于这个初始子空间能不能保留住全量微调过程中真正重要的更新方向。

这就暴露了两个误差来源。第一,适配器的子空间应该对齐全量微调过程中持续出现的梯度方向,而不只是初始点那一步的梯度方向。第二,每一层该分配多少秩,应该取决于这一层梯度能量的分布——如果某一层的梯度奇异值衰减很快,能量集中在前几个方向上,给小秩就够了;如果能量分散在很多方向上,就得给大一点的秩。

LoRA-GA² 的思路,就是同时盯住这两个误差源:用多步轨迹梯度来估计真正的更新方向,再用这个梯度的谱结构来指导秩分配和初始化。

核心思路:用一个「轻量探针」偷看未来几步

LoRA-GA² 的关键创新,在于它引入了一个非常轻量的「轨迹感知梯度探针」。这个探针的做法是:先用 AdaLomo 优化器在预训练权重上真正地跑 N 步(论文默认 64 步),每一步都把梯度累积下来,同时用 AdaLomo 的内存高效更新规则去更新权重,模拟一小段真实的微调轨迹。

跑完这 64 步之后,把预训练权重恢复原样,然后用这段累积下来的多步梯度去做两件事:谱感知的秩分配,以及 SVD 初始化。

这里有几个细节值得注意。第一,累积梯度的公式是 G_avg = (1/N) Σ ∂L_i/∂W^(i),注意每一步梯度都是在不同的权重位置 W^(i) 上算的,而不是像 LoRA-GA 那样所有梯度都算在初始权重 W₀ 上。第二,整个探针过程不需要额外的 GPU 显存——梯度是在 CPU 上累积的,权重更新用的是 AdaLomo 的融合反向核,探针结束后权重直接恢复,不留任何永久性修改。第三,探针阶段产生的梯度只用于秩分配和初始化,正式训练还是用标准的 Adam 优化器,完全兼容现有训练流程。

下面这张图是 LoRA-GA² 的整体框架,可以清晰地看到四阶段流程:探针收集轨迹梯度、计算重要性分数、做秩分配、最后用 SVD 初始化低秩矩阵,然后才进入标准的 LoRA 训练。

LoRA-GA2框架图
图1:LoRA-GA² 整体框架。临时多步探针收集轨迹梯度,恢复预训练权重,利用累积信号做秩分配和 SVD 初始化,再进行标准 LoRA 训练。

为什么非要多步不可?论文里给了一个很直观的类比。如果只用初始点 W₀ 处的一步梯度,那相当于你在山脚下看了一眼坡度就开始规划登山路线;但真正的下山路径是弯弯曲曲的,每一步的坡度都在变。多步探针等于先沿着山路小跑几步,感受一下真实的地形变化,再回来重新规划。对于二次损失这种简单情况,论文证明了一步估计器存在一个无法消除的偏差项 ‖W₀ - W*‖²,而轨迹估计器的误差只包含一个可控的方差项和漂移项,理论上更优。

这个「先跑几步再回来」的 look-ahead 策略,正是 LoRA-GA² 跟所有前辈都不一样的灵魂所在。

两个正交指标:敏感度 × 有效秩,一个都不能少

拿到多步梯度之后,怎么用它来分配每一层的秩?这是 LoRA-GA² 的第二个核心设计。

现有方法走两个极端。GoRA 只看敏感度,也就是 |W₀ ⊙ G_avg| 的均值,来衡量某一层对任务的重要性;RaLoRA 只看有效秩(effective rank),也就是梯度奇异值分布的熵。但论文尖锐地指出:这两个指标单独用都有盲区。

一个层可能对损失非常敏感,但它的梯度几乎集中在一个方向上——这时候给它分配大秩就是浪费;反过来,一个层的梯度方向非常分散、有效秩很高,但它对下游任务其实没什么贡献——这时候给它大秩同样是浪费。敏感度回答的是「这层重不重要」,有效秩回答的是「需要多少方向才能表示它的更新」,这是两个正交的属性。

LoRA-GA² 的做法是把两者乘起来:S^l = Ī_sens^l · (Ī_erank^l)^λ,其中 Ī 表示跨层的 min-max 归一化,λ 默认取 1.0。这样一层只有同时满足「重要」和「方向分散」两个条件时,才会被分配到更大的秩。这个设计既防止了敏感度高但方向单一导致的容量浪费,也防止了方向分散但不重要的无谓开销。

最终的秩分配还考虑了参数量预算:给定参考秩 r_ref,总预算 P_total = Σ √(d_in + d_out) · r_ref,然后根据归一化分数 S^l 按比例分配,再用平方根形状因子防止宽层吃掉整个预算。

SVD 初始化:让低秩适配器起跑就领先

秩分配解决的是「每层给多少容量」的问题,而初始化解决的是「初始子空间往哪个方向放」的问题。

LoRA-GA² 对累积的负梯度做截断 SVD 分解:D_avg = -G_avg ≈ UΣVᵀ,然后用 U√Σ 和 √ΣVᵀ 分别初始化 B 和 A,再除以 √(σ₁γ) 做归一化。这里的 σ₁ 是最大奇异值,γ 是一个稳定性缩放系数。这样做的效果是,初始的适配器更新 BA 恰好沿着多步累积梯度的主下降方向,而且谱范数被严格控制在 1/γ——也就是说,γ 直接控制了初始扰动的幅度。

为什么这个细节很重要?如果初始化后的适配器导致初始损失出现一个尖峰,训练一开始就崩了。论文采用了一个非常务实的策略:在 2 的幂次网格上搜索 γ,找到第一个能让初始损失不高于「无 LoRA 分支的恢复模型」的候选值。这个策略直接防止了非零初始化带来的不利影响。

论文的 Figure 1 把四类方法的区别画得很清楚:标准 LoRA 随机初始化,一步梯度方法(LoRA-GA)站在起点看梯度,连续多步对齐方法(LoRA-Pro)每一步都对齐但代价高,而 LoRA-GA² 用探针高效地模拟多步轨迹,兼顾了信息量和开销。

方法对比图
图2:(a) 标准 LoRA;(b) 基于一步梯度的 LoRA 变体;(c) 基于多步梯度的 LoRA 变体;(d) LoRA-GA²,引入高效探针估计预训练权重的多步梯度,并利用梯度的方向和内在维度初始化低秩权重。

数据与实验设计:三大模态,硬碰硬

为了验证 LoRA-GA² 的通用性,论文设计了三个跨模态、跨架构的实验场景,每个实验都用三种随机种子重复,在四张 NVIDIA H200 GPU 上完成。

第一个场景是自然语言理解,用 T5-Base 在 GLUE 基准的五个子任务(MNLI、SST-2、CoLA、QNLI、MRPC)上微调,超参数设置跟 LoRA-GA 和 GoRA 完全一致:Adam 优化器、峰值学习率 1e-4、批大小 32、一个 epoch、零权重衰减、FP32 训练。LoRA 适配器加在所有线性层上(语言头除外)。

第二个场景是推理和代码生成,用 Llama-3.1-8B-Base 分别在 GSM8K(数学推理,MetaMathQA-100K 训练,准确率评估)和 HumanEval(代码生成,CodeFeedback-100K 训练,pass@1 评估)上微调,跟 GoRA 的设置保持一致:AdamW、峰值学习率 5e-5、批大小 64、一个 epoch、BF16 模型权重加 FP32 低秩权重、LoRA 加在注意力投影矩阵上。

第三个场景是视觉迁移,用 CLIP-ViT-B/16 在七个图像分类任务(Cars、DTD、EuroSAT、GTSRB、RESISC45、SUN397、SVHN)上微调,分类器用文本提示「a photo of a {class}.」构建,跟 RaLoRA 的设置一致。

固定秩的 LoRA 变体统一用秩 8,自适应秩变体用参考秩 8、最小秩 4、最大秩 32。所有对比方法都使用各自论文报告的最优超参数设置,确保公平比较。

实验结果:全面开花,GLUE 反超全量微调

先看 GLUE 上的表现。LoRA-GA² 把平均分拉到了 88.62,比最强基线 GoRA 高出 0.66 分,比 LoRA-GA 高出 0.85 分,甚至比全量微调还高出 0.71 分。最大的增益出现在 CoLA 任务上,LoRA-GA² 拿到 82.39,比 LoRA-GA 高 1.82 分,比 GoRA 高 2.53 分。CoLA 是对语言可接受性非常敏感的任务,这个结果跟论文的核心主张高度一致:短轨迹探针比一步梯度能捕捉到更稳定的早期更新方向。此外 LoRA-GA² 在 MRPC 上也拿了最高分,说明这种对齐在小规模数据集上同样有效。

下面是 T5-Base 在 GLUE 五个子任务上的完整对比结果。

Table1 GLUE实验结果
表1:T5-Base 在 GLUE 五个子任务上的微调性能。加粗和下划线分别表示秩 8 或参考秩 8 的低秩方法中的最高和第二高分。

接下来看推理和代码生成。使用 Llama-3.1-8B-Base 微调,LoRA-GA² 在 GSM8K 上拿到 73.94,比最强基线 GoRA 高出 1.03 分;在 HumanEval 上拿到 49.85,比 GoRA 高出 0.87 分。GSM8K 甚至超过了全量微调的 73.69,而 HumanEval 虽然比全量微调低 1.78 分,但已经大幅缩小了标准 LoRA 那 8.54 分的差距。

下面这张图展示了 LoRA-GA² 在 MetamathQA 上微调 Llama-3.1-8B-Base 的损失曲线,对比标准 LoRA 可以明显看到优化和收敛速度的优势。

Figure3 损失对比
图3:LoRA 和 LoRA-GA² 在 MetamathQA 上微调 Llama-3.1-8B-Base 的损失对比。
Table2 GSM8K和HumanEval实验结果
表2:Llama-3.1-8B-Base 在 GSM8K(准确率)和 HumanEval(pass@1)上的微调性能。

在视觉迁移上,CLIP-ViT-B/16 的七个图像分类任务平均分,LoRA-GA² 拿到 91.16,比最强基线 RaLoRA 高出 0.63 分,在七个数据集中六个拿到最好成绩。Cars、DTD、SUN397 和 SVHN 都有明显提升。

Table3 CLIP视觉实验结果
表3:CLIP-ViT-B/16 在七个图像分类任务上的微调性能。

值得注意的是,CLIP 实验跟自适应秩基线用的是同一个参考秩预算(r_ref=8),也就是说改善不是靠增加可训练参数量堆出来的,而是更有效的分配和初始化带来的。三个模态的全面验证,支撑了「敏感度×有效秩」这个双指标设计的通用性——它不是绑定在某个模型族或某个模态上的特技。

消融实验揭示:每个组件都不可或缺

完整的 LoRA-GA² 由三个核心组件组成:多步轨迹梯度、谱感知秩分配、SVD 初始化。消融实验的目的,就是看看每一个组件到底贡献了多少。

Table4 消融实验结果
表4:Llama-3.1-8B-Base 上的关键消融实验(含标准差)。

第一个消融是替换多步梯度为固定权重的一步梯度,但保持同样的数据预算(同样用 64 个 mini-batch 的平均梯度,只是所有权重都固定在 W₀ 上算)。结果显示,多步梯度在 GSM8K 上比一步梯度高 1.81 分(73.94 vs 72.13),在 HumanEval 上高 0.20 分。这说明「沿着轨迹移动」这件事本身就带来了信息增益,而不只是「多算几个 batch」的收益。

第二个消融是去掉 SVD 初始化,改为随机初始化(但保留多步梯度做秩分配)。这一步的损伤最大,GSM8K 从 73.94 直接掉到 68.92,掉了超过 5 分。这说明轨迹梯度提供的方向信息只有通过 SVD 初始化注入到适配器里,才能真正转化为性能增益;如果只用来算敏感度分配秩,价值会大打折扣。

第三个消融是替换双指标秩分配为单指标。只用敏感度(GoRA 的做法)或者只用有效秩(RaLoRA 的做法),GSM8K 和 HumanEval 都有不同程度的下滑。这验证了论文的核心观点:敏感度和有效秩是正交的信息,缺一个都会导致参数分配不够合理。

论文还做了超参数的消融,包括探针步数 N 和稳定性系数 γ。结果显示,N=64 是一个好的平衡点:太小时轨迹信息不足,太大时探针时间开销上升且梯度漂移变大。γ 的搜索策略(在 2 的幂次网格上找第一个不增加初始损失的候选值)则保证了非零初始化的稳定性。

Figure5 超参数消融
图5:超参数 N 和 γ 的消融实验。

龙迷三问

下面是龙哥对于大家可能的一些问题的解答:
这篇论文到底在解决什么问题?中科大提出LoRA-GA²,用AdaLomo轻量模拟多步微调轨迹,以零额外显存成本获取稳定的多步梯度,并据此做谱感知的秩分配与SVD初始化。
这篇工作最值得看的点是什么?在GLUE benchmark上平均分88.62,超过最强基线GoRA 0.66分;在GSM8K上73.94分,超过GoRA 1.03分;在HumanEval上49.85分,超过GoRA 0.87分;在CLIP图像分类上平均91.16分,超过RaLoRA 0.63分
这篇工作的边界或风险在哪里?优点:1) 利用多步梯度信息,比单步梯度方法更准确地捕捉训练动态;2) 探测阶段无额外GPU内存开销,时间开销小;3) 结合敏感性和有效秩的秩分配策略更全面;4) 与现有训练框架兼容性好。缺点:1) 引入额外的探测阶段,增加训练流程复杂度;2) 全局指数λ需要人工设定;3) 探测步数N和缩放因子γ需要调优
如果你还有哪些想要了解的,欢迎在评论区留言或者讨论~

龙哥点评

论文创新性分数:★★★★☆

提出一种利用轻量级多步梯度探测(基于AdaLomo优化器)获取轨迹感知的梯度信息,并基于谱感知的重要性分数进行秩分配和SVD初始化的LoRA变体方法。

实验合理度:★★★★☆

准确率(Accuracy)、pass@1

学术研究价值:★★★★☆

提出一种利用轻量级多步梯度探测(基于AdaLomo优化器)获取轨迹感知的梯度信息,并基于谱感知的重要性分数进行秩分配和SVD初始化的LoRA变体方法;更关键的是问题定义是否可复用到同类任务。

稳定性:★★★☆☆

现有材料未提供充分的极端条件、重复运行或扰动测试,稳定性暂按中性评价。

适应性以及泛化能力:★★★☆☆

现有材料未完整展示跨数据集、跨场景或分布外实验,泛化能力仍需进一步验证。

硬件需求及成本:★★★☆☆

探测阶段在Llama3.1-8B-Base上耗时5分55.83秒,峰值GPU内存108,019 MB;正式训练耗时31分14.4秒,峰值GPU内存137,695 MB

复现难度:★★★☆☆

现有材料未确认完整代码、配置、数据处理脚本和权重是否齐备,复现难度暂按中性评价。

产品化成熟度:★★★☆☆

论文验证以研究实验为主,真实部署中的时延、成本、维护和异常场景仍需补充验证。

可能的问题:1) 引入额外的探测阶段,增加训练流程复杂度;2) 全局指数λ需要人工设定;3) 探测步数N和缩放因子γ需要调优

主要参考文献

[1] Hu E, Shen Y, Wallis P, et al. LoRA: Low-Rank Adaptation of Large Language Models[C]//ICLR 2022.
[2] Wang S, Yu L, Li J. LoRA-GA: Low-Rank Adaptation with Gradient Approximation[C]//NeurIPS 2024.
[3] He H, et al. GoRA: Gradient-guided Adaptive Rank Allocation for LoRA[C]//2025.
[4] Ye Z, et al. RaLoRA: Effective Rank Allocation for Low-Rank Adaptation[C]//2026.
[5] Lv K, et al. AdaLomo: Low-memory Optimization with Adaptive Learning Rate[C]//NeurIPS 2023.
[6] Wang Z, et al. LoRA-Pro: Are Low-Rank Adapters Simply Optimizers?[C]//ICLR 2025.
[7] Zhang Q, et al. AdaLoRA: Adaptive Budget Allocation for Parameter-Efficient Fine-Tuning[C]//ICLR 2023.
[8] Wang A, et al. GLUE: A Multi-Task Benchmark and Analysis Platform for Natural Language Understanding[C]//ICLR 2019.
[9] Cobbe K, et al. Training Verifiers to Solve Math Word Problems[J]. arXiv:2110.14168, 2021.
[10] Chen M, et al. Evaluating Large Language Models Trained on Code[J]. arXiv:2107.03374, 2021.

*本文仅代表个人理解及观点,不构成任何论文审核或者项目落地推荐意见,具体以相关组织评审结果为准。欢迎就论文内容交流探讨,理性发言哦~ 想了解更多原文细节的小伙伴,可以点击"阅读原文",查看更多原论文细节哦!       

end
微调别只看一步,多走几步天地宽。LoRA-GA² 用64步轨迹探针换来全面涨点,想聊聊大模型微调、参数高效微调的最新玩法?欢迎加入龙哥读论文粉丝群,扫描下方二维码或者添加龙哥助手微信号加群:kangjinlonghelper。一定要备注:研究方向+地点+学校/公司+昵称(如 图像处理+上海+清华+龙哥),根据格式备注,可更快被通过且邀请进群。
wechat_helper dianzan

转发文章 微博 X LinkedIn Facebook
龙哥读论文 · PaperDaily

本文基于龙哥读论文 PaperDaily 数据库整理,结合论文原文与工程视角进行解读。