← 返回 PaperDaily 视觉与图像

图像生成|统一协议揭秘:SAG局部称王,FLUX.2上替代法全输CFG

CFG的八种免训练替代方法,真的比原版CFG更香吗?这篇论文在统一协议下,用组合对齐基准在SD3.5 Medium和FLUX.2 klein上实测,结论相当扎心:没有一个方法能全面胜出,CFG依然是性价比之王。想知道哪些方法在哪些指标上偷偷涨了点?这篇评测给你答案。

图像生成|统一协议揭秘:SAG局部称王,FLUX.2上替代法全输CFG
原论文信息如下:
论文标题:
重新审视潜在扩散模型中的无分类器引导方法(Revisiting Classifier-Free Guidance Methods in Latent Diffusion Models)
发表日期:
2026年8月18日(预印本)

发表单位:
俄罗斯高等经济大学(HSE University)、Yandex

原文链接:
https://arxiv.org/pdf/2608.16786v1.pdf

开源代码链接:
论文称提供实现与配置,但未给出公开仓库链接

引言

文生图模型卷到现在,从Stable Diffusion到FLUX,从U-Net到DiT,几乎每隔几个月就有新一代模型刷新认知。但有一个东西从扩散模型诞生起就一直陪跑,至今仍是推理阶段不可或缺的组件——无分类器引导(Classifier-Free Guidance,简称CFG)。
CFG的原理简单却极其有效:采样时同时计算条件预测ε_cond和无条件预测ε_uncond,通过线性插值组合:ε̂ = ε_uncond + w · (ε_cond − ε_uncond)。w控制生成结果对文本的服从程度,w>1时放大差异,让结果更贴合提示词。但这种线性外推也带来副作用:过高的w会导致色彩过饱和、结构伪影、多样性下降。这些副作用在U-Net时代已被广泛研究,但在新一代Transformer架构上,问题的表现形式和严重程度是否变化,此前缺乏系统研究。
正是这些副作用,催生了一大批试图“既要高权重、又不想翻车”的替代方法。它们有的从数学上重新推导引导公式,有的从注意力机制入手构造扰动,有的借鉴能量函数视角。但这些方法大多基于不同模型、数据集和指标,彼此缺乏可比性;且大多在U-Net架构上提出,能否平移到当前主流的Transformer架构,本身就是一个悬而未决的问题。
本文正是为了解决这一痛点而生。来自俄罗斯高等经济大学和Yandex的研究者,将八种声称能替代或改进CFG的免训练引导方法拉到同一擂台,使用两个现代整流流Transformer模型(SD3.5 Medium和FLUX.2 [klein] 4B Base),在三个组合对齐基准(GenEval、DPG-Bench、OneIG-Bench)上进行了公平、系统的对比评测。评测协议经过精心设计,包括统一采样步数、统一超参选择流程、严谨的不确定性量化。最终结果相当扎心:没有任何一个方法能在所有指标上全面胜过CFG,CFG依然是性价比最高的基线选择。

CFG替代方法大比拼:谁才是真正的赢家?

文生图圈每隔一阵就冒出一篇论文,宣称找到了比CFG更聪明的引导方法,配上FID降了多少、CLIP分数涨了多少的漂亮数字。但如果把这些方法拉到同一擂台,用同一个模型、同一批提示词、同样的采样步数公平比一次,结果会怎样?这篇来自俄罗斯高等经济大学和Yandex的论文给出了一个相当扎心的答案:八个号称要"修正"CFG的免训练替代方法,没有一个能在两个现代模型、三个组合对齐基准上全面胜过CFG。
先给不太熟悉的读者补个背景。CFG做着看起来最简单的事:采样时同时计算条件预测和无条件预测,再把两者按权重拉开,让生成结果更听文本的话。它的更新规则可以写成:
ε̂ = ε_uncond + w · (ε_cond − ε_uncond)
其中ε_cond是文本条件下的预测,ε_uncond是无条件预测,w是引导权重。权重越大,生成图像越贴合提示词,但过大的w会带来一系列副作用:色彩过饱和、结构伪影、图像多样性下降。正是这些副作用,催生了一大批试图"既要高权重、又不想翻车"的替代方法。
麻烦在于,这些替代方法诞生于不同时期,验证模型各不相同,评测指标也五花八门,大多是在U-Net架构的扩散模型上做了局部测试。它们到底谁更强,在新一代Transformer架构上还灵不灵,一直没有一个统一的答案。本文做的就是这件事:把八种同类方法拉到同一副擂台,用固定协议重新打一遍。
这八位选手分别是:CFG++、CFG-Zero*、APG、TCFG、SAG、PAG、SEG、OSEG。虽然它们都试图解决CFG的某些缺陷,但切入角度和数学形式差异很大。为了便于理解,论文将它们分为两个门派。第一个门派是“更新规则修改派”,直接在CFG的更新公式上做文章。CFG++提出流形约束,把引导更新方向限制在数据流形上,避免生成过程偏离自然图像分布。CFG-Zero*则是针对流匹配模型设计的改进版本,让某些去噪步骤从零初始化,减少引导的累积误差。APG全称Anti-saturation Projected Guidance(反饱和投影引导),在高引导权重下对更新方向做投影来抑制过饱和。TCFG全称Tangential damping Classifier-Free Guidance(切向阻尼引导),把引导力分解成切向和法向分量,只保留切向分量来减弱过冲。第二个门派是“注意力扰动派”,核心思路是构造一个“弱化版”预测,再引导模型远离它。SAG全称Self-Attention Guidance(自注意力引导),通过修改自注意力图构造弱化预测。PAG全称Perturbed-Attention Guidance(扰动注意力引导),对注意力的扰动方式比SAG更灵活。SEG全称Smoothed Energy Guidance(平滑能量引导),把注意力图视作能量函数进行平滑,降低能量曲率让引导更稳定。OSEG是SEG的正交化改进,通过正交化处理抑制能量函数中的交叉干扰。
这里有一个容易被忽视的背景:这些方法绝大多数最初是在U-Net架构的扩散模型上提出并验证的,而现在的SOTA模型早已换成Transformer架构。U-Net上的最优配置和结论,能不能平移到Transformer上,本身就是个大问号。因此本文在适配每个方法时重新选择了Transformer层,而不是照搬原论文设置。这种适配过程本身就是一个重要的研究贡献,因为它揭示了哪些方法的核心机制是架构无关的,哪些方法是严重依赖U-Net特定结构的。
评测所用基座模型是两款开源的整流流(Rectified Flow)模型:Stable Diffusion 3.5 Medium,25亿参数的多模态扩散Transformer(MM-DiT),文本和图像走联合注意力;FLUX.2 [klein] 4B Base,黑森林实验室开源的40亿参数混合架构模型,采用双流加单流混合Transformer布局。两者架构差异明显,正好可以检验方法的可迁移性。SD3.5 Medium的MM-DiT架构将文本和图像token在同一个注意力块中处理,而FLUX.2 [klein] 则先使用双流Transformer分别处理文本和图像,再在后期阶段合并为单流。这种架构差异意味着,在SD3.5上有效的注意力扰动策略,在FLUX.2上可能因为注意力分布的不同而失效。
超参选择也做得相当讲究。每个方法在原始论文给出的参数范围内,先用一个固定的小型提示集做网格搜索,只保留没有明显过饱和、光晕、结构重复或细节丢失问题的配置;全程不看任何基准分数,从机制上避免了"对着测试集调参"的嫌疑。具体来说,研究者为每个方法定义了一个候选参数网格,例如CFG++的引导尺度范围、SAG的层选择范围等。然后在一个包含约50个多样化提示的小型集合上生成图像,由人工检查是否存在明显的视觉伪影。只有通过视觉检查的参数组合才会被用于正式的基准评测。这种超参选择方式虽然不能保证找到全局最优参数,但至少确保了所有方法都在一个“合理工作点”上进行比较,避免了因参数设置不当而导致的误判。
不确定性量化是这篇论文另一个用心之处。它用10,000次成对提示自助抽样(paired prompt bootstrap)来估计方法间差异的显著性。简单说,每次抽样按相同索引抽取相同提示,所有方法共用同一条随机链,最终得到每个方法与CFG差异的经验分布,取95%分位数作为"共享参考边界"。差异落在这个边界内,就视为无法判定谁更好,而不是草率宣布打平或胜出。这种统计方法比简单地比较点估计要严谨得多,因为它考虑了提示集采样带来的随机波动。例如,如果方法A在GenEval上比CFG高0.02,但共享参考边界是±0.03,那么这0.02的差异就可能是抽样噪声造成的,不能算作真正的提升。

组合对齐基准:揭示传统指标掩盖的真相

为什么传统的FID、CLIP Score、Inception Score不够用了?因为这些指标衡量的是"整张图好不好看",而不是"这张图是否准确实现了提示词的语义关系"。提示词写"戴圆眼镜的女人在图书馆里",模型画了"戴方眼镜的女人在咖啡厅里",FID可能完全无感,CLIP Score大概率也不会给出明显惩罚。但对真实用户来说,这就是画错了。FID衡量的是生成图像分布与真实图像分布之间的差异,它无法捕捉到具体的语义错误。CLIP Score虽然能反映图像与文本的全局相似度,但对于细粒度的属性绑定(如颜色、形状、位置)并不敏感。Inception Score则更关注图像的类别多样性和清晰度,与文本对齐几乎无关。
为此本文全面转向组合对齐基准。GenEval测对象组合能力,比如"三只狗"的计数、"狗在马右边"的空间关系;DPG-Bench测密集提示跟随,提示词里塞满颜色、形状、纹理、位置等多重属性;OneIG-Bench则把能力拆分成对象、文本渲染、知识推理等维度,本文选取了其中三个家族:General Object、Text Rendering和Knowledge Reasoning。这三个基准各有侧重:GenEval专注于对象数量、颜色、空间关系等基本组合能力;DPG-Bench则更强调对复杂、密集属性提示的跟随能力;OneIG-Bench的General Object家族测试对象类别和属性的正确性,Text Rendering家族测试图像中文本渲染的准确性,Knowledge Reasoning家族则测试模型对世界知识的理解和应用能力。通过这三个基准的组合,可以较为全面地评估引导方法对文本-图像对齐的影响。
表1展示了两个模型上的头部指标总览,GE为GenEval,DPG为均值乘100,Obj、Txt、Rsn分别对应OneIG-Bench的对象、文本渲染和知识推理家族。灰色表示与CFG的差异落在共享bootstrap margin之内,绿色和红色分别表示显著增益和损失,加粗为该列名义最大值。
表1:两个模型上的头部基准分数
表1:两个模型上的头部基准分数。GE为GenEval,DPG为均值×100,Obj、Txt、Rsn分别为OneIG-Bench的对象、文本渲染和知识推理家族。灰色表示与CFG的差异在共享参考边界内,绿色/红色分别表示显著增益/损失。
从表1中可以清晰地看到,没有任何方法能在所有指标上同时超越CFG。每个方法都只在特定的模型和特定的指标上表现出局部优势,而在其他指标上则可能持平甚至显著落后。这种“此消彼长”的现象在传统的全局质量指标(如FID)中几乎不可见,但在组合对齐基准上却暴露无遗。这正是本文选择组合对齐基准作为主要评测工具的原因所在。

结果解读:局部增益与整体平局

先看SD3.5 Medium上的战况。最亮眼的正向结果是SAG:它在GenEval上拿到0.715,对比CFG的0.655,明显超出±0.027的共享margin;在推理(Rsn)上也从0.257提升到0.269,稳稳越线。APG、CFG++和TCFG在对象组合(Obj)指标上都越过了margin,其中APG以0.763拿到名义最高分。但增益非常局部:CFG++的GenEval反而下降,CFG++和CFG-Zero*的推理分数显著下跌;PAG则全线翻车,在GenEval、DPG、文本渲染、推理四个指标上都显著落后于CFG。SAG在SD3.5上的表现尤为突出,它不仅显著提升了GenEval和推理分数,而且在其他指标上也没有显著损失。这表明SAG的注意力扰动机制在MM-DiT架构上能够有效地引导模型关注更准确的语义特征。
再看FLUX.2 [klein] 4B Base,局面就有些尴尬了。没有任何一个方法能在任一头部指标上获得超出共享margin的正向增益。APG名义上在GenEval、DPG和文本渲染三项上领先CFG,但差距全部落在margin之内,无法判定为真优势。与此同时,CFG++和CFG-Zero*的GenEval显著下降,SEG、OSEG、PAG也都在GenEval上出现显著损失;所有注意力扰动类方法在文本渲染或推理上至少有一项显著下跌。FLUX.2上的结果与SD3.5形成了鲜明对比。在FLUX.2上,不仅没有方法能显著超越CFG,而且多个方法在多个指标上显著落后。这表明FLUX.2的CFG基线可能已经非常强大,替代方法难以找到改进空间;或者这些替代方法的机制与FLUX.2的混合Transformer架构不兼容。
SAG在SD3.5上的高光表现,在FLUX上完全消失,这个对比本身就说明了方法收益对架构的高度敏感性和迁移的不确定性。SAG在SD3.5上通过扰动自注意力图来构造弱化预测,这种扰动在MM-DiT的联合注意力机制中可能恰好起到了“纠错”的作用。但在FLUX.2的双流-单流混合架构中,自注意力的分布和角色发生了变化,同样的扰动策略可能不再有效,甚至可能引入额外的噪声。
图1:选定配置下的生成输出对比
图1:选定配置下的生成输出,左侧为SD3.5 Medium,右侧为FLUX.2 [klein] 4B Base。行为各方法,列为共享提示:戴圆眼镜在图书馆的女性肖像;领带右边的狗;日出时薄雾笼罩的山谷与河流;骑着白马穿过红色罂粟花田的女性。
图1的定性结果与定量指标相互印证。在SD3.5上,SAG生成的图像在细节和语义准确性上明显优于CFG,例如“戴圆眼镜的女性”这一提示,SAG正确生成了圆眼镜,而CFG则可能生成方眼镜。但在FLUX.2上,SAG与CFG的视觉差异变得很小,甚至在某些情况下SAG生成的图像出现了新的伪影。这种视觉上的对比直观地展示了方法迁移性的问题。
图2则给出了FLUX.2上更具体的两行案例。上一行是替代方法相对CFG引入错误的情况,比如把"两只狗"画成三只,或者把空间关系搞反;下一行是替代方法修正了CFG输出错误的情况。同一类干预在不同提示上方向完全相反,这解释了为什么在聚合指标上难有稳定增益。例如,SAG在某个提示上可能修正了CFG的颜色错误,但在另一个提示上却引入了新的对象数量错误。这种“按下葫芦浮起瓢”的现象,使得任何方法都难以在聚合指标上取得全面优势。
图2:FLUX.2上的精选定性案例
图2:FLUX.2 [klein] 4B Base上的精选案例。上方为替代方法相对CFG引入错误的示例,下方为修正CFG输出的示例。列为各方法,行为不同提示。
论文在附录中还提供了GenEval的六个类别细分,以及DPG-Bench的L1/L2多层次分解。这些表格能帮助定位某个方法到底在哪些提示属性上更强或更弱。
表5:GenEval类别分数
表5:GenEval六个类别分数和总体分数。Single为单对象,Two为双对象,Count为计数,Color为颜色,Pos为空间位置,Attr为属性,Overall为宏平均。
表6:DPG-Bench L1分数
表6:DPG-Bench L1分数,包含属性、实体、其他、全局、关系五个子项,DPG为均值×100。
表7:DPG-Bench L2属性分数
表7:DPG-Bench L2属性分数,细分为颜色、其他、形状、尺寸、纹理五个属性维度。
表8:DPG-Bench L2非属性分数(SD3.5 Medium)
表8:DPG-Bench L2非属性分数(SD3.5 Medium)。
表9:DPG-Bench L2非属性分数(FLUX.2 [klein] 4B Base)
表9:DPG-Bench L2非属性分数(FLUX.2 [klein] 4B Base)。
从这些细分中能看到不少有趣现象:某些方法在颜色属性上微涨,代价是尺寸或纹理属性下跌。这种此消彼长在聚合指标上几乎完全不可见。例如,在SD3.5上,APG在GenEval的Color类别上表现突出,但在Count类别上却可能显著落后于CFG。这种细粒度的分析对于理解方法的适用场景至关重要。如果某个应用场景特别关注颜色准确性,那么APG可能是一个值得考虑的选择;但如果场景对计数准确性要求很高,那么APG可能就不合适了。与此同时,论文还做了一项很有价值的工作:把每个方法原始论文声称的评测结果,与本文SD3.5 GenEval结果并排对比,如表2所示。
表2:原始论文评测结果与本文结果对比
表2:各方法原始论文相对CFG的评测结果与本文SD3.5 GenEval结果对比。"Comp.?"标记原始论文是否使用了组合对齐基准,最后一列为本文实测的GenEval总分(CFG为0.655)及差值。
可以看到,除了CFG-Zero*之外,其余七个方法的原始论文都没有使用组合对齐基准,主要依赖FID、CLIP Score、Inception Score、美学分数等全局质量指标。"原始论文里我对CFG涨了多少"和"本文里我在GenEval上相对CFG如何"之间,几乎不存在可预测的对应关系。SAG是唯一在两项评测中都占优的正面案例(GenEval +0.060),而PAG(−0.060)和CFG++(−0.038)则出现了显著下滑。这种不一致性凸显了评测基准选择的重要性。一个方法在FID上可能表现优异,但在组合对齐上却可能一塌糊涂。对于实际应用来说,组合对齐能力往往比全局统计指标更为关键。
总的来说,本文的结论可以概括为一句话:以目前的证据,CFG替代方法更适合被视为"针对特定模型和特定指标的局部选择",而不是通用升级方案。CFG依然是竞争力极强、成本最低的基线。对于模型部署方来说,除非有明确的证据表明某个替代方法在自己的模型和提示分布上能带来显著提升,否则继续使用CFG是最稳妥的选择。

对研究社区的启示与未来方向

读完全文,最值得反复琢磨的是下面几点。第一是方法迁移性的问题。U-Net架构上验证有效的引导方法,迁移到Transformer架构时,优势可能消失甚至逆转。本文中SAG从SD3.5上的显著领先到FLUX.2上的完全失效,就是最直观的案例。对于研究者来说,这提醒我们在新骨干网络上一味沿用旧模型的成功配方可能并不稳妥。未来的引导方法研究,应该直接在最新的Transformer架构上进行验证,而不是在过时的U-Net架构上反复打磨。
第二是模型越强、引导优化的空间可能越小的趋势判断。FLUX.2作为比SD3.5更新的模型,CFG基线本身已经非常强,替代方法几乎找不到可乘之机。这个观察符合直觉,但还需要更多代模型的评测才能确认为普遍规律。一种可能的解释是,随着模型规模的增大和训练数据的丰富,模型自身的条件预测已经非常准确,CFG的线性外推已经足够接近最优引导方向,因此复杂的替代方法难以带来额外收益。另一种解释是,FLUX.2的架构设计(如双流-单流混合)可能已经隐含了对引导过程的优化,使得外部干预难以奏效。
第三是评测协议本身的启示。如果只看FID,本文中的多个方法可能各有所长;但换成组合对齐基准之后,格局完全变了。论文建议社区把组合对齐基准作为引导方法评测的必备项,同时报告不确定度,而不是只报一个漂亮的点估计。这样的评测生态才能让真正有效的改进浮出水面。此外,论文还强调了超参选择透明性的重要性。在评测引导方法时,应该明确说明超参的选择过程和依据,避免因参数设置不当而导致的误导性结论。
论文也有明确的局限:只覆盖两个整流流Transformer模型;每个方法只测了一个选定配置;缺少人工评估和感知质量指标;共享margin只反映当前提示集和评测程序下的不确定性。更宽泛的参数搜索可能会改变个别排名,但这些局限并不影响核心结论的稳健性。例如,如果对每个方法进行更大范围的超参搜索,某些方法的排名可能会有所提升,但“没有方法能全面超越CFG”这一核心结论不太可能被推翻。此外,论文没有进行人工评估,因此无法判断不同方法在人类感知质量上的差异。未来的工作可以引入人工评估,以及覆盖更多样化的模型和提示分布。

龙迷三问

下面是龙哥对于大家可能的一些问题的解答:
这篇论文到底在解决什么问题?俄罗斯高等经济大学与Yandex在统一协议下,以组合对齐基准重点评测8种免训练CFG替代方法在SD3.5 Medium和FLUX.2 klein上的表现,结论:没有方法能一致超越CFG,APG名义领先但差距多在误差内,CFG仍是性
这篇工作最值得看的点是什么?没有任何方法在所有指标上一致优于CFG;APG在部分指标上获得名义最高分,但多数增益在估计不确定性范围内;SAG在SD3.5上对GenEval和推理有显著提升,但在FLUX上无显著优势;CFG仍是有竞争力的低成本基线。
这篇工作的边界或风险在哪里?优点:系统性地在统一协议下比较了八种方法,使用组合对齐基准而非传统质量指标,提供了不确定性估计;缺点:仅覆盖两个模型,超参数选择基于定性扫描,未进行人类评估,未覆盖所有OneIG-Bench子集。
如果你还有哪些想要了解的,欢迎在评论区留言或者讨论~

龙哥点评

论文创新性分数:★★★★☆

在固定协议下系统性地重新评估八种基于无分类器引导(CFG)的推理时增强方法在两个现代整流流Transformer模型上的表现,使用组合对齐基准而非传统图像质量指标进行公平比较。

实验合理度:★★★★☆

GenEval总体得分、DPG-Bench均值×100、OneIG-Bench三个子集得分;使用10,000次配对提示词自助抽样估计不确定性

学术研究价值:★★★★☆

在固定协议下系统性地重新评估八种基于无分类器引导(CFG)的推理时增强方法在两个现代整流流Transformer模型上的表现,使用组合对齐基准而非传统图像质量指标进行公平比较;更关键的是问题定义是否可复用到同类任务。

稳定性:★★★☆☆

现有材料未提供充分的极端条件、重复运行或扰动测试,稳定性暂按中性评价。

适应性以及泛化能力:★★★☆☆

现有材料未完整展示跨数据集、跨场景或分布外实验,泛化能力仍需进一步验证。

硬件需求及成本:★★★☆☆

SD3.5 Medium使用25步采样,FLUX.2 [klein] 4B Base使用30步采样;推理使用V100 32GB GPU;注意力扰动方法每次预测增加一次额外前向传播

复现难度:★★★☆☆

现有材料未确认完整代码、配置、数据处理脚本和权重是否齐备,复现难度暂按中性评价。

产品化成熟度:★★★☆☆

论文验证以研究实验为主,真实部署中的时延、成本、维护和异常场景仍需补充验证。

可能的问题:仅覆盖两个模型,超参数选择基于定性扫描,未进行人类评估,未覆盖所有OneIG-Bench子集。

主要参考文献

[1] Ho J, Salimans T. Classifier-free diffusion guidance. arXiv preprint arXiv:2207.12598, 2022.
[2] Esser P, Kulal S, Blattmann A, et al. Scaling rectified flow transformers for high-resolution image synthesis. ICML, 2024.
[3] Stability AI. Stable Diffusion 3.5 Medium. Hugging Face, 2024.
[4] Black Forest Labs. FLUX.2 [klein]: Towards interactive visual intelligence. 2026.
[5] Ghosh D, Hajishirzi H, Schmidt L. GenEval: An object-focused framework for evaluating text-to-image alignment. NeurIPS, 2023.
[6] Chung H, Kim J, Park G Y, et al. CFG++: Manifold-constrained classifier free guidance for diffusion models. ICLR, 2025.
[7] Hong S, Lee G, Jang W, et al. Improving sample quality of diffusion models using self-attention guidance. ICCV, 2023.
[8] Ahn D, Cho H, Min J, et al. Self-rectifying diffusion sampling with perturbed-attention guidance. ECCV, 2024.

*本文仅代表个人理解及观点,不构成任何论文审核或者项目落地推荐意见,具体以相关组织评审结果为准。欢迎就论文内容交流探讨,理性发言哦~ 想了解更多原文细节的小伙伴,可以点击"阅读原文",查看更多原论文细节哦!       

end
CFG替代方法到底行不行?八种方法实测数据都在这篇解读里啦!还想和龙哥一起追踪文生图最新评测、吐槽论文里那些"看似涨点实则翻车"的操作,欢迎加入龙哥读论文粉丝群,扫描下方二维码或者添加龙哥助手微信号加群:kangjinlonghelper。一定要备注:研究方向+地点+学校/公司+昵称(如 图像生成+上海+清华+龙哥),根据格式备注,可更快被通过且邀请进群。
『龙哥读论文』微信群目前包含:图像处理、大模型及智能体、自动驾驶及机器人、AI医疗及AI金融5个群,文生图、扩散模型、评测基准,等你来聊~
wechat_helper dianzan

转发文章 微博 X LinkedIn Facebook
龙哥读论文 · PaperDaily

本文基于龙哥读论文 PaperDaily 数据库整理,结合论文原文与工程视角进行解读。