← 返回 PaperDaily 视觉与图像

控制变量法实测18个视觉骨干 VMamba险胜Swin

想象一下:你正坐在家里吹着空调,屋顶光伏板正在发电。突然一片云飘过来,光伏输出瞬间掉了一半;云飘走,输出又瞬间拉满。这种"过山车式"发电曲线,正是光伏并网最大的痛点。

控制变量法实测18个视觉骨干 VMamba险胜Swin


原论文信息如下:
论文标题:
A Controlled Visual-Backbone Benchmark for Multimodal Short-Term Solar Irradiance Forecasting
发表日期:
2026年07月
发表单位:
University of Peradeniya
原文链接:
https://arxiv.org/pdf/2607.23633v1.pdf
想象一下:你正坐在家里吹着空调,屋顶光伏板正在发电。突然一片云飘过来,光伏输出瞬间掉了一半;云飘走,输出又瞬间拉满。这种"过山车式"发电曲线,正是光伏并网最大的痛点。如果提前10分钟精准预测太阳辐照强度,电网就能提前调配备用容量,避免供需失衡。
如今,越来越多研究将地面天空图像与气象历史数据结合做多模态预测。但这里藏着一个"连环坑":很多论文对比不同视觉模型时,常把编码器、时序模型、融合策略、优化器全换一遍。好比比较两个厨师的刀工,一个用菜刀、一个用砍刀,还一个煎、一个炸——最后根本说不清差距是刀的问题还是火候的问题。
来自斯里兰卡佩拉德尼亚大学的研究团队这次就来了一次"教科书级"控制变量实验。他们搞了一个受控基准,把预处理、目标定义、时间编码、融合模块、回归头、优化器调度、随机种子、时间划分策略全部固定,唯独只换视觉骨干网络。用他们的话说,就是要看清在同一个多模态预测框架下,CNN、Transformer和Mamba这几大视觉骨干家族到底谁更"能打"。

太阳能预测的"控制变量法":为什么只看视觉骨干网络?

先把任务说清楚。论文要做的是10分钟提前量的太阳辐照预测,输入是当前时刻的地面天空图像和过去40步的气象历史序列,输出是10分钟后的清晰天空指数(clear-sky index)——即实际辐照度与理论晴空辐照度的比值。简单来说,这个指数衡量的是"天空被云遮挡了多少",是短期预测里非常好用的物理量。
为什么用清晰天空指数而不是直接用辐照度?因为太阳高度角随时间变化有很强的确定性规律——早上低、中午高,这个趋势如果直接丢给模型学习,会占据大量"注意力预算",反而盖过了云层变化带来的随机扰动。做了清晰天空归一化之后,模型就可以专注于预测"云的影响"这个真正困难的部分。论文里用Ineichen晴空模型计算理论晴空辐照度,再将预测结果反变换回物理单位(W/m²),这样误差数值对工程人员来说更直观。核心公式如下:
公式1:预测任务定义
公式1:预测任务定义。其中It表示t时刻的天空图像,Xt表示t时刻之前40步的气象历史序列,kt+10为10分钟后的清晰天空指数,GHIt+10为10分钟后的水平总辐照度,GHIcst+10为对应时刻的理论晴空辐照度。
任务里的"老规矩"——智能持久法(smart persistence)基线也值得一提。它的思路很朴素:假设当前云况在10分钟内基本不变,直接拿当前的清晰天空指数当作10分钟后的预测值,再乘上对应的晴空辐照度得到预测GHI。公式表示就是:
公式2:智能持久法基线
公式2:智能持久法(smart persistence)基线定义。kt为当前时刻的清晰天空指数,直接作为10分钟后的预测值,再乘以理论晴空辐照度还原为物理量。
别看这个基线简单,在太阳能预测领域它可是"黄金守门员"。很多花里胡哨的深度学习模型,最后连这个简单基线都打不过,那就非常尴尬了。论文也明确要求所有视觉骨干模型都要在技能分数(Forecast Skill, FS)上和这个基线对比,技能分数的计算如下:
公式3:技能分数定义
公式3:技能分数(Forecast Skill)定义。RMSE_model为模型的均方根误差,RMSE_sp为智能持久法的均方根误差。技能分数大于0表示模型优于智能持久法,小于0表示不如它。
理解了任务定义和基线之后,就能理解这篇论文的核心价值。它不是要提出一个"更花哨"的新模型,而是要给社区一个"手术台"——把视觉骨干网络单独拎出来,在同一套身体上做移植手术,看看谁的器官更好用。有意思的是,论文的固定协议还把评估指标扩展到了参数数量、FLOPs、FPS以及有效感受野(ERF)覆盖等维度,不仅看谁预测得准,还要看谁跑得快、谁更省资源,这个角度倒是很对工业界的胃口。

五大视觉骨干同台竞技:CNN、Transformer与Mamba谁主沉浮?

这次登场的选手阵容相当豪华:四个CNN系的ConvNeXt变体、三个Transformer系的Swin变体、三个VMamba、三个Spatial Mamba和五个MambaVision,一共18个模型,几乎把当前视觉骨干网络的"网红"们都集齐了。它们分别代表了几条技术路线。ConvNeXt是现代CNN的代表,通过借鉴Transformer的设计思路对传统卷积网络做了全面现代化改造;Swin Transformer采用分层移位窗口注意力,在图像分类、检测、分割等任务上表现优异;VMamba和Spatial Mamba则来自近两年大火的Mamba系列,利用选择性状态空间模型实现线性复杂度的长程建模;MambaVision则是Mamba与Transformer的"混血儿",试图取两者之长。
论文的固定架构把各个骨干都接在同一个"流水线"上:图像输入后先统一调整为224×224分辨率,然后应用一个以图像中心为圆心、半径为图像宽度250/512的圆形天空穹顶掩膜,把穹顶外的像素置零,再做ImageNet标准化。光线经过骨干网络提取特征后,每个骨干都要输出四个阶段的特征图,分别经过固定形式的投影器(包括1×1卷积、批归一化、GELU激活和全局平均池化),最终拼接成一个1024维的视觉描述子。整个架构如下图所示:
图1:共享的多模态预测架构
图1:共享的多模态预测架构。被掩码的天空图像和天气历史序列分别编码为视觉描述子zv和时序描述子zt,两者拼接后通过同一个回归头进行预测。所有运行中只有视觉骨干网络的家族和规模不同,其他模块全部固定。
视觉描述子的计算公式如下。这实际上是将四个阶段的特征图分别通过可学习的投影器,然后做全局平均池化并拼接,从而把不同空间分辨率的特征压缩成一个固定长度的向量——不管用的是什么骨干网络,最终视觉描述子都是1024维,这样后面的融合头就不用为每个骨干单独调整了。
公式4:视觉描述子构建
公式4:视觉描述子构建。Fi为骨干网络第i阶段的特征图,φi为第i阶段的投影器,GAP为全局平均池化。四个阶段各输出256个通道的向量,拼接后得到1024维的视觉描述子。
时间分支用的是一个单层LSTM,输入是7个通道的天气历史数据:清晰天空指数、温度、气压、太阳天顶角、太阳方位角以及一天时间的正弦/余弦编码。LSTM把40步的历史信息压缩成一个128维的时序描述子。
公式5:时序描述子构建
公式5:时序描述子构建。Xt为40步×7通道的天气历史序列,LSTM为单层长短期记忆网络,输出128维的时序描述子。
最后把128维时序描述子和1024维视觉描述子拼接成1152维的融合向量,依次经过层归一化、一个256单元的GELU层、丢弃率为0.3的Dropout,最后通过线性层输出标量预测。整个流程就是:骨干网络提特征、投影器降维度、LSTM编历史、拼接融合、轻量回归头输出。为了保证各个骨干之间的公平性,训练时所有模型统一用Huber损失(δ=1.0),AdamW优化器,批大小32,训练8个epoch,学习率5×10⁻⁵,骨干网络参数的学习率倍率为0.1,权重衰减0.05,余弦退火到10⁻⁶,随机种子统一设置为42,并且不用早停(no early stopping),完全靠验证集选最优检查点。下表汇总了全部固定的协议细节:
表2:固定比较协议
表2:固定的STRICT_V1比较协议。唯一有意变化的因素是视觉骨干网络的家族和规模,其余所有环节都保持不变,以最大程度确保对比的公平性。

65.39 vs 65.50:VMamba与Swin的毫厘之争

接下来就是激动人心的"揭榜时刻"。在Folsom数据集上,所有带视觉骨干的模型都超过了智能持久法,这个结果本身就很能说明问题——在数据量充足的情况下,天空图像确实提供了超越纯历史时序的增量信息。具体的对比结果如下表所示:
表3:严格协议下的完整实验结果
表3:严格协议下各模型的完整实验结果。RMSE单位为W/m²,FS为相对智能持久法的技能提升。金色、银色和青铜色单元格分别标注各站点表现前三的视觉模型。NREL站点只有313个匹配测试样本,作为低数据压力测试报告,所有视觉行的技能分数均为负值,不应作为站点级骨干排名的依据。
从Folsom的结果来看,VMamba Small以65.39 W/m²的RMSE拔得头筹,紧随其后的是Swin Base,RMSE为65.50 W/m²。这两者的差距仅有0.11 W/m²——可以说是在同一个水平线上的"毫厘之争"。第三名是Spatial Mamba Small,RMSE为65.99 W/m²。作为对比,纯时序模型(temporal-only)的RMSE为69.51 W/m²,比最好的视觉模型差了约4 W/m²,这说明在Folsom这个数据充足的站点,视觉信息确实贡献了可观的预测增益。
但要提醒大家的是,这0.11的差距远不足以得出"VMamba Small完胜Swin Base"的结论。毕竟每次训练都有随机性,即便固定了随机种子,不同初始化也可能带来约0.1的量级波动。论文作者也非常克制地表示,这个结果应该被理解为"单种子(single-seed)严格条件下的对比",而不是统计学意义上的最终赢家。如果要下更硬的结论,需要做多次重复实验并给出配对置信区间。
更有意思的是次要指标。除了RMSE之外,论文还报告了平均绝对误差(MAE)和平均偏差误差(MBE)以及决定系数R²。结果如下表所示:
表4:代表性模型的次要指标
表4:严格测试输出中的代表性次要指标。RMSE、MAE和MBE的单位均为W/m²。可以看到VMamba S虽然RMSE最低,但MAE反而比Swin B高(31.61 vs 30.36),负偏差也更大(-3.38 vs -2.10),说明它预测值整体偏低的情况更明显。
这意味着,最低RMSE的模型并不一定在所有运营目标上都是最优选择。如果你的光伏电站更关心避免系统性低估(因为低估意味着备用容量准备不足),那负偏差更小的Swin B可能反而更适合。这提醒我们:模型选型不能只看一个指标,要结合具体应用场景来做多目标权衡。
除了预测精度,论文还给出了模型的计算效率和吞吐量数据。下图展示了Folsom站点在RMSE与FPS(每秒处理帧数)之间的权衡关系——左上角是理想区域,既精准又高效。
图2:Folsom站点精度-吞吐量权衡
图2:Folsom站点评估运行中精度与吞吐量的权衡关系。RMSE越低越好,FPS越高越好。VMamba S虽然RMSE最低,但并未处于高吞吐量边界上;ConvNeXt T和Swin T保持着大部分精度优势,同时帧率却高得多。
图中透露的信息量很大。VMamba S的FPS约168.5,这对于10分钟提前量的预测任务来说绝对够用,但如果你要同时处理几十个站点的摄像头数据,或者部署在嵌入式设备上,那ConvNeXt T(561.5 FPS)或Swin T(471.5 FPS)无疑更有吸引力。尤其是ConvNeXt T,在RMSE只比最佳差约0.86 W/m²的情况下,吞吐量却是VMamba S的三倍多,部署性价比相当突出。

从Folsom到NREL:数据量如何颠覆模型排名?

如果说Folsom的结果让我们看到了不同骨干在"充分数据"条件下的真实差距,那NREL站点的结果就是一次"极限施压"——把模型和数据之间最微妙的互动关系暴露得淋漓尽致。
先看看数据规模。NREL站点在经过图像匹配、日照过滤和40步历史检查之后,最终只剩580个训练样本、64个验证样本和313个测试样本。这是什么概念?Folsom的测试集有224,022个样本,NREL的测试集连Folsom的零头都不到。更重要的是,Folsom的采样间隔是60秒,40步历史大约对应39分钟;而NREL的采样间隔是10分钟,40步历史对应的时间跨度高达6.5小时。
表1:数据集统计
表1:经过图像匹配、历史检查和目标过滤后的数据集统计。Folsom的测试年份为2016年,共有224,022个测试样本;NREL的测试年份为2020年,只有313个严格匹配的测试样本。
在这个"饥饿游戏"般的设定下,结果出现了大反转:智能持久法反而成了最强基线,RMSE为17.48 W/m²,所有视觉模型的技能分数都是负的。最低的视觉RMSE由Swin Tiny取得,为23.76 W/m²,比智能持久法差了约6 W/m²。连纯时序诊断模型的RMSE(21.33 W/m²)都优于所有视觉模型。
这里的启示非常深刻:在数据极端稀缺的情况下,视觉模型不仅无法带来增益,反而会"拖后腿"。原因也不难理解——深度视觉模型动辄几千万甚至上亿的参数,在580个训练样本上很容易过拟合,学到的映射关系不够稳定,泛化能力自然无法保证。而智能持久法没有参数,天然不会过拟合,反而是数据稀缺时的"安全牌"。
更值得玩味的是NREL站点上的模型规模效应。在Folsom上,增大模型并不总是带来提升——ConvNeXt L反而比ConvNeXt T差,VMamba B比VMamba S差,MambaVision L比MambaVision T2差。这说明在固定融合头和有限训练预算下,更大的容量未必能被有效利用。在NREL上,这种"越大越差"的趋势更加明显。模型容量的边际收益在数据不足时会迅速衰减,甚至转为负值。这个现象在迁移学习和低资源学习中其实很常见,但在一篇做基准对比的论文里被如此直观地展示出来,还是很有说服力的。
还有一个细节值得关注:NREL的40步历史窗口长达6.5小时,这本身就包含了极强的持续性信息。对于一个10分钟提前量的预测任务来说,6.5小时的历史足够让任何时序模型"躺赢"——毕竟云的移动是有惯性的,短时间内辐照度不会发生剧烈跳变。但一旦天气状况发生突变(比如阵雨前锋的边界扫过),历史窗口再长也无济于事。这时才真正需要天空图像来提前感知云况变化。因此,NREL的结果并非说明"视觉信息无用",而是说明"在持续性占主导的平稳天气下,视觉信息带来的增量被过拟合的噪声淹没了"。

有效感受野揭秘:不同骨干如何"看"天空?

除了精度和效率,论文还做了一个非常直观的定性分析——把不同骨干网络在固定预测头下的有效感受野(Effective Receptive Field, ERF)画出来叠加在天空图像上。有效感受野可以理解为"模型在做预测时,实际上"看"了图像的哪些区域"。这有点像给模型做一次"眼动追踪",看看它在做判断时到底关注哪里。
图3:代表性模型的有效感受野叠加
图3:固定预测头下代表性模型在Folsom样本上的有效感受野叠加图。ConvNeXt T在整个天空穹顶上有弥散的响应;Swin B更紧凑且居中;VMamba S的灵敏度分布更广且包含非中心区域;MambaVision T2介于Swin与VMamba之间。ERF覆盖模式仅表明不同骨干在固定头下聚集空间上下文的方式不同,不构成因果性结论。
从图3可以看到几个有趣的模式。ConvNeXt Tiny的响应面积最大、分布最弥散,几乎覆盖了大部分天空穹顶区域——这符合卷积网络局部连接但层层堆叠后感受野逐步扩大的特性。Swin Base的响应更加紧凑且集中在图像中心——这与窗口注意力的设计一致,注意力机制倾向于聚焦在最有判别力的区域。VMamba Small则呈现出更广的分布,且包含了一些偏离中心的位置——选择性状态空间的扫描路径可能捕捉到了更多方向性的云层运动线索。MambaVision T2恰好介于Swin和VMamba之间,显示出混合架构的空间聚合特性。
这些ERF模式能用来解释预测性能差异吗?可以,但要小心。比如,如果某块云是从图像边缘方向飘来的,那一个倾向于关注中心区域的模型(如Swin B)可能响应较慢;而一个空间覆盖更广的模型(如VMamba S)则可能更早捕捉到边缘云况的变化。当然,论文的作者也很谨慎地指出,ERF覆盖模式只是"表明不同骨干在固定头下聚集空间上下文的方式不同",并不构成因果性结论。换句话说,ERF更像是一扇观察窗口,让我们看到模型内部的"注意力风景",但要想精确解释每个区域的贡献比重,还需要更精细的归因分析工具。

受控基准的启示:预测精度之外的效率与泛化考量

聊完了具体数据,我们把视角拉高一些,看看这个受控基准对整个太阳能预测领域意味着什么。
第一,效率指标应该成为论文的"标配"。这篇论文做了很好的示范:除了RMSE和技能分数之外,还额外报告了参数量、FLOPs、FPS和ERF。这些指标对于工程选型非常有价值。如果你是一家光伏运维公司的算法工程师,看到"ConvNeXt T 561.5 FPS,RMSE仅比最优差0.86 W/m²"这样的信息,你就有底气向领导建议选择效率型模型——毕竟多台设备的实时预测需要的是综合性价比,而非单点精度。
第二,"模型越大越好"的惯性思维需要警惕。Folsom站点上的结果就毫不留情地打破了这个幻想:ConvNeXt L反而比ConvNeXt T差,VMamba B比VMamba S差,MambaVision L比MambaVision T2差。在标量回归任务中,当融合头和训练预算固定时,更大的骨干网络可能是"杀鸡用牛刀",不仅没能发挥容量优势,反而增加了过拟合风险。这个发现对工业界尤其重要——不要盲目追大模型,先用小模型跑通流程,再根据实际收益决定是否扩容。
第三,跨站点的"迁移"要谨慎。Folsom和NREL的结果差异已经说明,一个站点上排名靠前的模型,在另一个站点上可能排名垫底。站点间的差异不仅来自地理位置和气候模式,还来自数据采样频率、样本数量、天气分布等多个维度。因此,论文明确建议在跨站点迁移时,要把简单基线和匹配样本条件作为必查项,而不是直接照搬之前的排名。
第四,也是最本质的一点:受控基准的价值是给出"边界清晰的操作点",而不是给出"全局最优解"。论文通篇都保持了这种克制——排名差异小的时候就说差异小,数据不够就不做过度的统计推断。这种研究态度在当下"刷点至上"的学术环境里显得格外清醒。它告诉我们的不是一个"冠军模型",而是一个方法论:如何设计一个能真正回答"视觉骨干选择对预测性能有多大影响"这个问题的实验方案。任何在类似场景做模型选型的团队,都可以直接复用这个协议,把自家数据跑一遍,得到属于自己的结论。
当然,这个基准也有明显的边界。论文自己就承认,固定融合头和时间分支是一种"保守"的选择,它最大化可比性,但可能并不能让每个骨干都发挥出全部潜力——某些骨干在网络容量更大或融合方式更适配时,也许会有更好的表现。另外,所有结果都基于单种子运行,虽然论文从协议设计上论证了效率结论与种子无关,但精度排名仍需要多种子重复确认。这也正是论文在结论部分强调的:下一步不是加更多骨干,而是用重复实验、配对置信区间、天气条件分层等方法,把现有基准的证据强度做扎实。这些扩展方向对任何想做"公平对比"的研究者来说,都是相当实用的参考清单。

龙迷三问

下面是龙哥对于大家可能的一些问题的解答:
这篇论文到底在解决什么问题?斯里兰卡佩拉德尼亚大学提出受控视觉骨干基准:固定多模态预测流水线,仅替换图像编码器,系统对比CNN、Transformer与Mamba三大架构在10分钟太阳辐照预测中的表现。
这篇工作最值得看的点是什么?Folsom上所有视觉backbone均优于智能持久性,VMamba S取得最低RMSE 65.39 W/m²(技能19.64%),Swin B紧随其后(65.50 W/m²);NREL上智能持久性最强(17.48 W/m²),Swin T取得最低视觉RMSE 23.76 W/m²。
这篇工作的边界或风险在哪里?优点:1)严格的受控对比协议,仅变化视觉backbone,隔离变量清晰;2)引入智能持久性和时序-only诊断作为基线,提供多维度参照;3)涵盖CNN、Transformer、SSM三大类视觉backbone,对比全面;4)报告效率指标(FPS、FLOPs)和ERF可视化,兼顾部署视角。缺点:1)单种子运行,缺乏统计显著性验证;2)固定融合头可能对某些backbone不友好;3)NREL数据量过少(313样本),结论外推受限;4)未进行超参数搜索,可能低估某些backbone的潜力。
如果你还有哪些想要了解的,欢迎在评论区留言或者讨论~

龙哥点评

论文创新性分数:★★★☆☆研究定位是"基准评测"而非"新方法",贡献在于受控比较协议的设计和系统分析。创新点主要体现在实验框架的严谨性上,而非提出全新的网络结构或学习范式。

实验合理度:★★★☆☆固定所有非视觉组件的协议设计非常严密,减少了变量混淆。但所有结果基于单种子运行,精度排名缺少多次重复和置信区间,削弱了统计学上的说服力。

学术研究价值:★★★★☆为太阳能预测领域的骨干网络选择提供了可复现的参考框架,也为其他多模态预测任务(如风功率预测、负荷预测)设计受控对比实验提供了方法论借鉴。

稳定性:★★★☆☆Folsom上各骨干模型性能差距较小,说明在数据充足时稳定性尚可。但NREL小样本场景下视觉模型全部退化,反映出方法在数据稀缺时的不稳定性。

适应性以及泛化能力:★★★☆☆仅在Folsom和NREL两个站点验证,且站点间差异巨大。固定协议在跨站点时的适用性存疑,需更多站点的数据来验证泛化性。

硬件需求及成本:★★★★☆最轻量的ConvNeXt T仅需28.6M参数、18.5G FLOPs即可获得接近最优的精度,在常见GPU上能实时运行,部署成本较低。

复现难度:★★★★☆论文给出了详细的协议描述、数据集来源和评估指标,并提供了代码仓库(https://github.com/Oshadha345/irradiance benchmark),复现门槛较低。

产品化成熟度:★★★☆☆固定协议本身可以作为工程团队选型参考,但受限于单种子结果和站点数量,直接产品化仍需更多验证。不过效率指标的引入对工业界很有价值。

可能的问题:单种子实验不足以支撑精确排名结论;仅两个站点的验证限制了结论的普遍性;固定轻量融合头可能对部分骨干不公平;NREL严格分割样本量过小,统计功效不足;缺少对天空状态(如晴天/多云/阴天)的分层分析。


主要参考文献

[1] Z. Liu, H. Mao, C.-Y. Wu, et al. "A convnet for the 2020s," 2022. https://arxiv.org/abs/2201.03545
[2] Z. Liu, Y. Lin, Y. Cao, et al. "Swin transformer: Hierarchical vision transformer using shifted windows," 2021. https://arxiv.org/abs/2103.14030
[3] Y. Liu, Y. Tian, Y. Zhao, et al. "Vmamba: Visual state space model," 2024. https://arxiv.org/abs/2401.10166
[4] C. Xiao, M. Li, Z. Zhang, et al. "Spatial-mamba: Effective visual state space models via structure-aware state fusion," 2025. https://arxiv.org/abs/2410.15091
[5] A. Hatamizadeh and J. Kautz. "Mambavision: A hybrid mamba-transformer vision backbone," 2025. https://arxiv.org/abs/2407.08083
[6] A. Gu and T. Dao. "Mamba: Linear-time sequence modeling with selective state spaces," 2024. https://arxiv.org/abs/2312.00752
[7] Y. Nie, X. Li, Q. Paletta, et al. "Open-source sky image datasets for solar forecasting with deep learning: A comprehensive survey," Renewable and Sustainable Energy Reviews, vol. 189, p. 113977, 2024.
[8] 论文原文:A Controlled Visual-Backbone Benchmark for Multimodal Short-Term Solar Irradiance Forecasting. https://arxiv.org/pdf/2607.23633v1.pdf

融会贯通

把这篇论文放到PaperDaily已收录的论文库中横向观察,可以提炼出三条有意义的线索。
第一条是"受控比较"正在成为视觉骨干评测的新范式。此前该团队在遥感图像分割任务中也采用了类似的受控骨干对比框架,结论同样是"不同骨干在领域偏移和边界敏感性上差异显著"。把这一结论与本文在太阳能预测上"精度差异不大、效率差异显著"的发现对照,可以看出:骨干网络的选择对任务的最终影响,与任务本身的数据规模、目标复杂度和评价维度高度相关。单一任务上的"冠军模型"很难直接迁移到另一个任务上。
第二条是"效率维度"正在从加分项变成必选项。无论是遥感还是太阳能预测,单纯堆精度已经不能满足部署需求。本文把FPS、FLOPs和参数数量纳入基准协议,正是对这一趋势的响应。对于从事相关工程实践的读者,强烈建议在评估模型时参考这套多维指标体系。
第三条是"简单基线不过时"。智能持久法在NREL小样本场景下吊打所有深度模型,这个结果本身就是对"无脑上深度学习"倾向的警示。在数据稀缺、场景单一的情况下,先跑通简单基线再做增量改进,才是务实的工程路径。任何时候都不要低估简单基线的价值——它既是最低保障,也是衡量复杂模型增益的标尺。

*本文仅代表个人理解及观点,不构成任何论文审核或者项目落地推荐意见,具体以相关组织评审结果为准。欢迎就论文内容交流探讨,理性发言哦~ 想了解更多原文细节的小伙伴,可以点击"阅读原文",查看更多原论文细节哦!


转发文章 微博 X LinkedIn Facebook
龙哥读论文 · PaperDaily

本文基于龙哥读论文 PaperDaily 数据库整理,结合论文原文与工程视角进行解读。

LONGGE AI COMMUNITY

把每天读到的论文,变成长期积累

加入「龙哥读论文」知识星球,持续获取 AI 论文、资讯、开源项目、招聘与研究思路。

加入龙哥读论文微信群:添加微信 kangjinlonghelper,备注“研究方向 + 地点 + 学校/公司 + 昵称”。

龙哥读论文知识星球二维码 微信扫码加入知识星球