← 返回 PaperDaily
大模型与智能体
一次预训练让检索大涨55%?遥感基础模型的“成分感知”新范式
很多人第一次看卫星图会觉得诧异:为什么遥感基础模型的检索效果总是不如预期?明明模型参数已经加到几亿甚至几十亿,预训练语料也够大,遇到“港口”“农田”“城市”这类场景,还是经常把完全不同的图像混在一起。
龙哥读论文
发布于 2026-09-12 16:54:33
阅读 1
查看原文
原论文信息如下:
很多人第一次看卫星图会觉得诧异:为什么遥感基础模型的检索效果总是不如预期?明明模型参数已经加到几亿甚至几十亿,预训练语料也够大,遇到“港口”“农田”“城市”这类场景,还是经常把完全不同的图像混在一起。问题的根源之一,可能不是模型不够大,而是预训练阶段看图的“视角”出了问题。
一张自然照片通常有一个明确的主角:一只猫、一辆车、一座桥。模型训练时只要学会抓住这个主体,基本就能得到靠谱的表征。可卫星影像完全不是这个逻辑。一个512×512像素的“单元”里,可能同时包含水面、码头、仓库屋顶、船体、道路标线等多种地物。换句话说,卫星图是典型的“多概念混合体”,而不是单主体画面。遗憾的是,现有主流预训练范式,无论是基于掩码自编码器,还是基于全局对比学习,都默认把一张图当成一个整体语义来处理,这就难免陷入“盲人摸象”的困境。
先简单回顾一下两类主流预训练方法为何会“漏掉”混合信息。掩码自编码器一类的方法,比如Prithvi、SatMAE,预训练目标是重建被掩蔽的像素块。遥感影像中大量区域是相似且冗余的背景纹理,模型把大量容量花在背背景纹理上,却没有刻意去学习地物之间的构成关系。全局对比学习一类的方法,比如SeCo、Sky-Sense,则把一张图的区域特征压成一个全局向量,再做正负样本拉近推远。如果一张图里60%是水面、40%是建筑,池化之后得到的向量既不能代表“水”,也不能代表“建筑”。更麻烦的是,两类光谱内容完全不同但只要平均颜色相近的图,池化后可能得到几乎一样的向量。
针对这个问题,来自印度NITK等机构的研究者提出了一种组成感知预训练框架,核心思路是:不再让模型强行把一张混合场景“压扁”成一个单一语义,而是把每个影像单元看成一组局部视觉纹理的分布,让模型预测“这幅画面里有哪些地物、各占多少比例”。这套方法在零样本图像检索、场景分类等区域级理解任务上提升明显,而且只用了36.8M参数的骨干,就超过了303M参数的SatMAE和600M参数的Prithvi-EO-2.0。
从“整体”到“成分”:一种全新的组成感知预训练范式
这套组成感知预训练框架的第一步,是构造一个“视觉词表”。可以把视觉词表理解成一组能代表卫星影像中常见地物的“基础纹理单元”,就像字母表里的字母可以拼出各种单词,视觉词表中的每一个簇代表一种基础地物纹理。
具体做法分三步。第一步,把大规模预训练影像切成512×512像素的单元,再把每个单元切成256个32×32像素的局部小块。随后用一个冻结的DINOv3视觉Transformer把这些小块编码成语义特征。
由于特征提取是带上下文的,水边的一小块水域和开阔大洋中的一小块水域,得到的语义表达会不一样,DINOv3的自注意力机制会让每个patch token都感知到整张图的信息。论文对DINOv3输出的1024个空间token进行了2×2的平均池化,压缩成256个更高层语义token,为后续聚类和存储省下不少开销。
第二步,从整个预训练语料里均匀采样约500万个patch embedding,用GPU加速的K-Means算法聚成512个簇,每个簇的中心就是视觉词表里的一个“视觉词”。这里有个容易踩的坑:聚类前必须对每个token做L2归一化,否则聚类会受向量长短影响,亮水面和暗水面明明只是亮度不一样,却可能被分到完全不相关的簇里。
第三步,对每个影像单元生成“构成目标”。方法是把一个单元内的256个patch token,用软分配的方式映射到512个视觉词上。所谓软分配,就是每个patch不完全只属于某一个最近的簇,而是用径向基函数核,把权重分散到语义相近的多个簇上。最后把全单元所有patch的分配权重累加并做L1归一化,得到一个512维直方图。这个直方图就是论文所说的“构成目标”。它可以被理解成一张图的“地物配方”:既知道画面里有哪些基础地物纹理,也知道每种纹理大概占多少比例。
这种做法的好处是,模型不再用单一向量去概括一张图,而是用一个成分分布去描述整张图。两张整体光谱相近、但地物组合完全不同的图,会得到两个差异很大的构成目标,从而倒逼基础模型去学习更有区分度的特征。
三大分支协同训练:EMD蒸馏+MIL对齐+辅助分类的巧妙设计
构成目标生成以后,接着要训练基础模型去学会预测这个目标。论文选用的骨干是DynamicVis-Base,参数量只有36.8M。DynamicVis是一种面向遥感空间稀疏性的状态空间模型架构,它没有对所有token做等量计算,而是通过自适应token路由,把密集的Mamba计算集中在少数信息量最高的区域token上,背景token则走残差直连,既省算力又保留空间结构。
骨干输出的768维特征会同时送入三条分支。分支A是直方图蒸馏分支,负责让模型学会预测地物构成比例。它把一个MLP头和softmax作用在骨干特征上,输出512维的预测分布,然后用带语义代价的推土机距离来计算预测和目标直方图的差异。
这里的推土机距离,也叫EMD或Wasserstein-1距离,它不是简单逐位比较两个直方图每个bin的差值,而是允许分布中的“概率质量”在语义相近的bin之间搬移,搬移的量乘以搬移的语义代价。损失可以写成:LEMD = minT Σi,j Ti,j Ci,j,其中T是满足边际约束的最优输运矩阵,Ci,j是两个视觉词簇之间的余弦距离。直观地说,把“草坪”预测成“林地”只算小错,把“草坪”预测成“水面”就是大错,模型受到的惩罚会更大。
直接求解EMD代价较高,论文采用Sinkhorn-Knopp算法,给最优输运问题加上熵正则项,并转化为可通过并行矩阵乘法迭代求解的形式。这样就保证了训练时梯度的连续性和GPU上的计算效率。
分支B是多实例学习对齐分支。这里的多实例学习,英文全称是Multi-Instance Learning,通常缩写为MIL。一张大幅遥感影像被看作一个“包”,包里有大量局部实例,学习目标是让整个包与正确的类别语义对齐。论文采用MIL-NCE损失(Multi-Instance Learning Noise Contrastive Estimation),也就是多实例学习下的噪声对比估计损失,把区域视觉特征拉向对应的类别元嵌入,同时推远不相关类别。
其数学形式为:LMIL-NCE = -log [ Σ(v,t)∈P f(v,t) / ( Σ(v,t)∈P f(v,t) + Σ(v',t')∈N f(v',t') ) ],其中f(x,y)=exp(⟨x,y⟩/τ),⟨x,y⟩表示余弦相似度,τ是可学习温度。P集合包含正样本对,N集合则包含负样本对。这个损失是双向的:一方面视觉特征v要靠近正确类别嵌入t,另一方面类别嵌入也会被拉向所有带同类标签的批量实例,这正是“双向”的含义。
分支C是一个辅助分类头。关键细节在于,特征进入这个分类头之前先做了stop-gradient,也就是分离梯度。分类损失只更新它自身那层映射权重,不会把单标签分类的梯度回传到骨干里,以免破坏EMD和MIL分支已经学到的细粒度构成特征。这种“旁路分类稳定训练”的设计,既保留了一定判别信号,又防止单标签约束主导整体特征。
三个分支的损失按权重相加得到总目标:Ltotal = λemd·Lemd + λmil·Lmil + λcls·Lcls。其中EMD损失负责主导训练,MIL和CLS损失负责约束嵌入空间的整体拓扑结构。论文在消融实验中发现,三个分支缺一不可,去掉任何一个都会导致区域级任务指标下降。
实验大揭秘:36.8M小模型如何逆袭600M大模型?
预训练完成后,论文进入下游任务验证环节。这里有一个很关键的可信度设计:所有对比模型在下游任务评估时都保持骨干完全冻结,只训练轻量级的任务头。这样做能真实反映预训练表征的质量,而不是让微调能力掩盖表征本身的缺陷。
首先是零样本图像检索任务。零样本图像检索的意思是,给一张查询图,模型不需要任何额外训练,直接从大型无索引图像库里检索语义相似的图像。论文在AID航空影像数据集和ForestNet森林退化监测数据集上进行验证。
从表1可以看到,在AID数据集上,36.8M参数的组成感知预训练模型把mAP@10从DynamicVis-B的0.670一路拉升到0.808;而600M参数的Prithvi-EO-2.0只有0.638,303M参数的SatMAE为0.782。也就是说,这个“迷你模型”在检索任务上同时超过了体积大它好几倍的对手。
更具说服力的结果是ForestNet-12细粒度变体。这个数据集的样本常常混合原始森林、小型农业用地、基础设施和商业砍伐区等多种土地覆盖类型,正是对“构成分辨能力”的严苛测试。论文方法在ForestNet-12上的mAP@10从DynamicVis-B的0.279提升到0.434,相对增幅约55.6%,同时显著超过SatMAE和Prithvi-EO-2.0。这直接验证了显式构成建模对细粒度地物混合场景的价值。
检索任务之外,场景分类也是典型的区域级理解任务。论文在UC Merced土地利用数据集和NWPU-RESISC45遥感场景分类数据集上做了评估。从表2可以看到,组成感知预训练在场景分类中同样取得了超过基线DynamicVis的效果,最高约有7个百分点的准确率提升,依旧以36.8M参数与更大规模的SatMAE、Prithvi-EO-2.0直接竞争。
到这里,36.8M小模型反超大模型的故事已经足够令人印象深刻。但真正严谨的工作还需要回答一个现实问题:这种为区域级理解优化的构成建模,会让依赖像素级空间细节的任务付出代价吗?答案是有代价,但有代价这件事本身同样值得认真讨论。
权衡的艺术:区域理解大幅提升,像素级任务为何略有牺牲?
遥感基础模型的下游任务大体可以分为两类。一类是区域级理解,比如判断整张图属于港口还是公园、在大规模图库里查询相似场景,这类任务要求模型抓住“画面整体构成”。另一类是像素级密集预测,比如建筑物变化检测、小目标船舶检测、建筑物轮廓分割,这类任务要求模型精确保留微小目标的边界和空间结构。
论文在LEVIR-CD变化检测数据集、LEVIR-Ship小目标船舶检测数据集和WHU建筑物分割数据集上做了测试。结果显示,组成感知预训练在像素级任务上依然保持了足够的竞争力,但相较于原始DynamicVis基线,并没有形成像检索任务那样压倒性的优势。
在LEVIR-CD变化检测上,模型预测结果与真值的结构重合度较高,绿色部分代表被正确检测到的变化区域。这说明直方图构成建模并没有让模型完全丧失对局部变化的敏感度。
小目标船舶检测比变化检测更考验空间细节。船只在卫星图里往往只有几十个像素,一旦特征在整体池化过程中被稀释,就很容易漏检。论文在LEVIR-Ship上的结果说明,组成感知预训练没有显著牺牲这类任务的表现,但Small仍然不是它的舒适区。
为什么区域级任务大涨,像素级任务却不涨?原因在于构成目标本身是一种“压缩”表示。模型最核心的训练信号,是把256个局部patch聚合成512维直方图。这个动作天然丢弃了部分亚像素级别的精确空间位置信息,却留下了每种地物的类别和比例信息。对“画面里有什么、大概占多少”这类区域级问题,这种归纳偏置是极大的帮助;但对“建筑物精确边界在哪里”这类像素级问题,直方图聚类的信息瓶颈就会显露出代价。
论文也做了细致的消融实验来验证框架组件和超参数的有效性。在AID数据集上比较了不同视觉词表大小,在AID和ForestNet-4上分别比较了去掉不同损失分量后的效果。结论与设计直觉一致:K=512是精度和词表区分度之间的较好平衡点;EMD、MIL、CLS三个损失分量各自都有贡献,缺一个都会掉点。
龙迷三问
这篇论文到底在解决什么问题? 遥感基础模型一直把整张卫星图当成“一个概念”来学,忽略场景中复杂的土地覆盖混合。
这篇工作最值得看的点是什么? 在区域级理解任务上显著优于基线:AID数据集mAP@10从0.670提升至0.808(相对提升20.5%),ForestNet-12数据集mAP@10从0.279提升至0.434(接近翻倍),UC Merced分类准确率达0.928超过所有对比方法;在像素级任务上略有下降但保持竞争力。
这篇工作的边界或风险在哪里? 优点:(1) 创新性地提出成分感知预训练范式,显式建模卫星图像的组合性质;(2) 使用EMD损失结合语义距离矩阵,能区分轻微和严重预测错误;(3) 在区域级理解任务上效果显著,尤其在小参数下超越大规模模型。缺点:(1) 在像素级任务(变化检测、语义分割)上略逊于基线,存在分辨率-语义权衡;(2) 依赖离线K-Means聚类和DINOv3特征提取,流程复杂;(3) 仅处理3通道RGB图像,未扩展到多光谱数据。
如果你还有哪些想要了解的,欢迎在评论区留言或者讨论~
龙哥点评
论文创新性分数:★★★★☆ 把“单概念聚合瓶颈”明确为遥感基础模型的问题,并把视觉词袋直方图重新引入现代预训练框架,用EMD度量地物构成差异,思路新颖且组合方式不常见。
实验合理度:★★★★☆ 统一冻结骨干、覆盖区域级和像素级多类任务,并配检索定性结果、词表大小和损失分量消融,完整度较高;AID用5折交叉验证也提升了可信度。不足是与更近期的遥感基础模型横向对比还不够多。
学术研究价值:★★★★☆ 论文明确提出“遥感基础模型不该只学习单概念”这一观点,并把图像检索、场景分类这类区域级任务与像素级任务区分开来,对后续预训练目标设计有较强启发。
稳定性:★★★☆☆ 整体流程稳定,但多阶段依赖较强:视觉词表由冻结DINOv3生成,聚类质量会直接影响训练目标;若要适应新的地理区域,词表可能需要重新聚类更新,存在一定不确定性。
适应性以及泛化能力:★★★☆☆ 在区域级检索和场景分类上泛化突出,特别是细粒度ForestNet-12提升明显;但在变化检测、小目标检测和建筑物分割等像素级任务上只是保持竞争力,没有全面领先,泛化优势有一定边界。
硬件需求及成本:★★★★☆ 模型本身的训练与推理成本是可接受的,预训练只用两张H100;真正的一次性成本来自DINOv3特征提取和K-Means聚类,但属于离线步骤,整体成本可控。
复现难度:★★★☆☆ 论文作者表示代码实现可获取,但完整复现需要额外准备DINOv3预训练模型、fMoW全量数据预处理、离线特征池和词表聚类流程,整体工程链路较长。
产品化成熟度:★★★☆☆ 如果产品目标是以图搜图、区域场景分类、地物快速普查这类语义级理解,这套表征直接可用;如果业务本身对像素级边界有极高要求,则需要配合专门的下游分割头或检测头做针对性调整。
可能的问题: 论文部分表格没有给出明确的统计显著性或多次运行方差;检索评估集中在同源公开数据集,跨分布迁移能力验证略有不足;像素级任务的收益描述相对保守,需要读者在“区域级更强”与“像素级仍有保留”两种评价之间谨慎拿捏。
融会贯通
结合PaperDaily已收录论文可以观察到,AID和ForestNet-12上能够直接横向对比的公开数值并不算多,当前还不能把本文结果简单外推成“全领域绝对领先”。不同论文在预训练语料、数据划分、评估协议上常有差异,复现对比时尤其需要小心。
但本文给出的方向值得后续工作跟进:与其不断放大模型参数,不如先审视预训练目标是否真的匹配遥感影像“多类地物按比例混合”这一固有属性。尤其对森林退化监测、城市土地利用分析这类场景,一个能理解“成分”的基础模型,很可能比一个只会分辨“整图是什么类别”的大模型更有实用价值。
主要参考文献
[1] A Composition-Aware Pretraining Framework for Geospatial Foundation Models. arXiv:2608.30817.
[2] DynamicVis: 论文采用的高效动态区域感知状态空间模型骨干,相关对齐目标与路由机制详见原文引用[4]。
[3] SatMAE: 基于掩码自编码器的时间与多光谱卫星影像预训练方法,原文引用[6]。
[4] Prithvi-EO-2.0: 面向地球观测的大规模掩码自编码预训练基础模型,原文引用[17]。
[5] 原论文代码地址:论文摘要中标注的公开代码实现链接。
卫星图不是一张“大照片”,而是一份会呼吸的地物配方表。想搞懂遥感预训练、检索分类和新范式的小伙伴,欢迎进群把这套配方一起盘明白~
欢迎加入龙哥读论文粉丝群,
扫描下方二维码或者添加龙哥助手微信号加群 :kangjinlonghelper。
一定要备注:研究方向+地点+学校/公司+昵称(如 图像处理+上海+清华+龙哥) ,根据格式备注,可更快被通过且邀请进群。
『龙哥读论文』微信群目前包含:图像处理、大模型及智能体、自动驾驶及机器人、AI医疗及AI金融5个群
*本文仅代表个人理解及观点,不构成任何论文审核或者项目落地推荐意见,具体以相关组织评审结果为准。欢迎就论文内容交流探讨,理性发言哦~ 想了解更多原文细节的小伙伴,可以点击 "阅读原文", 查看更多原论文细节哦!