论文基本信息
原文标题:Genesis: A Generative Engine for Hierarchical Satellite Image Synthesis
首次公开:2026年9月2日(arXiv v1)
原论文链接:https://arxiv.org/abs/2609.02683v1
论文许可:CC BY 4.0
龙哥导读
Genesis把“一张图放大”和“一张图向外补”接进同一套四叉树调度,让稀疏种子长成可连续缩放的地图金字塔。论文超分协议中,Genesis-H六组LPIPS、DISTS、FID全领先,超分FID为9.2—14.8;这不是地理真实性分数。
先看最直观的结果。下图展示三个地点在缩放级别16上的外扩,每个地点只给1—3个红框种子,其余大片区域由模型补全;上排与下排分别是不同站点,不是“生成前、生成后”的时间序列。
图1:Genesis外扩定性结果。三列从左到右分别以1、2、3个红框种子启动;红框内是被保留的已知图块,框外是生成补全。树林、道路、农田与工业区在大范围上能够延续,但该图只能说明这些样例具有视觉连贯性,不能证明框外内容对应当地真实观测。
先看三组核心结果
六组全胜
六个超分split/zoom组,LPIPS、DISTS、FID均领先;论文超分协议下FID 9.2—14.8。
八格全胜
两个split × 四种mask的八个外扩cell,FID、LPIPS、B-diff均领先。
13.46 → 10.30
超分消融中,同时加入DINOv3条件与LPIPS后,FID降至10.30。
问题也由此变得具体:如果只补一圈,普通外扩模型已经能做;如果只把一块图放大,超分模型也能做。可一张在线地图要求用户既能平移,又能不断缩放,细层图块必须继承粗层布局,相邻图块还不能在边界处突然断路、变色或换地貌。
一、Genesis补的缺口:不是一张图,而是一整棵地图
卫星地图天然是多尺度系统。缩放级别较低时,一块图覆盖很大范围;向下进入更高缩放级别时,一个父图块分成四个子图块,每个子图块覆盖父图的一个象限,同时显示更细的纹理。
论文把目标定义为“多尺度图块补全”:输入是一组位于任意缩放级别和任意位置的种子图块,输出是目标子树中的全部图块。系统同时满足两类约束:纵向上,父节点应等于四个孩子拼接后下采样的结果;横向上,同一层的邻居应自然接合。
图2:论文任务总览。左侧不同高度的平面代表不同缩放级别,红框标出分散的输入种子;中间箭头表示Genesis执行补全;右侧每一层都被填满,并沿虚线保持父子覆盖关系。它表达的是任务目标与输出形态,不能单凭示意图证明所有层已达到无缝或真实一致。
以前的卫星生成大多只沿一条轴工作。超分沿“纵轴”走,把一个图块变细;inpainting、outpainting与MultiDiffusion式方法沿“横轴”走,在同一尺度扩展画布。Genesis把研究对象从孤立图像改成统一四叉树,因而第一次把“放大后要像父层”和“扩边后要接得上邻居”放进同一个系统问题。
二、第一条数学主线:把噪声沿速度场推回图像
Genesis的超分与外扩不是同一个模型共享两种按钮,而是两个独立训练的像素空间JiT流匹配Transformer。它们都直接处理像素token,避免先把卫星图压进VAE潜空间再解码时可能引入的信息瓶颈,但也意味着高维像素生成本身计算不轻。
公式卡①:从噪声到干净图像的直线路径
x̃τ = τx + (1−τ)ε, τ∈[0,1]
x是干净图,ε是高斯噪声,τ是流时间。先采x与ε再线性混合:τ从0走到1,输入由纯噪声靠近干净图。直觉是定义一条易学习的直线路径;它只规定运输路径,不保证生成内容地理真实。
路径速度为v=x−ε。网络先预测干净图xθ,再换算vθ=(xθ−x̃τ)/(1−τ);也就是输出图像、监督方向场。
公式卡②:速度损失与采样更新
L = Eτ,x,ε[ ||vθ−(x−ε)||² ]
x̃τ+Δτ = x̃τ + Δτ·vθ(x̃τ,τ)
顺序是噪声→估计速度→Euler前进一步→重复至τ=1;K是Euler步数,Δτ=1/K。作用是把方向场积分成图像;K越大步子越细,但模型误差仍会在跨层调用中累积。
这里的关键不是“扩散模型换了一个名字”,而是两个空间操作共享同一种可组合的生成底座:超分学父到子的速度场,外扩学已知区域约束下孔洞内部的速度场。统一训练语言让调度器能把两者串起来,但不会自动保证串联后的全局一致性,后面仍需要重锚定、重叠融合和确定性回扫。
三、垂直算子:一个父图块,长成四个孩子
设缩放级别z上的父图块为N×N。垂直超分算子不是只输出某一个孩子,而是一次生成2N×2N的完整马赛克,再按四个象限切成z+1层的四个N×N子图块。这样,四个孩子在生成时能彼此看见,比独立生成四块更有机会保持道路与纹理连续。
公式卡③:四叉树父子映射
SR: tile(z,x,y)∈RN×N×3 → mosaic(children at z+1)∈R2N×2N×3
parent = BicubicDownsample(stitch(child00,child01,child10,child11), ÷2)
顺序是父图生成2N马赛克、切成四个孩子;反向则拼接孩子并双三次下采样。向下可产生多种细节,向上不创造信息;它可缩小非种子节点的父子冲突,但种子优先保留,不能保证整棵树无条件一致。
父图对生成有两路条件:一路是父图的像素patch token,负责局部颜色和布局;另一路来自冻结的卫星领域DINOv3,提供较高层语义。流时间τ与目标缩放级别z还会被嵌入到AdaLN条件中,让同一模型知道自己处于哪一步、正在生成哪种尺度。
训练时不一定四个孩子都可用,因此速度损失只在已观测像素上计算。除此之外,论文加入按象限计算的LPIPS感知损失,直接比较每个预测孩子与真实孩子的特征距离,避免只优化像素或速度后得到结构正确但视觉发糊的结果。
公式卡④:掩码速度损失 + τ加权LPIPS
LSR = E[Σpmp||vθ−v||²p/Σpmp] + λperc·E[τΣqmqLPIPS(xθ(q),x(q))] / E[τΣqmq]
p索引像素,q索引四个孩子,m标记哪些像素或象限有真值,λperc=0.5。先对可见像素算速度误差,再对存在真值的孩子算LPIPS;乘τ意味着更强调接近干净端的样本,因为此时网络预测的xθ更可靠。局限是LPIPS奖励感知相似,不等价于地理对象逐像素真实。
超分训练还采用由易到难的缩放课程:先学较粗父层,再混合粗细尺度,最后覆盖全部缩放级别与完整四象限。DINOv3偏向稳定语义,LPIPS推动感知质量;两者作用会在实验部分细拆。
四、水平算子:灰色孔洞有四种,不是随便涂一块
水平外扩算子把一个N×N图块分成四个象限,允许其中任意一部分已知、其余部分待生成。二值掩码h在孔洞像素处为1、已知像素处为0;噪声只注入孔洞,已知区域始终保持干净。
图3:四种单图块外扩掩码。彩色卫星区域是已知输入,灰色区域是待生成孔洞;从左到右依次为已知三象限、已知两个相邻象限、已知两个对角象限、只知一个象限,对应孔洞25%、50%、50%和75%。相邻双象限提供连续边界,对角双象限提供两块分离锚点,最后一种上下文最少、难度最高。
模型条件由七个通道拼成:三通道的“孔洞加噪、已知区干净”图像,一通道掩码h,再加三通道的(1−h)⊙x已知内容。它们被patch化后送入每个Transformer块的交叉注意力,而且注意力限制在已知patch上,避免模型把尚未生成的孔洞误当成条件。
公式卡⑤:外扩输入、孔洞损失与已知区重置
context = concat(x̃τ, h, (1−h)⊙x)
LOP = E[Σphp||vθ−v||²p/Σphp]
每个Euler步后:x̃τ ← h⊙x̃τ + (1−h)⊙x
先构造七通道条件,再只对孔洞像素计算速度误差;每走一步,都把已知区域原样写回。最后一行是“硬锚点”:保证种子不随采样漂移,但它只能固定已知像素,不能保证远处生成语义一定正确。
课程学习同样从易到难:先补25%孔洞,再补两种50%孔洞,然后挑战75%孔洞,最后混合全部模式。实验中孔洞越大越难,Genesis-H的FID从quad3约3.2,上升到quad2约8,再到quad1约17,符合“可用锚点越少,不确定性越大”的直觉。
四种mask不是为了凑四个测试格,而是在模拟调度器真正会遇到的上下文形状。当生成从种子向外传播时,有时窗口三面已有内容,有时只碰到一角;如果模型只会规则的单侧扩边,整张大图很快就会卡住。
五、核心方法图:六步把两种算子编成一台引擎
有了超分和外扩,还不等于有Genesis。真正决定整棵树如何长出来的是调度器:它先选一个“工作层”,把所有种子投影到同一分辨率,在这一层完成横向补全,再向叶子逐层超分,最后从细到粗回扫。
图4:Genesis框架。①蓝、紫、橙边框是不同层和位置的种子;②经下采样或超分带到工作层D−r;③红色滑窗按已知象限最多优先外扩;④补全工作层;⑤重叠超分到叶层;⑥向上双三次回填非种子粗层。图中是算法顺序,不是一次端到端前向。
工作层记为zD−r,D是目标子树深度,r表示它距离叶层还有几级。r大,工作层更粗,外扩网格更小,系统更多依赖后续超分;r小,工作层更细,外扩承担更多高分辨率幻觉。论文系统设置取r=1,即在倒数第二层完成主要横向补全。
第二步是“最大覆盖外扩”。调度器把画布看成半图块大小的象限网格,用一个覆盖2×2象限的窗口以半图块步长滑动;每轮优先挑已知象限最多、彼此不争用单元格的窗口批量生成。新补出的象限立刻成为邻居的条件,于是内容像水波一样从种子向外传播。
第三步不是逐块独立超分,否则边界会各算各的。Genesis在拼接后的整幅马赛克上运行MultiDiffusion式轨迹:256×256窗口重叠32像素,并在每一步把各窗口速度按平台形权重融合,窗口内部权重大、重叠边缘逐渐衰减。
这一步还采用双三次warm start:先把父层插值放大,再把它加噪到τ=0.4,从中间状态继续生成,而不是从纯噪声完全重画。已知叶子种子在每一步按对应噪声等级重新锚定,既保留原输入,也让周围窗口围绕它协调。
第四步专门修缝。系统计算叶层内部边界的平均像素不连续度,从最差边界开始,在缝中心放置256×256窗口,遮住宽64像素的带状区域,再用外扩模型重生成并以柔边掩码混回原图。它不是全局重跑,而是把计算集中在最明显的接缝。
最后从叶层向上双三次下采样,只回填非种子粗层;原始种子必须保留,工作层中未受修缝影响的部分图块也保持不变。这次“对账”缩小的是非种子节点的父子冲突,并不把细层宣布为绝对事实,也不保证整棵树无条件一致。叶层误差仍可能向被回填的粗层传播,确定性计算也不等于语义正确。
六、dense500:500棵完整四叉树,为什么每棵正好85块
要评估“补完整棵树”,只收集零散父子对不够。论文构建dense500:500个完整深度4四叉树,每个地点连续覆盖四个缩放级别,因此图块总数是1+4+16+64=85。
这500棵树又分成五个zoom window,每个窗口100个地理上不同的站点。窗口沿地图金字塔逐段下移,覆盖从约76米/像素到0.6米/像素的尺度,让同一任务同时面对大范围地貌和较细城市纹理。
“完整观测”意味着任意挑选种子后,未给模型的每一层、每一块都有对应真值可比较。它不仅能测单算子的LPIPS、DISTS、FID和边界差异,也能测整棵金字塔的跨层一致、光谱特征与空间连续。
dense500的价值不在“500很大”,而在每个站点都拥有完整的85块父子链。不过站点按人口密度加权并限制在城市单元,主要覆盖有人居住、细尺度影像更丰富的区域;它不能证明荒漠、极地、海岛或罕见地貌上同样稳定。
七、超分结果:标题里的9.2,究竟代表什么
超分评测有两个测试划分:random_test与spatial_test;每个划分再按孩子缩放级别分成z12—15、z16—17、z18三组,因此共有六个split/zoom组。Genesis-H在六组中都取得最低LPIPS、DISTS和FID,也就是三项感知或分布指标全部领先。
论文概括的超分FID范围是9.2—14.8;主表各组约9.41—14.85。SwinIR是32—47,ZoomLDM是42—70,差距横跨两个划分与三组尺度。
六组超分结论,应该这样读
• Genesis-H:超分FID约9.2—14.8,六组LPIPS、DISTS、FID均为最优。
• SwinIR:FID约32—47;Genesis-H的LPIPS在每组相对低约20%,例如z12—15为0.129对0.159。
• ZoomLDM:FID约42—70。FID衡量生成分布与真实分布的距离,越低越好,但它不是单张图的地理真实性分数。
还有一个看似矛盾的细节:双三次插值在多数PSNR、SSIM上最高,却在LPIPS和FID上明显落后。原因是插值忠实保留低频结构,因此像素误差小,但生成不出高频纹理;Genesis则更偏感知自然与分布逼真,未必逐像素最接近。
所以“FID低至9.2”准确表达的是:在论文的卫星超分协议与对应组别中,Genesis-H生成分布最接近真值分布。它不表示误差只有9.2%,也不表示生成地区有91%的地理事实被恢复,更不能直接跨数据集与其他论文的FID横比。
消融证据:两类条件缺一不可
无DINOv3、无LPIPS:FID 13.46;只加DINOv3:12.74;只加LPIPS:11.12;两者合用:10.30,且LPIPS、DISTS最佳。语义条件稳定结构,感知损失带来更大的分布改善。
八、外扩结果:八个格子全赢,边界指标比“看着顺”更关键
外扩证据:两个划分 × 四种mask
random_test与spatial_test各评估quad3、相邻quad2、对角quad2、quad1。Genesis-H在八个split/mask cell的FID、LPIPS、B-diff全部领先,对手包括SD2-Inpaint、SD2-Inpaint+Text与Text2Earth-Inpaint。
B-diff尤其值得关注。普通图像补洞只要整体像就可能过关,但Genesis要连续调用外扩,孔洞边界的一点色差或纹理错位会被复制到更大范围;边界差异低,才有资格成为可链式组合的水平算子。
从数字看,random split中Genesis-H的FID约为3.23、8.20、8.05、16.99,对应孔洞从25%扩大到75%;spatial split也非常接近。Text2Earth-Inpaint在最难quad1约为19.34与19.91,而SD2系列超过30,说明卫星领域专门建模与训练mask课程确实有效。
这些指标不代表外扩地貌真实:离开已知区域后,模型做的是条件生成,评价的是统计相似与接缝连续,不是观测真实性。
九、与TerraGen、COP-GEN-Beta相比,Genesis到底多了哪一维
TerraGen关注的是layout-conditioned遥感数据增强:先给道路、建筑、地物布局等结构条件,再生成与布局匹配的遥感图像。它解决“怎样按指定空间布局制造训练样本”,控制性强,但核心对象仍是给定布局下的图像生成,不负责把任意稀疏种子递归组织成完整缩放金字塔。
COP-GEN-Beta强调对Copernicus多传感器影像缩略图进行统一生成建模。它把不同传感器或观测模态纳入一个生成框架,回答“多源地球观测缩略图能否由统一模型生成”;但缩略图生成与四叉树父子一致不是同一问题。
Genesis补上的环节,是递归缩放金字塔的一致性。它不以布局条件替代地理种子,也不以传感器统一替代空间层级,而是明确规定父节点、四个孩子、相邻图块与调度顺序,让生成结果可以被连续平移和缩放。
三者对应的是三种不同控制轴:TerraGen控制“画什么布局”,COP-GEN-Beta控制“以什么观测模态生成”,Genesis控制“怎样跨空间与尺度长成一棵一致的树”。未来真正强的地球生成引擎,很可能需要把这三类控制合并,而不是选一个淘汰另外两个。
十、它能做什么:从稀疏素材到可浏览的假想世界
第一类价值是游戏、模拟器和数字环境。团队可能只有少量区域素材,却需要大范围、可连续缩放的背景地图;Genesis式系统能把素材扩成结构连贯的多尺度世界,比逐尺度手工生产更适合快速原型。
第二类是“如果这样规划会怎样”的假想城市布局探索。种子可以作为必须保留的局部锚点,模型补全周围合理环境,再通过金字塔提供从区域到街区的浏览体验。这里输出是设计空间中的候选,不应包装成真实未来预测。
第三类是遥感训练数据生成。过去增强方法常在单一分辨率上制造图像,Genesis让同一合成场景拥有父层与子层,可用于研究跨尺度检测、检索、变化分析和多分辨率表示。不过训练数据是否真的改善下游任务,仍需任务级实验,而不是只看FID。
龙哥觉得,它最值得关注的不是“自动造一张卫星图”,而是把生成结果做成一种可遍历的数据结构。从平面图像到四叉树,意味着系统开始考虑地图产品真实使用时的缩放、拼接、缓存与层级关系,这比单张惊艳样例更接近基础设施。
十一、局限集中看:四个问题决定它能不能被认真使用
第一,生成区域是合理幻觉,不是真实观测。红框外即使道路、森林和建筑看起来顺,也不能用于确认某地真实存在什么。任何测绘、灾害评估、环境执法或安全决策,都必须回到有时间戳、有传感器来源的原始影像。
第二,单种子场景容易语义漂移。只有一小块上下文时,模型不知道远处究竟应延续城市、农田还是森林,生成语义可能逐步离开真值。图1左列视觉上连贯,只能说明“像一种可能世界”,不能说明它找回了缺失世界。
第三,dense500偏向人口区域。这种选择符合高分辨率影像供给与应用需求,也让城市纹理得到充分评估;但人口稀疏地区、极端气候区和异常地貌的分布更不同,现有结果不足以外推。
第四,迭代组合会积累误差。一次超分中的细小道路偏移,可能在下一层被继续细化;一次外扩的语义选择,也会成为后续窗口的新条件。重叠融合、修缝与自底向上对账能缓解边界和父子冲突,却不能把早期错误变回真实内容。
十二、龙哥点评:重要的不是把地图补满,而是知道哪一层该生成
Genesis的方法里,最漂亮的部分不是某个单独网络,而是让生成与确定性操作分工:横向未知内容交给外扩,纵向细节交给超分,再以保留种子为前提,用自底向上下采样回填非种子粗层、缩小父子冲突。
这是一种很有工程味的判断:不是所有步骤都需要生成模型。能确定计算的地方就确定计算,只有信息缺失处才承担生成不确定性;再通过调度顺序把不确定性限制在最合适的尺度上。
工作层D−r就是这套系统的“风险旋钮”。层选得粗,外扩范围小、效率高,但后续超分要连续猜更多细节;层选得细,已知种子可能约束更直接,却要在更大网格上生成,接缝与计算成本都会上升。
长期看,生成地图的竞争点不会只是谁的单图FID更低,而是谁能把来源、尺度、置信度、父子一致和用户交互一起纳入系统。Genesis给出了四叉树调度的第一块较完整拼图,但“合理生成世界”与“可信描述世界”仍是两条必须分开的产品路线。
十三、龙迷三问
第一问:Genesis能把一张低清卫星图恢复成真实高清图吗?
不能这样理解。超分受到父图和语义特征约束,指标显示输出更接近真实图像分布,但缺失的高频细节没有唯一答案。它生成的是合理细节,是否对应真实屋顶、道路或车辆,必须由真实高分辨率观测确认。
第二问:为什么不直接在最高分辨率把整张大地图一次生成?
最高分辨率画布巨大,直接生成成本高,也难利用地图天然的父子结构。Genesis先在工作层横向补全,再逐层增加细节,既缩小外扩网格,也让粗布局成为后续条件;代价是多次调用会产生累计误差。
第三问:FID低至9.2,是否已经足够用于真实业务?
不够。FID只说明测试协议下的分布接近度,还要看区域类型、种子数量、接缝、跨层跳变、下游任务和错误成本。模拟与数据增强可以容忍合理幻觉,事实型遥感业务则必须禁止把生成区域冒充观测。
总结
Genesis提出多尺度图块补全:从任意位置、任意缩放级别的稀疏种子出发,补成一棵完整四叉树。它用垂直超分生成孩子、用水平mask外扩补同层未知区域;调度器完成种子对齐、最大覆盖外扩、重叠超分与修缝,最后在保留种子及部分未受修缝影响的工作层图块的前提下,回填非种子粗层、缩小父子冲突。
实验上,dense500提供500棵深度4完整四叉树、每站点85块与五个zoom window;Genesis-H在六个超分组的LPIPS、DISTS、FID全部领先,超分FID约9.2—14.8,在八个外扩格的FID、LPIPS、B-diff也全部领先。
它把卫星生成从“做一张像真的图”,推进到“生成一套可连续浏览的层级结构”。但结构一致不等于地理真实:框外内容仍是生成,单种子会漂移,城市偏置限制外推,迭代误差会累积。把它用于创造世界,可以大胆;把它用于描述现实,必须克制。
本文基于龙哥读论文PaperDaily数据库及PaperMiner的MCP进行汇总整理。论文图1至图4均来自Genesis论文作者,依据论文CC BY 4.0许可,用于论文评述与方法说明;图注为本文依据原图和论文正文所作解释。
原论文:
https://arxiv.org/abs/2609.02683v1
许可说明:
https://creativecommons.org/licenses/by/4.0/
本文为论文解读,不构成对所有地区、数据与业务场景的效果保证。论文主张主要依赖大规模训练,本文未进行模型复现;生成卫星区域不得冒充真实观测,高风险用途请以原始影像、任务级验证与人工复核为准。