← 返回 PaperDaily
视觉与图像
伦斯勒理工最新方法:G*2-Net搭建双层图网络,用二阶优化学连接
病理图像分析中,细胞空间结构是关键诊断线索,但传统启发式图结构无法自适应学习。G*2-Net巧妙地将图像级图结构学习转化为二阶双层优化问题,用DARTS式一步展开避免高昂计算,在三个数据集上全面超越现有方法。值得关注的是,其可学习图结构为模型提供了更好的解释性。
龙哥读论文
发布于 2026-09-05 00:31:11
阅读 7
查看原文
原论文信息如下:
龙哥向来觉得,医学图像分析,特别是病理切片这种超大尺寸图像的分析,简直就是一场考验人类耐心和算力的极限挑战。一张全切片图像(Whole-Slide Image, WSI),动辄几万乘几万像素,你得把它切成成千上万个小补丁(patch),然后像拼图一样再拼回去做诊断。传统的做法,要么是挨个看补丁然后投票,要么是粗暴地拼成一个大特征图。但问题来了:细胞们不是孤立存在的,它们在组织里的空间排列、彼此挨得多近、是聚团还是分散,这些“空间结构”恰恰是病理学家判断良恶性的关键依据。
大多数已有的基于图网络(GCN)的方法,它们构建的图结构往往是固定的——要么用欧氏距离画个圈,要么做个德劳内三角剖分。就好比你给所有房子都规定必须修一条固定长度的路,不管邻居之间实际需不需要来往。这当然不靠谱,因为它引入了人为的偏向,无法自适应学习真正的、任务相关的组织连接。
来自伦斯勒理工学院(Rensselaer Polytechnic Institute)和纽约大学格罗斯曼医学院的团队,就试图解决这个核心矛盾。他们最近在arXiv上公开的论文 《A Hierarchical Framework for Graph Structure Learning in Histopathology Image Classification》 ,提出了一种名为 G*2-Net 的全新框架。这套框架的核心思想,用一个字概括就是:“学” 。它不再给切片预设一个固定的组织结构,而是让它自己去学习、去优化——哪些细胞小团体应该被连接起来,哪些不该连,完全由分类任务说了算。
组织病理学图结构学习的全新范式:G*2-Net
要理解这个“全新范式”,得先看看他们是怎么把一张巨大的WSI处理成药丸大小的。
首先,G*2-Net 把每一张WSI或大ROI切成重叠的补丁(patch)。在每个补丁内部,先利用一个预训练的StarDist2D模型来检测细胞核的质心。有了这些质心坐标,就能构建一个“细胞级图”(Cell Graph)。这个图的边是用一个简单的欧氏距离阈值来确定的——两个细胞质心靠得够近(比如小于64像素),就连一条线。这个级别是固定的,旨在捕获局部的、微观的组织架构,比如细胞是聚集成团还是散落分布。
然后,他们从这个细胞级图中提取了69维 的丰富结构特征,这些特征包括连通性、距离分布、谱特征,还结合了Voronoi图、Delaunay三角剖分、最小生成树和核最近邻特征。这个69维的向量,就代表了该补丁的“结构指纹”。
接下来进入最精彩的部分:G*2-Net 将这些补丁节点(patch nodes)视为“图像级图”(Image-level Graph)的顶点。核心任务就是学习这个图像级图的邻接矩阵——也就是决定哪些补丁之间应该存在连接。这不再是一个靠固定规则(如余弦相似度)拍脑袋的决定,而是一个可学习的、由任务驱动的过程。
二阶双层优化:分离图结构与分类器学习
先别被“二阶双层优化”这个听起来很唬人的名字吓到,龙哥给你拆解一下。
假设你要训练一个模型,模型里有两个大模块:一个叫“图结构生成器”(参数是ψ),它负责决定节点之间怎么连线;另一个叫“分类器”(参数是θ),它拿着这个图结构去预测最终的分类标签。传统方法通常是放在一起优化,让分类器自己去适应一个可能很差的图结构。
但G*2-Net的做法更巧妙。它把问题建模成了一个“学习如何学习” 的过程。它提出了一个双层优化问题,具体数学表达如下:
上层问题(Upper-Level): 最小化验证集上的损失 minψ Lval (θ*(ψ), ψ)
下层问题(Lower-Level): 找到最优分类器参数 θ*(ψ) = arg minθ Ltrain(θ, ψ)
翻译成大白话就是:给图结构生成器(ψ)一个任务——你生成的图结构,必须能让基于这个图结构训练出来的分类器(θ*),在它从未见过的验证集上表现得最好。
这就好比一个教练(上层)负责规划训练方案(图结构),而运动员(下层)严格按照方案训练。教练不看运动员在训练场上流了多少汗,而是看他最终在正式比赛(验证集)中拿没拿奖牌。如果没拿,说明训练方案有问题,教练就得改。这种分离,避免了模型一味讨好训练集,而忽视了真正的泛化能力。
这个上层更新的梯度,就叫做“超梯度(Hypergradient) ”,它包含了分类器参数对图结构参数的依赖关系,是一个二阶的、非常复杂和昂贵的计算过程。直接硬算的话,不仅要求解内层优化到收敛,还要算Hessian矩阵,这在深度学习里几乎是不可能的。
DARTS式一步展开:高效近似二阶超梯度
这里,论文巧妙地借鉴了神经网络结构搜索领域的一个经典方法——DARTS (Differentiable Architecture Search,可微架构搜索,由Liu等人于2019年提出)。DARTS的思想精髓在于“一步展开”(One-step Unrolled Approximation)。
具体做法是这样的:在每一步训练迭代中,他们不再把内层的分类器训练到完美收敛,而是只做一次梯度下降的更新,得到一个临时的分类器参数。
1. 一步展开(虚拟更新): θ̃t = θt-1 - ξ ∇θ Ltrain(θt-1, ψt-1)
2. 直接超梯度: dψ = ∇ψ Lval(θ̃t, ψt-1)
3. 二阶校正项(通过有限差分法近似): hψ ≈ [∇ψ Ltrain(θ+t, ψt-1) - ∇ψ Ltrain(θ-t, ψt-1)] / (2ϵ)
这里面,ξ和ϵ是超参数(学习率和扰动半径)。Gumbel-Sigmoid 重参数化技术也被用来生成可微的、介于0和1之间的随机连接强度,使得图结构的学习是平滑且可导的。
“自适应可靠性系数” (ρt)。这个系数用一个余弦相似度来衡量直接超梯度(dψ)和二阶校正方向(cψ)之间的一致性。如果两者方向一致,说明二阶信息可信,就给个大权重;如果方向相反,就认为这个二阶近似可能不稳定,给它降权甚至忽略。这种设计非常精巧,有效避免了有限差分近似可能引入的噪声。
三大数据集验证:全面超越CNN与GCN基线
理论说得天花乱坠,不如实验数据板上钉钉。G*2-Net 在三个差异巨大的公共病理数据集上做了验证:
数据集一(Extended CRC): 结直肠癌分级数据集,三分类(正常、低度、高度),来自华威大学,包含300张图像。
数据集二(Colon Cancer): 结肠癌数据集,二分类(癌/正常),来自浙江大学,包含717个ROI。
数据集三(Melanoma): 黑色素瘤数据集,二分类(富淋巴/富肿瘤),来自纽约大学朗格尼健康中心,包含1072个ROI。
对比的基线方法也相当有分量,包括了经典的CNN模型(如ResNet50、Xception、InceptionV3)和最新最强的图网络方法(如CGC-Net、HAT-Net、C2P-GCN)。
从表格可以清晰地看到,G*2-Net 在三个数据集的六个评价指标中,取得了其中五个的最优或并列最优结果,展现出了全面性。
在Extended CRC(数据集一) 这个最难的三分类任务上,G*2-Net 达到了96.33% 的平均准确率,比传统CNN里最好的Xception高了将近10个百分点,比GCN里最强的HAT-Net也提升了整整1个百分点。在Melanoma(数据集三) 上,它也以97.29% 的成绩登顶,证明了这个框架不局限于结直肠癌应用,对黑色素瘤这样的完全不同病理特征的图像同样有效。
在Colon Cancer(数据集二) 上,它的准确率是97.03% ,虽然略低于CGC-Net的97.68%,但仍然稳居第二,与所有基线方法相比极具竞争力。CGC-Net在这个简单二分类任务上的突出表现,可能得益于其多尺度聚合机制对这类数据比较契合,但这并不影响G*2-Net在更复杂任务上的优越性。
更值得注意的是方差 。G*2-Net 在大多数数据集上的标准差都是最小的(0.58%和0.89%)。这说明它不仅仅是“偶尔”跑得好,而是非常稳定,无论你怎么划分训练和测试集,它的表现都很坚挺。这对于临床诊断这种对稳定性要求极高的应用场景来说,是个非常关键的加分项。
消融实验揭示:学习到的连接性与补丁特征不可或缺
光看整体结果还不够,得看看是不是每个模块都在起作用。论文在数据集一上做了细致的消融实验,把结果扒开了看。
第一个消融实验:学习到的图结构,到底香不香?
他们把G*2-Net里学到的那一套邻接矩阵,换成了一个固定的、基于补丁特征余弦相似度的图。结果就是,准确率从96.33% 跌到了95.00% ,方差也从0.58%扩大到了1.70%。
这1.33个点的大幅下降,以统计学角度来看,是很显著的。它直接证明了“学习连接性”不是玄学,而是实打实地在起作用。固定规则定义的图(比如根据特征相似度),在面临复杂的、非线性的组织结构关系时,确实力不从心。而通过学习得来的图结构,才能更好地捕捉到那些对分类任务真正关键的、长程的全局依赖关系。
第二个消融实验:补丁特征的黄金组合。
前文提到,他们从补丁里头提取了69维特征,包括细胞图特征(CG)、Voronoi图特征(VD)、Delaunay三角剖分特征(DT)、最小生成树特征(MST)和核最近邻特征(NN)。那么单独使用每种特征会怎样?
结果一目了然。单一特征组的准确率纷纷跳水,最差的细胞图特征(CG)只有可怜的79.67% ,就算是表现最好的核最近邻特征(NN)也只有92.33% 。而把它们全部合在一起,准确率就是最高的96.33% 。这规律非常明确:单一的结构视角(比如只看细胞间的距离,或只看Voronoi多边形)都只能看到局部信息,容易以偏概全。当它们组合在一起时,就构成了一个互补的、多维度的组织结构描述,极大地丰富了对微环境特征的表征能力。
未来展望:联合优化两级图结构
目前的G*2-Net框架,焦点集中在优化“图像级”的图结构,而底层的“细胞级”图仍然是基于启发式的固定规则(即欧氏距离阈值)。这在当前阶段保证了计算上的可行性。但论文在结论中明确指出了下一步最有潜力的方向:联合优化两级图结构 。
这意味着未来的模型将不仅能学会“哪些补丁应该连在一起”,还能学会“每个补丁内部的细胞之间,哪些互动才是有意义的”。这无疑将更真实地模拟生物组织中的多层次、自适应连接机制。当然,这也意味着计算复杂度的进一步爆炸,如何平衡好表示能力与计算效率,将是后续研究的关键挑战。
龙哥觉得,这个方向也给了我们一个很有价值的启发:在真实世界的结构化数据中,无论是生物组织、社交网络还是交通流,单一的、固定的连接规则往往无法捕捉到复杂的动态交互。更高级的做法,应当像G*2-Net一样,把“如何连接”也作为学习的一部分。这种 “以任务为导向,让结构自适应数据” 的思路,值得我们移植到更多领域。
龙迷三问
什么是“二阶优化”?它可以怎么通俗理解? 文中的二阶优化,核心在于计算图结构参数ψ对验证集损失的梯度时,不仅要考虑ψ直接影响验证损失的部分,还要考虑ψ通过影响分类器参数θ*(而θ*反过来又影响验证损失)的间接影响 。这种间接影响的导数就是二阶导(或Hessian矩阵)。可以类比:教练不仅要知道训练方案的直接效果(一阶),还要知道方案对运动员状态的改变,以及状态改变又会怎么影响比赛成绩(二阶)。G*2-Net通过DARTS一步展开和有限差分法来高效近似这个昂贵的二阶信息。
Gumbel-Sigmoid和普通Sigmoid有什么不同?为什么这里要用它? 普通的Sigmoid函数将输入映射为0到1之间的确定值。而Gumbel-Sigmoid重参数化在计算过程中引入了Gumbel分布的随机噪声。这使得模型在训练时可以探索不同的连接模式(以概率形式采样),而不是立刻收敛到局部最优。随着训练过程进行,通过退火策略降低温度参数τ,采样会逐渐从“探索”模式退火到“利用”模式,最终得到一个确定的、离散的图结构。
G*2-Net的计算代价高吗?是否能在常规GPU上训练? 论文中明确讨论了计算代价。图像级图学习的复杂度是O(n2),其中n是补丁数。根据估算,一张WSI被切分成几百到一千多个补丁,对应的邻接矩阵内存占用在0.26MB到7.50MB之间。整个模型(分类器+生成器)的总参数量仅为0.86M ,是一个非常轻量的模型。因此,在大多数有GPU(如RTX 3080/3090)的实验室环境下,完全可以负担。这打消了很多人对高阶优化方法“很重”的顾虑。
如果你还有哪些想要了解的,欢迎在评论区留言或者讨论~
龙哥点评
论文创新性分数: ★★★★☆
采用二阶双层优化框架来自适应学习图像级图结构,思路新颖,脱离了传统图结构学习常用的单目标优化范式。结合了DARTS和Gumbel-Sigmoid、自适应可靠性系数等设计,也展示了较强的工程技巧。是从方法层面进行的有效创新。
实验合理度: ★★★★★
实验设计几乎满分。在三个领域内公认的标准数据集上进行评估,既包含三分类又包含二分类,既有结直肠癌又有黑色素瘤,覆盖面很全。对比方法包含了主流CNN和最新的GCN基线,消融实验逻辑严谨,分别验证了图结构学习和特征组组合的有效性。跨数据集的结果稳定性极具说服力。
学术研究价值: ★★★★☆
将神经架构搜索中的双层优化思想成功迁移到图结构学习并应用于医学影像,为图表示学习提供了新思路。二阶超梯度的近似方案和自适应可靠性系数设计具有启发性,可以启发后续在图网络的可解释性、图结构生成等领域的工作。
稳定性: ★★★★☆
在多个实验中,G*2-Net取得了最低的标准差(0.58%和0.89%),说明模型对数据划分的随机性不敏感,非常稳定。但是需要注意到,这一稳定性建立在固定的细胞级图结构之上,如果未来扩展到两级图表联合学习,其稳定性还有待观察。
适应性以及泛化能力: ★★★★☆
在三组来源和癌种完全不同的数据集(结直肠癌、结肠癌、黑色素瘤)上均表现优秀,证明了其良好的跨组织、跨临床任务的泛化能力。当前只在有固定结构的H&E染色切片上验证,对于IHC染色或其他组织(如肝、肺)的泛化性仍是未知数。
硬件需求及成本: ★★★★☆
模型参数仅0.86M,邻接矩阵内存消耗低,在常规GPU上即可高效训练和推理。成本控制得相当好,没有出现为了性能而堆算力的情况。不过,在运行时O(n2)的成对评分计算,如果未来面对数千个补丁的大尺寸WSI,可能需要一些优化。
复现难度: ★★★☆☆
虽然算法描述非常详细,并附有伪代码,但实现二阶超级度的自适应系数计算、有限差分法的稳定性调试仍有一定门槛。目前论文未公开官方代码仓库,这给希望精确复现的研究者带来了一些挑战。
产品化成熟度: ★★★☆☆
在特定病理数据集上的准确率已经达到或接近临床可用水平(>96%),且模型轻量。但要真正进入临床辅助诊断流程,还需要在大规模、多中心、多扫描仪的场景下做进一步验证。目前的评估依然属于固定的数据集竞赛,距离真实世界的部署还有一段路要走。
可能的问题: 目前的补丁级图结构是固定的(基于欧氏距离构建的细胞图),这限制了底层表示的潜力。未来可以尝试联合优化两级图结构。此外,论文没有在公开的TCGA等更大规模、更多样化的数据集上测试,这在一定程度上影响了其在更广泛场景下泛化能力的说服力。
主要参考文献
[1] Yener, B. “Cell-graphs: image-driven modeling of structure-function relationship”. In: Commun. ACM 60.1 (2016), 74–84.
[2] Zhou, Y. et al. “CGC-Net: Cell Graph Convolutional Network for Grading of Colorectal Cancer Histology Images”. In: 2019 IEEE/CVF International Conference on Computer Vision Workshop (ICCVW) (2019), pp. 388–398.
[3] Su, Y. et al. “HAT-Net: A Hierarchical Transformer Graph Neural Network for Grading of Colorectal Cancer Histology Images”. In: BMVC. 2021.
[4] Liu, H., Simonyan, K., and Yang, Y. “DARTS: Differentiable Architecture Search”. In: arXiv:1806.09055 (2019).
[5] Paul, S. et al. “C2P-GCN: Cell-to-Patch Graph Convolutional Network for Colorectal Cancer Grading”. In: 2024 46th Annual International Conference of the IEEE Engineering in Medicine and Biology Society (EMBC). 2024, pp. 1–4.
[6] 原文链接:https://arxiv.org/pdf/2607.26153v1.pdf
*本文仅代表个人理解及观点,不构成任何论文审核或者项目落地推荐意见,具体以相关组织评审结果为准。欢迎就论文内容交流探讨,理性发言哦~ 想了解更多原文细节的小伙伴,可以点击 "阅读原文", 查看更多原论文细节哦!