← 返回 PaperDaily
视觉与图像
西北大学最新:用医生看片时的“眼球轨迹”做弱监督分割,Dice达81.85%!
还在为医疗分割数据的像素级标注头疼?西北大学这篇工作告诉你,医生看片子时的眼动轨迹就能当弱监督信号,而且效果居然超越了最专业的涂鸦、边界框等“传统”弱监督!更关键的是,它首次用Mamba这种高效架构建模了轨迹的时序信息,而不是把它当作一堆散点的静态图。看完你会感叹:原来最宝贵的监督信号,就藏在医生最自然的阅片习惯里。
龙哥读论文
发布于 2026-08-14 09:11:51
阅读 3
查看原文
原论文信息如下:
1. 眼动轨迹不只是空间标注:时间上下文才是弱监督分割的新钥匙
想象一下,你面前坐着一位经验丰富的放射科医生,他正盯着CT片子看,目光游走、停顿、再游走——这不到30秒的“眼神运动”里,藏着病灶的位置、边界,甚至医生在确诊前的犹豫区域。换句话说,医生的眼动轨迹,就是一份天然的弱监督分割标签。
现有的弱监督语义分割方法(比如框框、点、涂鸦)都要求医生在阅片之外做额外操作,增加临床负担。而眼动跟踪(eye tracking)不需要医生改变任何习惯——戴上眼动仪,正常看片子,机器自动记录注视点——这就是一个“无感”的、天然的弱监督信号。
但别高兴太早。过去几年,很多眼动监督方法只把注视点的空间位置(哪里看了)当作弱监督信号,生成一张类似热力图的注意图就完事了。比如图1(a)所示:先对离散的注视点做高斯滤波变成注意图,再用它监督分割网络。这种做法的本质是把眼动当作“静止的地图”,完全丢弃了时间维度上“先看哪里、后看哪里”所包含的医生的诊断推理过程。
实际上,眼动包含两种关键信息:空间语义 (注视点落在哪些区域)和时间上下文 (注视的先后顺序、停留时长、眼跳速度等)。西北大学(Northwest University)提出的TrailNet正是抓住了后者——它首次把眼动轨迹当作一个时序序列 来显式建模,并与图像空间语义做交互增强,从而大幅提升了弱监督分割的精度。
为什么时间上下文这么重要?因为医生的诊断过程不是随机的——他们通常先整体扫视,再聚焦到可疑区域,最后来回比较边界。这种“由粗到精”的观察模式,在轨迹中体现为注视点的空间扩散和回归,恰好可以辅助模型理解复杂解剖结构和不明确的病变边界。而之前的GNAN、GradTrack等方法要么只用了注意图,要么把轨迹当成静态特征(如GradTrack虽然考虑了注视顺序,但最终还是坍缩成注意图),都没有真正利用时序建模。
TrailNet的核心理念就是:从空间语义到时间上下文,让眼动轨迹的“时间密码”和图像的空间语义互相补充 。下面咱们就来拆解它是怎么做到的。
2. TrailNet三大模块:TSE、MUD、CDS如何协同工作?
TrailNet整体架构如图2所示,包含三个核心模块:轨迹引导的时空编码器(TSE) 、多尺度不确定性解码器(MUD) 和循环蒸馏策略(CDS) 。三者分工明确,串联起来形成了一条从训练到推理的完整链路。
首先看轨迹引导的时空编码器(TSE) ,它的任务是把眼动轨迹的时间序列信息和图像的空间语义特征进行融合。具体来说,TSE内部又包含三个子模块:
① 双源嵌入块(DE Block) :轨迹包含7维特征:坐标(x,y)、注视时长d、速度v_x、v_y、加速度a_x、a_y。DE同时利用了轨迹物理特征(通过线性层+RMSNorm提取)和图像语义特征(通过双线性插值从视觉编码器特征图采样得到),并用一个自适应的门控融合权重g把它们组合成初始的轨迹嵌入f^0_traj。这种设计让轨迹特征既能反映运动学特性,又能感知图像上的位置语义。
② 轨迹感知块(TP Block) :这是建模时序的关键,后面专门展开。它用Mamba(一种状态空间模型,State Space Model, SSM)来捕捉轨迹的长期依赖。
③ 上下文语义交互块(CI Block) :在每一个尺度上,用轨迹的时间特征去增强图像的空间特征,同时用图像的空间特征去“校准”轨迹特征,抑制其中的探索性噪声(比如医生扫视时落在非病灶区域的注视点)。交互通过交叉注意力机制和自适应权重实现。
接着是多尺度不确定性解码器(MUD) 。眼动信号本身带有噪声:医生可能会在非病变区域停留(探索性注视),注意图生成的伪标签边界模糊。MUD通过三个不同尺度的头上分别输出前景、背景和“不确定”三类概率图,并强制它们满足类别互斥(category mutual-exclusivity) 约束——即前景和背景不能重叠、前景和不确定不能重叠、背景和不确定也不能重叠。同时,不确定区域不参与监督损失计算,这样模型只从确定区域学习,避免了噪声干扰。
最后是循环蒸馏策略(CDS) 。训练时TSE需要轨迹输入,但推理时(实际临床使用)医生不可能给每张图都戴眼动仪。所以CDS通过教师-学生网络进行知识蒸馏:教师网络(包含TSE+MUD)用原始图像+轨迹输入;学生网络(仅视觉编码器+MUD)只用图像输入。蒸馏损失强制学生在多尺度特征上模仿教师的特征,同时加入循环一致性 约束(增强后的教师和学生特征也要一致),从而让学生学会在没有轨迹输入的情况下也能“想象”出轨迹引导的特征。
总结一下,三个模块的配合关系是:TSE负责融合时序与空间,MUD负责抑制噪声,CDS负责蒸馏知识以实现无眼动推理。训练时三者联合优化,推理时只用学生模型(没有轨迹输入)即可完成分割。
3. 关键设计揭秘:Mamba如何高效建模轨迹时序?互斥损失如何抑制噪声?
这一节我们深入两个关键技术点:Mamba 和 类别互斥损失 。
轨迹是一个长度N的序列(N通常是几十到几百)。Transformer的self-attention复杂度是O(N²),对长序列不友好;RNN很难捕捉长距离依赖。Mamba(Gu和Dao, 2024,出自Mamba: Linear-Time Sequence Modeling with Selective State Spaces)基于连续状态空间模型(Continuous State Space Model, SSM),通过输入自适应的离散化和选择性扫描机制,实现了O(N)的推理复杂度,同时能捕捉类似Transformer的长程依赖。
在TrailNet的TP块中,使用了如图2-内部所示的双层残差Mamba结构 。具体来说,对轨迹特征 f̂^i_traj,首先做RMSNorm(根均方归一化),然后经过Mamba块,残差相加后再做FFN(前馈网络)和RMSNorm。Mamba块内部用一个线性层将输入映射到状态参数 Δ_t, B_t, C_t(分别对应离散化步长、输入矩阵和状态矩阵),然后按照SSM的递推公式更新隐藏状态。最终的输出序列 y_t 综合了当前输入和历史状态,从而捕捉了注视的顺序依赖。
为什么用Mamba而不是Transformer?论文通过消融实验(表5)证实:替换TP块为Transformer或FFN层都导致性能下降。原因在于眼动轨迹通常包含几十到上百个注视点,Transformer的二次计算量会拖慢训练(而且在小样本下容易过拟合),而Mamba的线性复杂度更匹配这种中等长度的序列数据。事实上,Mamba在许多长序列任务上已经证明了其优越性,用在轨迹建模范式上非常自然。
MUD在每个尺度上都输出三张概率图:前景 P_f^j、背景 P_b^j、不确定 P_u^j。常识告诉我们对同一个像素,它要么是前景,要么是背景——不能既是前景又是不确定。互斥损失L_u就强制这三个概率图的元素积(element-wise product)接近于0,即:
这个损失会“惩罚”那些同时被预测为前景和背景(或前景和不确定)的像素。同时,前景和背景的预测在确定区域(注意图A中值较高的区域)被重点监督——注意图A由注视点的高斯滤波生成,可以看作一个空间置信度先验。通过这种设计,模型被迫做出更确定的预测,从而抑制了因噪声导致的模糊输出。
此外,MUD还在多尺度上施加监督:将不同尺度的伪标签下采样后分别计算分割损失L_m。这样模型从粗到细都能学到有用的信息,进一步稳定了预测。
4. 实验结果一览:超越所有弱监督方法,甚至接近全监督nnU-Net
论文在GazeMedSeg基准的两个数据集上进行了实验:Kvasir-SEG(胃肠道息肉分割,900训练/100测试)和NCI-ISBI(前列腺MRI分割,789训练/117测试)。图4展示了两个数据集中的样本示例。
主要对比结果 :表1是核心对比,涵盖全监督(Full)、边界框(Box)、点(Point)、涂鸦(Scribble)和眼动(Gaze)五种监督范式。TrailNet在眼动监督下取得了NCI-ISBI上81.25% Dice、Kvasir-SEG上81.85% Dice的结果,显著优于所有其他弱监督方法(包括当前最强眼动监督方法GradTrack,提升了约1%)。甚至与全监督的nnU-Net(85.37% on Kvasir-SEG)相比,差距缩小到了3.5%左右,这在弱监督领域是非常优秀的成绩。
注意TrailNetF(全监督版本,即直接用地面真值代替伪标签)在两个数据集上分别达到了82.78%和86.68%的Dice,比nnU-Net还高,说明TSE和MUD的架构设计本身也为全监督场景带来了增益。
定性效果 :图5展示了几张样本的分割结果对比。可以看出,TrailNet在边界处理上比其他方法更干净,过分割(红色)和欠分割(绿色)更少。尤其是在NCI-ISBI的低对比度MRI图像上,TrailNet利用轨迹信息能够更准确地勾勒出前列腺边缘。
消融实验 :表2消融了三个主要损失。基线(仅有L_seg和基础蒸馏损失)在NCI-ISBI上只有78.96%;加上MUD后提升到80.54%(+1.58%);再加上CDS后达到81.25%(+0.71%)。每个组件都有贡献,且增益显著。
表3进一步消融了MUD内部的两个损失项(L_u和L_m)以及CDS中的增强一致性损失。去掉任何一项都会导致性能下降,验证了互斥约束和多尺度监督的有效性。
表4和表5分别验证了轨迹类型和TSE内部块架构的影响。有趣的是,随机打乱注视顺序(Random (Trajectory-level))和反转轨迹(Reversed Trajectory)都会降低精度,说明正确的时序信息确实很重要。TP块用FFN或Transformer替换后性能下降,证明了Mamba的优越性。
总结实验结果:TrailNet在所有指标上均达到SOTA,且消融实验证明每个设计都有扎实贡献。唯一需要注意的是,当前实验只在两个公开数据集上进行,且数据量不大(各约900张),泛化到更多模态(如CT、超声)还有待验证。
5. 总结与展望:眼动监督的未来方向与实用价值
TrailNet是第一个完整地将眼动轨迹的时间上下文 显式建模并用于弱监督分割的方法。它的核心贡献在于:提出TSE来融合轨迹时序与图像语义,提出MUD用互斥损失抑制眼动噪声,提出CDS实现无眼动推理。实验证明,仅用医生日常阅片的眼动数据,就能达到接近全监督的分割精度。
实用价值非常清晰:眼动仪成本越来越低(几百到几千元),可以无缝嵌入现有PACS系统。医生戴上眼动仪正常工作,后台自动收集轨迹数据,用于训练分割模型。这比手动标注节省约80%的时间(表1显示眼动标注只需2.2小时,而全监督需要18.7小时)。
不过,眼动监督也有其局限性:① 需要设备硬件支持;② 轨迹信息依赖医生的专业水平,新手医生的眼动噪声更大;③ 当前只在两个数据集上验证,对于不同器官、不同影像模态的泛化性尚未充分评估;④ CDS蒸馏不可避免会损失部分信息,学生模型性能略低于教师(大约0.2-0.3% Dice的差距)。
未来方向包括:扩展到更多医学影像模态(CT、超声、病理全切片),结合医生多轮诊断的眼动数据,以及探索在视频(如内窥镜视频)中的眼动轨迹分割。相信眼动监督会成为弱监督领域一个重要的新范式。
龙迷三问
TrailNet为什么能在弱监督下接近全监督的水平? 眼动轨迹包含了医生对病灶区域的持续关注和诊断推理过程,这比单纯的静态标注(如点、框)提供了更丰富的信息。TSE通过Mamba捕捉了注视的时序模式,MUD又抑制了噪声,相当于从“弱信号”中提炼出了“强信息”。再加上CDS蒸馏,使得没有轨迹输入的学生模型也能学到这些信息。
Mamba和Transformer在时序建模上谁更好? 对于轨迹这种中等长度(几十到几百步)的序列,Mamba的线性复杂度优势明显,而且通过选择性扫描机制能捕捉长程依赖。消融实验也证实替换为Transformer性能略低(可能因为小数据下过拟合)。但对于更长序列(如视频帧),可能仍需要进一步比较。
现实中收集眼动数据需要什么条件? 需要一台眼动仪(如Tobii Pro系列,价格在几千到几万不等),以及医生在阅片时佩戴。数据是自动记录的,不需要医生额外操作。但需要处理头部移动、眨眼等噪声,并且不同医生的眼动模式差异很大,数据质量波动。目前TrailNet的实验中使用的是来自Zhong et al. (2024) 发布的GazeMedSeg公开数据集,其中已经经过预处理。
如果你还有哪些想要了解的,欢迎在评论区留言或者讨论~
龙哥点评
论文创新性分数: ★★★★★
首次将眼动轨迹的时序上下文显式建模(使用Mamba)并与图像语义交互,MUD的类别互斥损失也是新颖设计,整体创新度很高。
实验合理度: ★★★★✰
实验设计全面,包括多种监督范式对比、消融、组件分析、参数敏感性、轨迹类型验证。但仅在两个公开数据集上进行,且数据量不大,统计显著性检验(Wilcoxon signed-rank test)虽已做,但缺少跨模态验证。
学术研究价值: ★★★★★
为弱监督分割开辟了新的方向,证明了眼动轨迹时序信息的重要性,并展示了Mamba在医学时间序列建模上的潜力。对后续研究有很强的启发意义。
稳定性: ★★★✰✰
眼动数据本身噪声大,不同医生、不同医院差异大。CDS蒸馏会损失部分信息。目前只在两个干净数据集上测试,真实临床环境中的鲁棒性尚未验证。稳定性有待进一步评估。
适应性以及泛化能力: ★★★✰✰
只测试了内镜和MRI两种模态,没有验证其他器官(如肺结节、肝脏等)或其他影像类型(CT、超声)。眼动模式在不同模态下差异可能很大,需要更多跨域实验。
硬件需求及成本: ★★★★✰
训练使用单张NVIDIA 4090 GPU,学生模型推理时不需要眼动仪。Mamba的计算效率高,整体成本可控。但眼动仪本身需要一定成本。评为4星。
复现难度: ★★★✰✰
论文提供了详细的架构图和公式,但代码未开源(未在原文中发现链接)。GazeMedSeg数据集是公开的,但伪标签生成和轨迹处理等细节仍需参考附录。未开源情况下复现有一定难度。
产品化成熟度: ★★✰✰✰
当前仍处于研究阶段。真实部署需要解决眼动仪硬件集成、不同医生水平差异、实时性要求(学生模型推理速度应该可以)、系统稳定性和监管认证等问题,距离产品化还有距离。
可能的问题:
1. 眼动数据采集需要额外的硬件和医师配合,推广门槛不低。2. 当前实验仅包含两个数据集,且都是相对简单的分割任务(息肉和前列腺),在更复杂场景(如肿瘤浸润区域、多器官分割)中的表现未知。3. 代码未开源,复现和进一步改进困难。4. 互斥损失中注意图A作为权重,其质量直接影响噪声抑制效果——如果注意图本身不准(比如医生快速扫视导致的漂移),可能引入错误先验。
主要参考文献
[1] Wu, S., Zhang, X., Zhao, X., Tian, Y., Tang, Y., Feng, J. (2026). From Spatial Semantics to Temporal Context: Leveraging Gaze Trajectory for Weakly Supervised Medical Image Segmentation. arXiv:2607.26542.
[2] Zhong, Y., et al. (2024). GazeMedSeg: A Benchmark for Gaze-Supervised Medical Image Segmentation. MICCAI 2024.
[3] Gu, A., Dao, T. (2024). Mamba: Linear-Time Sequence Modeling with Selective State Spaces. arXiv:2312.00752.
[4] Ronneberger, O., Fischer, P., Brox, T. (2015). U-Net: Convolutional Networks for Biomedical Image Segmentation. MICCAI 2015.
[5] Isensee, F., Jaeger, P. F., Kohl, S. A. A., Petersen, J., Maier-Hein, K. H. (2021). nnU-Net: a self-configuring method for deep learning-based biomedical image segmentation. Nature Methods, 18, 203-211.
*本文仅代表个人理解及观点,不构成任何论文审核或者项目落地推荐意见,具体以相关组织评审结果为准。欢迎就论文内容交流探讨,理性发言哦~ 想了解更多原文细节的小伙伴,可以点击 "阅读原文", 查看更多原论文细节哦!
读完本文,是不是对眼动轨迹这个“低成本的宝藏监督信号”有了新认识?想和更多志同道合的朋友一起探讨AI医疗、前沿视觉技术吗?
欢迎加入龙哥读论文粉丝群,
扫描下方二维码或者添加龙哥助手微信号加群 :kangjinlonghelper。
一定要备注:研究方向+地点+学校/公司+昵称(如 医学图像+上海+西北大学+龙哥) ,根据格式备注,可更快被通过且邀请进群。
『龙哥读论文』微信群目前包含:图像处理、大模型及智能体、自动驾驶及机器人、AI医疗及AI金融5个群