← 返回 PaperDaily 视觉与图像

眼动就能让AI分割医学图像?零样本息肉分割Dice 88.1%,追平全监督

医学图像分割被昂贵标注卡脖子多年,GazeRefine却用医生眼动当提示,在不需要任何训练的前提下把息肉分割做到88.10% Dice,一脚踩到全监督nnU-Net脚后跟。想让AI指哪打哪还不炼丹?这篇值得一读。零样本、免训练、免标注,核心思路极清爽:眼动点一下,冻结特征自动“长出”掩码。适合所有关心医学图像落地成本与交互分割效率的读者。

眼动就能让AI分割医学图像?零样本息肉分割Dice 88.1%,追平全监督

paperdaily_reaction_gif


原论文信息如下:
论文标题:
GazeRefine: Expert Gaze as a Test-Time Prompt for Training-Free Medical Image Segmentation
发表日期:
2026年09月
发表单位:
巴黎索邦北大学、美国西北大学、捷克VSB-俄斯特拉发科技大学
原文链接:
https://arxiv.org/pdf/2609.01310v1.pdf
开源代码链接:
原文提供GazeRefine仓库(未见完整URL时,以论文发布页为准)

引言

医学图像分割,说起来大家都不陌生——计算机辅助诊断、手术规划、放疗靶区勾画,哪一个都离不开它。从早期的U-Net,到如今近乎“无脑好用”的nnU-Net,性能确实一路飙升。但有一个问题始终没有被根治:高质量的密集像素级标注太贵了。
请专家把每一张内镜图里的息肉边界一点点描出来,或者在前列腺MRI每一层切片上精修轮廓,不光是时间黑洞,还充满主观性:同一个病灶,不同医生勾出来的边界可能差不少;换一个扫描仪、换一种模态,之前的标注基本作废,又得重新找专家再来一遍。密集标注难扩展,这个“卡脖子”问题横在所有医学影像从业者面前。
于是“减少标注依赖”成了热点。弱监督方向用点、涂鸦、框或伪标签来凑合;SAM这类提示分割模型允许用户通过点击或画框做交互分割。而另一边,自监督视觉Transformer(DINO系列)已经默默长出了相当强的语义定位能力:它没学过任何像素标签,特征图里的目标和背景却分得清清楚楚。于是有研究者开始琢磨:能不能别训练了,直接拿冻结特征做分割?
这里面最有趣的一个信号是:放射科医生、内镜医生阅片时眼睛在看哪里,其实天生就是宝贵的“分割提示”。医生盯住病灶的时间长短、扫视的路径,隐含了他们对可疑区域的判断。问题是,怎么把这种原始的眼动信号,变成可以驱动冻结视觉大模型做精细分割的东西?
巴黎索邦北大学、西北大学等机构的研究者给出的答案是:把注视点当“测试时提示”,在冻结的DINOv3特征空间里做前背景原型迭代,也就是今天要聊的GazeRefine。这套方法不需要任何分割掩码、不需要微调、不需要适配器、不需要梯度更新,甚至连SAM那套分割专用架构都不用。它在Kvasir-SEG息肉数据集上拿到了接近全监督nnU-Net的水平,而付出的“人工成本”,仅仅是医生阅片时自然产生的眼动轨迹。

1. 医生眼睛盯哪里,AI就分割哪里?——GazeRefine的零样本新思路

先来感受一下GazeRefine的输入到底有多“轻”:给定一张医学图像,再加上一组医生看这张图时的眼动注视点,每个注视点带一个坐标和停留时长。没有像素级标注,没有提示框,没有涂鸦。
输出则是一张和原图同尺寸的分割掩码,把病灶和背景清清楚楚分开。整个过程零训练、零微调、零适配器,也不依赖SAM之类的大规模分割基础模型,只用了一个冻结的DINOv3 ViT-L/16来提取特征。
怎么做到的?一句话版本:让眼动信息在DINOv3的冻结特征空间里定义“病灶原型”和“背景原型”,然后通过前背景判别和近邻亲和度传播反复细化这两个原型,直到原型稳定,再把每个图像块对前景原型的响应映射回像素空间,得到掩码。
说白了,眼动点本身很稀疏(每张图几十个点),但DINOv3的patch特征里已经蕴含着“息肉看起来像什么”的语义集群。GazeRefine要做的,就是用眼动点去引导特征空间里的聚类,让分割结果从几个注视点“长”出来。
有小伙伴可能会想:这和GazeSAM把注视点传给SAM有什么区别?区别还真不小。
GazeSAM走的是“SAM拿到眼动提示做推理”的路线,需要一个为分割专门训练过的Transformer解码器;GazeRefine则完全没有这种分割专用组件,只依赖一个冻结的自监督骨干。GazeMedSeg、GradTrack这些方法用眼动做训练信号,还得

1. 医生眼睛盯哪里,AI就分割哪里?——GazeRefine的零样本新思路

把注视点当提示这件事,其实并不是第一次出现在医学图像分割里。之前的GazeSAM,思路是把眼动点转成提示(比如把注视点变成点提示、框提示甚至粗略的掩码提示),扔给SAM去分割,利用的是SAM强大的交互分割能力;GazeMedSeg、GradTrack这类工作则把眼动当成弱监督信号,拿去训练一个专门的分割模型。而GazeRefine走了一条完全不同的路:它压根不训练任何分割模型,也不用SAM那一整套东西,只用了一个冻结的DINOv3视觉Transformer来提取特征,然后纯粹在特征空间里做文章。
为什么这条路能走通?关键在于DINOv3这个自监督视觉模型。DINO系列模型有一个非常神奇的性质:它从来没有见过任何像素级标签,但在训练之后,它的特征图里天然地出现了“同一物体聚成一团、不同物体彼此分开”的语义结构。也就是说,一张内镜图里的息肉区域,在DINOv3的特征空间里本来就倾向于聚在一个簇里;医生盯住息肉看的那些注视点,恰好可以告诉模型“这个簇就是目标”。GazeRefine的整套路子,就是围绕这个洞察展开的。
放到真实场景里想,这件事的价值更直观。设想一个忙碌的放射科医生,每天要读几十上百张影像。传统的交互分割需要他停下来,用鼠标精确地点出病灶边界或者画框,操作本身就是负担。而眼动追踪是医生阅片时自然而然发生的行为——他盯着哪里看、在哪里停留更久,本身就反映了他的注意力焦点和临床判断。GazeRefine相当于把这种“无意识行为”顺手变成了分割提示,不用额外付出多少操作成本,就能拿到一个初始的分割结果。如果结果不够好,医生再补几眼或者做简单修正就行。这种人机协作的方式,比传统的“标注—训练—推理”循环要轻得多。
说到这里,有必要先交代一下GazeRefine用到的几个关键背景概念,方便不熟悉这块的读者跟上后面的技术细节。

DINOv3是什么?DINOv3是Meta提出的自监督视觉Transformer系列的最新版本,全称是“self-DIstillation with NO labels”的第三代。它通过在大量无标注图像上做自监督学习,让模型学会“图像里什么东西看起来像同一个物体”,从而得到语义结构清晰的稠密特征。论文里用的是DINOv3的ViT-L/16版本:输入图像被切成16×16像素的patch,每个patch经过Transformer编码成一个1024维的特征向量。在文章里,这些patch特征被记作pi,i=1到N,N是patch总数。

注视点(fixation)是什么?人的眼球运动不是平滑扫过画面的,而是“扫视—注视”交替进行:目光快速跳跃到某个位置(扫视,saccade),然后在那个位置停留一段时间(注视,fixation)。医生阅片时,注视点的位置和停留时长能反映他对该区域的关注程度——盯得越久,说明越觉得这里可疑或者重要。GazeRefine用到的眼动数据正是这种注视点序列,每个注视点包含横坐标x、纵坐标y和持续时间d。

零样本(zero-shot)在这里是什么意思?在GazeRefine的语境下,零样本指的是:在推理时,模型不针对某个特定分割任务做任何训练,没有用任何像素级分割掩码来微调参数。GazeRefine使用的DINOv3骨干网络是冻结的(frozen),意味着它的参数在推理时完全不动。真正“告诉”模型目标是什么的,是测试时给出的眼动注视点——这也是论文标题里“test-time prompt”的含义。

熟悉SAM的读者可能会脱口而出:这不就是SAM的prompt分割的思路吗?区别恰恰藏在这里。SAM是专门为分割任务训练的,有一个庞大的分割解码器,prompt只是告诉它“目标在哪”,具体怎么圈出边界还是靠SAM自己学到的分割能力。而GazeRefine呢?它没有分割解码器,没有prompt编码器,只用一个冻结的自监督骨干。它要回答的问题是:自监督特征本身携带的语义结构,加上一点点极稀疏的人类注视信号,够不够做分割?
实验给出的答案相当耐人寻味:在内镜息肉分割上,这种只需注视点、零训练的方法做到了88.10%的Dice,而同数据上全监督的nnU-Net是88.41%,两者几乎打平,而且GazeRefine的方差还更小。要知道,nnU-Net可是用了90%的标注数据训练出来的。一个免费方法追平一个炼丹炼到极致的全监督大牛,这事儿放在医学图像分割领域,确实有点“降维打击”的味道了。

2. 无需训练的分割魔法:注视点如何变成精准掩码

要把“医生眼睛看了哪里”变成“病灶像素在哪里”,GazeRefine设计了一个四阶段的pipeline:特征提取与注视点建模、注视引导的原型初始化、循环注视锚定原型细化、最终掩码生成。整个流程可以理解为一种“从稀疏种子到稠密掩码的特征空间生长”过程
图1:GazeRefine整体流程概览。临床医生的注视点和冻结的DINOv3特征共同初始化前景与背景原型,并通过迭代细化生成最终分割掩码。
图1:GazeRefine整体流程概览。临床医生的注视点和冻结的DINOv3特征共同初始化前景与背景原型,并通过迭代细化生成最终分割掩码。

第一步:把注视点画成一张“热力图”

一张医学图像进到模型里,先被DINOv3切成37×37=1369个patch(在592×592分辨率下)。与此同时,眼动注视点也要做预处理。论文拿到的是带持续时间的注视点序列,每个点记作(xm, ym, dm)。研究者把这些注视点画到图像坐标上,每个点用一个高斯核扩散出去,并且按注视时长加权——停留越久的注视点,对热力图的贡献越大。这样就得到了一张“医生注意力热力图”:病灶区域亮,背景区域暗。
注视热力图的构造公式
图2:注视热力图H(u,v)的构造公式。其中d̃m是归一化后的注视时长(所有注视时长求和后取比例),σ控制高斯核的空间扩散范围,ε是防止除零的极小常数。直观来看,就是把每个注视点变成一个“小土包”,土包的高度由注视时长决定,然后叠加在一起,得到整个图像上的注意力分布。
接下来,这张连续的热力图被映射到DINOv3 patch网格上,每个patch得到一个取值在0到1之间的权重hi。hi接近1表示这个patch被医生重点盯着(大概率是病灶),接近0表示医生扫过但没停留(大概率是背景)。

第二步:初始化前景和背景“原型”

有了每个patch的“前景概率权重”,下一步就是在DINOv3的特征空间里构造两个代表向量(prototype):一个代表前景(病灶),一个代表背景。具体做法是对所有patch的特征做加权平均——注意是在特征空间里加权平均,不是在像素空间里平均。权重高的patch(医生盯着看的地方)对前景原型的贡献大;反过来,权重低的patch对背景原型的贡献大。
前背景初始化权重的计算公式
图3:前景与背景初始权重的计算公式。hi是patch i的注视热力值(已映射到patch网格),ε是避免除零的极小常数。这两个式子分别把热力值归一化成“前景权重”和“背景权重”,确保所有patch的权重加起来为1。
前景与背景原型初始化的计算公式
图4:前景与背景原型F(0)和B(0)的初始化公式。ν(z)表示L2归一化操作,pi是DINOv3提取的第i个patch的特征向量。前景原型就是所有patch特征按照“医生注视程度”加权求和后再归一化的结果。可以把它理解成特征空间里的“重心”:医生盯着的那些patch的特征向量聚成的中心,就是“病灶长什么样”的第一次猜测。
这个初始原型的好坏,取决于DINOv3特征空间的质量——如果同一个目标的patch特征在空间里确实聚在一起,那么医生看一眼得到的前景原型就已经相当接近真实病灶的“特征中心”。但这还不够:医生的注视点只覆盖了病灶的一部分区域,直接按注视点做分类只能分割出被盯住的那一小块。怎么让分割“长”到整个病灶?这就轮到论文的核心机制出场了。

3. 冻结特征空间中的原型迭代:技术细节深度解析

有了初始原型,核心问题来了:注视点只覆盖了病灶的一部分,直接按相似度分类只能把“被医生看过的那部分”分出来,但病灶没被盯住的部分怎么办?GazeRefine给出的解法是迭代式的前背景判别加亲和度传播,整个过程像一个在特征空间里反复试探的“生长”过程。

核心机制一:前背景判别(Foreground-Background Discrimination)

第t轮迭代开始时,手里有当前的前景原型F(t)和背景原型B(t)。对每一个patch的特征pi,计算它和前景原型的内积sfg,i(等价于余弦相似度),以及和背景原型的相似度sbg,i。如果某个patch跟前景更相似,那它大概率属于病灶;反之则属于背景。定义前景置信度分数为两者之差并截断到非负——只有前景明显胜过背景的patch,才被认为是“靠谱的前景”候选。
前景置信度分数的计算公式
图5:前景置信度分数Si(t)的计算公式。sfg,i(t)是patch i与前景原型F(t)的余弦相似度,sbg,i(t)是patch i与背景原型B(t)的余弦相似度。取两者之差再与0比较取最大,相当于把“跟背景也像”的模糊patch直接归零。

核心机制二:kNN亲和度传播(kNN Affinity Propagation)

前背景判别只是第一步,它的问题在于太“短视”——每个patch只跟两个原型比一比,没有利用patch之间的空间关系。息肉表面可能有纹理变化、光照不均匀,靠近边缘的patch可能会被误判为背景。为了增强空间连贯性,GazeRefine引入了一个基于k近邻(k-nearest neighbor,简称kNN)的亲和度传播步骤。
做法也很清奇:在DINOv3的特征空间里,为每个patch找它的k个最近邻居(按特征相似度找,不是按像素距离找),然后把邻居们的置信度分数按相似程度加权汇总给它。这样做的直觉是:特征空间里相邻的patch,大概率属于同一个语义区域。如果一个patch自己的置信度低,但它的特征邻居们置信度都很高,那么它大概率是被误判了——让它“听听邻居怎么说”,把分数拉上来。
kNN亲和度传播的计算公式
图6:kNN亲和度传播的计算公式。Nk(i)是patch i在特征空间中的k个近邻的索引集合,Aij=piᵀpj是两个patch特征的内积(即余弦相似度),τ是控制亲和度分布尖锐程度的温度参数。这个公式本质上是一个带权重的“邻居投票”:邻居越相似,话语权越大。

核心机制三:注视锚定(Gaze Anchoring)与迭代收敛

亲和度传播得到的分数经过sigmoid函数转换成0到1之间的软权重qi(t),接下来用这套新的权重重新加权平均,得到更新后的前景原型F(t+1)和背景原型B(t+1)。但这里有一个隐患:如果让原型自由更新下去,初始的注视信息会被逐渐“冲淡”,原型可能在特征空间里漂移,最后收敛到一个跟医生关注的病灶完全没关系的地方——这就是所谓的“语义漂移”(semantic drift)。
软权重更新和权重归一化公式
图7:软权重更新公式。sigmoid函数把亲和度传播后的分数压到(0,1)区间,变成每个patch属于前景的软概率,再重新归一化成下一轮迭代的前景/背景权重。
当前原型重计算(加权池化)公式
图8:当前原型重计算公式。用上一轮更新后的软权重对patch特征做加权池化,得到“当前轮次”的前景原型Fcur(t)和背景原型Bcur(t)。
img公式
为了防止漂移,GazeRefine引入了一个精巧的“锚定”机制:每一轮更新后的原型,都要跟最初始的注视引导原型做一个加权融合。λ是锚定强度,论文里取0.5,意思是当前原型和初始原型各占一半。这样一来,每一次迭代都相当于“在原型的生长趋势和医生的初始判断之间取一个折中”。医生给的信息永远在场,模型不会跑偏。
注视锚定更新公式
图9:注视锚定更新公式。λ控制当前原型与初始注视锚点的融合比例。这个公式是GazeRefine抑制语义漂移的关键设计:分割可以“生长”,但不能脱离医生最初指出的区域太远。
迭代的终止条件有两个:达到预设的最大迭代次数T(论文里设为5),或者前后两轮原型的变化量都小于一个极小阈值ε(10-6),说明原型已经收敛稳定了。整个迭代过程不需要任何梯度计算——纯前向推理,每一步都是特征相似度计算和加权平均,所以速度非常快。
迭代结束后,把最终的前景置信度分数图重新排列成37×37的patch网格,然后上采样回原始图像分辨率,得到一张逐像素的响应图。把响应图归一化到[0,1],再用0.5做阈值——大于阈值的像素判为前景,小于的判为背景。这就是最终的分割掩码。
最终响应图归一化公式
图10:最终响应图归一化公式。Mmin和Mmax分别是响应图的最小值和最大值,ε防止除零。归一化后用0.5作为阈值,大于阈值判为前景。
如果觉得这一套流程还是有点抽象,可以用一个不严谨但很贴切的类比来理解:假设你在黑暗中摸索一个房间里的家具,医生先用手电筒照了几个关键位置(注视点),你看清了沙发扶手和茶几腿长什么样(初始原型),然后顺着“跟扶手质感相似的木头很可能是同一件家具”的推测,把整张沙发的轮廓都摸了出来(亲和度传播)。但为了不摸到别的东西上去,你每隔一会儿就回到手电筒照到的位置确认一下方向(注视锚定)。几个来回之后,沙发的完整轮廓就被勾勒出来了

4. 息肉与前列腺MRI上的实战表现:接近全监督的零样本奇迹

GazeRefine的实战检验选了两个差异极大的公开基准:Kvasir-SEG(肠镜息肉分割)和NCI-ISBI 2013(前列腺MRI分割)。前者是内镜图像,病灶是肠壁上的息肉,颜色纹理和周围黏膜有明显差异;后者是灰度MRI,前列腺和周围组织的边界对比度低得多。两个数据集的眼动标注都来自GazeMedSeg提供的注视点数据。预处理时剔除了时长小于50毫秒和落在图像边界外的注视点后,Kvasir-SEG每张图保留5到99个注视点,NCI-ISBI每张切片保留6到54个注视点——非常稀疏的信号。
实验严格采用了各数据集官方划分:Kvasir-SEG按90%训练/10%测试划分,NCI-ISBI按87%/13%划分。需要注意,GazeRefine是纯零样本方法,它不在这90%或87%的数据上做任何训练,只在对应的测试子集上评估。对比方法则涵盖了全监督的U-Net和nnU-Net、点监督、涂鸦监督、框监督、眼动监督以及零样本+眼动方法。所有方法在相同协议、相同测试集上对比。
表1:GazeRefine与最新方法在Kvasir-SEG和NCI-ISBI上的对比(Dice百分比)
表1:GazeRefine与最新方法在Kvasir-SEG和NCI-ISBI上的对比(Dice百分比)。Supervision列标注了各方法使用的监督类型:Full为全监督,Point为点监督,Scribble为涂鸦监督,Box为框监督,Gaze为眼动监督,Zero-Shot+Gaze为零样本加眼动提示。
先看Kvasir-SEG上的结果,这可以说是GazeRefine的高光时刻:Dice达到88.10%±0.14,逼近全监督nnU-Net的88.41%±0.47,完全是“平起平坐”的水平。更值得注意的是,GazeRefine超越了同为“零样本+眼动”路线的GazeMedSAMv2(85.19%)接近3个百分点,而且GazeRefine的方差比nnU-Net还低。要知道,GazeMedSAMv2背后是SAM家族的分割解码器,是有分割先验的;GazeRefine没有用到任何分割专用架构,就是纯冻结特征加注视引导的原型迭代——这个结果确实相当惊艳。
但NCI-ISBI前列腺MRI上的表现就冷静多了:Dice是80.28%±0.11,低于GazeMedSAMv2的85.62%,也略低于GazeSAM的82.60%。不过它仍然压制了大部分弱监督基线(比如PointSup的73.46%、BoxTeacher的75.60%),甚至接近了全监督U-Net的80.58%。这个结果其实也在意料之中:前列腺MRI是低对比度灰度图像,前列腺和周围组织的边界在视觉上很模糊,通用自监督特征在区分这种解剖结构时本身就不占优势。反观内镜息肉,颜色纹理和周围黏膜差异大,在特征空间里天然就能分开。
图11:GazeRefine与零样本眼动分割方法在Kvasir-SEG和NCI-ISBI代表性样本上的定性对比
图11:GazeRefine与零样本眼动分割方法在Kvasir-SEG和NCI-ISBI代表性样本上的定性对比。从左到右依次为输入图像、GazeSAM结果、GazeMedSAMv2结果、GazeRefine结果、真实标注(Ground Truth)。可见GazeRefine生成的掩码边界更贴合真实病灶,假阳性区域更少,对高光反射和照明干扰的鲁棒性也更好。
从定性结果来看,GazeSAM在肠镜图像上经常出现欠分割,而且对高光反射和照明伪影敏感;GazeMedSAMv2的覆盖更全,但两个SAM系方法都会偶尔引入无关的前景区域和边界伪影。相比之下,GazeRefine的掩码更干净,假阳性更少,边界定位也更准。
论文还做了消融实验来验证两大组件的贡献:kNN亲和度传播和背景清理(BG Clean,即前背景判别中通过“前景减背景相似度取正”来抑制背景响应的操作)。结果显示,去掉背景清理后,Kvasir-SEG上的Dice从88.10%暴跌到28.70%,NCI-ISBI从80.28%掉到13.50%——几乎完全崩掉。这组数据有力地说明了一个结论:在冻结特征空间里做零样本分割,最关键的不是如何找前景,而是如何压住背景。没有背景清理,背景patch的特征会混进原型里,污染整个判别过程。相比之下,去掉kNN传播的影响要小一些:Kvasir-SEG掉了0.25个百分点,NCI-ISBI掉了6.73个百分点。这说明kNN传播对MRI这种低对比度场景的收益更大,它帮助patch之间互相“确认身份”,弥补了单一patch特征判别力不足的问题。
表2:kNN传播与背景清理的消融实验(Dice百分比)
表2:kNN传播与背景清理的消融实验(Dice百分比)。kNN列表示是否启用kNN亲和度传播,BG Clean列表示是否启用背景清理。可见BG Clean是主导组件,去掉它性能几乎崩盘;kNN传播提供补充增益,尤其对NCI-ISBI帮助更大。
这一组消融有一个值得注意的点:只留kNN不留BG Clean,和两个都不要,性能非常接近(28.70%对28.35%,13.50%对12.79%)——这再次说明,背景清理是整个系统的“脊梁骨”,没有它,特征空间里真假难辨的背景patch会把一切判别逻辑彻底冲垮。

5. 局限与展望:低对比度场景下的挑战与未来方向

NCI-ISBI上的结果暴露了GazeRefine的适

龙迷三问

下面是龙哥对于大家可能的一些问题的解答:
这篇论文到底在解决什么问题?医学图像分割总被标注卡脖子。GazeRefine用医师眼动提示冻结DINOv3特征,无需训练与任何掩码,通过注视锚定的原型迭代在息肉分割上达88.10% Dice,逼近全监督nnU-Net,走出零样本人机协作新路子。
这篇工作最值得看的点是什么?在Kvasir-SEG上达到88.10% Dice,接近全监督nnU-Net(88.41%)并超越零样本GazeMedSAMv2(85.19%);在NCI-ISBI上达到80.28% Dice,低于GazeMedSAMv2(85.62%)但优于多数弱监督方法。
这篇工作的边界或风险在哪里?优点:(1) 无需任何训练、微调、适配器或提示编码器,真正实现训练免费;(2) 利用临床医生注视作为自然交互方式,符合临床工作流;(3) 在息肉分割上表现优异,接近全监督水平;(4) 消融实验清晰验证了各组件的贡献。缺点:(1) 在低对比度MRI(前列腺)上性能有限,表明对特征空间中前景/背景可分性依赖较强;(2) 需要额外的眼动追踪设备获取注视数据;(3) 与SAM-based方法相比,缺少对复杂边界和低对比度场景的鲁棒性;(4) 仅使用单一阈值(0.5)进行二值化,可能不适用于所有场景。
如果你还有哪些想要了解的,欢迎在评论区留言或者讨论~

龙哥点评

论文创新性分数:★★★★☆

利用临床医生的注视点作为推理时的提示,在冻结的DINOv3特征空间中初始化并迭代细化前景/背景原型,实现无需训练的零样本医学图像分割。

实验合理度:★★★★☆

Dice系数(%)

学术研究价值:★★★★☆

利用临床医生的注视点作为推理时的提示,在冻结的DINOv3特征空间中初始化并迭代细化前景/背景原型,实现无需训练的零样本医学图像分割;更关键的是问题定义是否可复用到同类任务。

稳定性:★★★☆☆

现有材料未提供充分的极端条件、重复运行或扰动测试,稳定性暂按中性评价。

适应性以及泛化能力:★★★☆☆

现有材料未完整展示跨数据集、跨场景或分布外实验,泛化能力仍需进一步验证。

硬件需求及成本:★★★☆☆

不适用(无需训练,推理时仅需前向传播和迭代原型细化,迭代次数T=5)

复现难度:★★★☆☆

GazeRefine

产品化成熟度:★★★☆☆

论文验证以研究实验为主,真实部署中的时延、成本、维护和异常场景仍需补充验证。

可能的问题:(1) 在低对比度MRI(前列腺)上性能有限,表明对特征空间中前景/背景可分性依赖较强;(2) 需要额外的眼动追踪设备获取注视数据;


*本文仅代表个人理解及观点,不构成任何论文审核或者项目落地推荐意见,具体以相关组织评审结果为准。欢迎就论文内容交流探讨,理性发言哦~ 想了解更多原文细节的小伙伴,可以点击"阅读原文",查看更多原论文细节哦!       

转发文章 微博 X LinkedIn Facebook
龙哥读论文 · PaperDaily

本文基于龙哥读论文 PaperDaily 数据库整理,结合论文原文与工程视角进行解读。

LONGGE AI COMMUNITY

把每天读到的论文,变成长期积累

加入「龙哥读论文」知识星球,持续获取 AI 论文、资讯、开源项目、招聘与研究思路。

加入龙哥读论文微信群:添加微信 kangjinlonghelper,备注“研究方向 + 地点 + 学校/公司 + 昵称”。

龙哥读论文知识星球二维码 微信扫码加入知识星球