← 返回 PaperDaily 视觉与图像

医学分割新范式:把JEPA搬进KAN函数空间,UUEKAN也被甩开

KAN架构虽然把可学习的函数搬到了每条边上,但训练时却只盯着聚合后的节点输出,边函数本身一直缺一个直接的优化目标。哈工大与港大这篇FS-JEPA,直接把自监督预测学习搬进了KAN聚合前的函数空间,用多半径签名当预测目标,把最强KAN方法平均Dice拉高2.25个百分点,思路清奇又扎实。

医学分割新范式:把JEPA搬进KAN函数空间,UUEKAN也被甩开
原论文信息如下:
论文标题:
Predicting Functions, Not Features: KANs with Function-Space Joint-Embedding Predictive Learning for Medical Image Segmentation
发表日期:
2026年08月
发表单位:
哈尔滨工业大学(深圳)、香港大学
原文链接:
https://arxiv.org/pdf/2608.12050v1.pdf
医学图像分割是个老战场了,U-Net 一脉的编码器-解码器架构打了十几年仗,从嵌套跳跃连接到注意力机制,该卷的都卷得差不多了。这几年 KAN(Kolmogorov–Arnold Networks,柯尔莫哥洛夫-阿诺德网络)强势入场,把网络里每个边上的固定激活函数换成可学习的单变量函数,给分割模型带来了一股新鲜血液。可问题也随之而来:边函数虽然被换成了显式的函数对象,训练时却还是靠聚合之后的节点输出去反向约束,每条边本身并没有一个明确的“学习目标”。换句话说,函数是显式了,但训练方式还是隐式的。
哈尔滨工业大学(深圳)和香港大学的研究者这次干脆把 JEPA(Joint-Embedding Predictive Learning,联合嵌入预测学习)那一套“预测表征”的思路,直接搬进了 KAN 聚合前的函数空间。你不是缺一个显式目标吗?那我就在每条边上构造一个多半径函数签名,拿掩码在线分支去预测全上下文 EMA 目标分支生成的签名,训练完预测分支一扔,推理时零开销。思路确实有意思。

KAN边函数只能“隐式”学习?

先给不太熟 KAN 的读者补个背景。KAN 的核心就是把传统神经网络里“加权求和 + 固定激活”的方式,改成了“边上直接挂一个可学习函数”。具体来说,一个 KAN 层的计算可以写成:第 j 个输出节点等于所有输入节点对应边函数的求和。这条边上的函数通常做成 B 样条基函数的线性组合,再加上一个残差连接。好处是网络的非线性表达能力被拆解到每条边上,理论上可以用更少的参数逼近更复杂的映射。
但这里藏着一个很微妙的问题。训练 KAN 的时候,损失函数只作用在节点聚合之后的输出上。也就是说,网络只需要保证“所有输入边函数的和”能产生正确的输出就行,至于每一条边具体长什么样,并不受直接约束。这就导致一个现象:完全不同的边函数配置,可能算出几乎一样的聚合结果。论文里把这种情况叫“多对一映射”,聚合操作把边函数的信息给“平均”掉了。
图1:FS-JEPA的动机示意
FS-JEPA 的动机示意。为了克服特征级预测的局限性,预测学习被扩展到 KAN 聚合前边函数的结构化表示上,多半径签名刻画局部函数变化,从而直接在 KAN 函数空间中实现预测学习。
更麻烦的是,一次前向传播中,每条边函数只在输入对应的那个锚点上被求值一次。即便两条不同函数在这个点上的响应一样,它们邻域内的变化趋势也可能完全不同。直观理解就是:考试只考了一个固定题目的答案,但没考这个学生是不是真的理解了解题思路。所以本文作者认为,现有的 KAN 视觉模型——包括 U-KAN、KAT 这些后续工作——本质上还是让边函数在“隐式”地被学习,缺少一个聚合前的显式优化目标。
图2:标准KAN训练与FS-JEPA框架对比
图2:标准 KAN 训练与所提出的 FS-JEPA 框架对比。(A)标准 KAN 训练只通过聚合后的任务监督优化边函数,此时不同的边函数配置可能产生相同的节点输出。(B)本文框架直接在采样的聚合前边函数上进行预测学习,从掩码在线上下文预测多半径签名到全上下文 EMA 目标,共享边索引保证对应关系。
FS-JEPA 的解决思路很直接:既然聚合后的监督不够,那就把自监督的预测目标直接下沉到边函数层面。在线分支拿到被掩码的部分上下文,目标分支看到全上下文,两个分支共享同一组被采样的边索引,在线分支要预测出目标分支对应的“多半径函数签名”。这样每条被采样的边,就相当于拥有了一个明确的、聚合前的学习信号。

从特征预测到函数预测:多半径签名如何刻画 KAN 边的局部行为

要做到“在函数空间做预测”,第一步是解决表示问题:一条边函数,到底该用什么作为预测目标?最朴素的想法是直接预测这条边在锚点 u 上的响应值 φ(u)。但前面已经分析过,单点响应信息量实在太低,卡不住函数的局部形态。
于是论文提出了“多半径签名”的概念。具体做法是:对一条采样边 e=(i,j),在锚点 u 的基础上,取一组对称的邻域偏移量,然后在这个偏移集合上分别求值,最终拼成一个 6 维向量。这个向量不是孤立的点,而是锚点附近函数变化的一个“切片”,它把函数在局部邻域的行为模式给“快照”下来了。
公式1:KAN边函数的样条参数化表示
公式1:KAN 边函数的样条参数化表示。其中 w^b 是基函数系数,w^s 是样条系数,s 是可学习的样条缩放因子,B^p 是 p 阶 B 样条基函数。这个公式描述了边 (j,i) 上的函数如何由 SILU 基函数和 B 样条基函数共同构成。
锚点加偏移量的设计其实很有讲究。偏移量集合选的是±0.025、±0.05、±0.10这组非均匀间距,越靠近锚点采样越密,兼顾了局部精度和覆盖范围。从信息论的角度看,单点响应是函数的一个“零阶信息”,而多半径签名则是包含了一阶、二阶趋势的“邻域信息”。预测难度增加了,但预测目标的信息量也上去了,模型被迫去理解边函数的局部几何结构,而不是背答案。
公式2:多半径签名的偏移量集合定义
公式2:多半径签名的偏移量集合定义。这组非均匀分布的偏移量围绕输入锚点 u 对称选取,用于刻画边函数在锚点附近的局部变化模式。
公式3:边函数签名定义
公式3:边函数签名定义。对一条采样边 e,其函数签名由锚点 u 加上偏移量集合 D 中的每个偏移 Δ 后逐一求值得到,最终构成一个多维向量,作为该边函数局部行为的结构化表征。
图3:FS-JEPA框架总览
图3:FS-JEPA 框架总览。分割网络与一个仅训练时生效的预测分支联合优化,该分支在聚合前学习采样 KAN 边函数的多半径签名。在线分支在显式边对应关系下预测 EMA 目标签名,从而在 KAN 函数空间中实现预测式表征学习。
整个框架的结构如图3所示。底层的分割网络是一个 U 形的 KAN 架构,用了注意力增强的 KAN 模块和边界引导的跳跃融合。训练时,在四个 KAN 模块上挂了函数空间 JEPA 分支,在线分支看到的是部分掩码的 token 序列,EMA 目标分支看到的是全上下文。两个分支对同一条采样边分别计算签名,在线分支要去“猜”目标分支的签名。EMA(Exponential Moving Average,指数移动平均)目标分支不接收梯度,只作为稳定的回归目标。

确定性边对应:如何保证预测与目标指向同一条边

做过自监督学习的人都知道,JEPA 这类方法最怕的就是“对应关系”出问题。在线分支要预测目标分支的表征,前提是两个分支拿到的是同一个东西。图像领域好办,token 位置是天然对齐的;但 KAN 边函数不一样,因为边是随机采样的。
论文里的做法很巧妙。对一条被采样的边 (i,j),把它的源节点 i 和目标节点 j 的位置分别编码成两个标量坐标。这两个坐标是确定性计算的,不引入任何额外可学习参数。然后把这些坐标跟多半径签名拼接在一起,作为签名预测器的输入条件。
公式4:确定性的边坐标编码
公式4:确定性的边坐标编码。源节点 i 和目标节点 j 通过线性映射归一化到 [−1, 1] 区间,得到坐标 (p_i, p_j),与多半径函数签名拼接后作为签名预测器的条件输入。
这个设计的精髓在于:它把“这条边是谁”这个身份信息和“这条边长什么样”这个函数行为信息解耦了。坐标只负责告诉预测器当前预测的是哪条输入-输出连接,签名只负责刻画函数局部行为。因为在线分支和目标分支共享同一组采样的边索引,坐标天然一致,对应关系就锁死了。
训练时还有一个工程细节值得注意:KAN 层如果有 d_in 个输入节点和 d_out 个输出节点,直接计算完整响应张量的复杂度是 O(BN·d_in·d_out),对大的层来说开销惊人。FS-JEPA 选择只采样 K 条边,通过“选边算子”直接 gather 对应边的样条参数和网格,把额外激活开销降到了 O(BNK)。这是能落地训练的关键一步。

五个医学分割基准全面领先:+2.25% Dice 提升从何而来

实验部分,论文选了五个覆盖不同成像模态的医学分割基准:BUSI(乳腺超声图像分割)、DDTI(甲状腺超声结节分割)、TN3K(甲状腺区域和结节分割)、CVC-ClinicDB(内窥镜息肉分割)和 GlaS(组织病理腺体分割)。从超声到内镜再到病理切片,模态跨度拉得很开,能较好地检验方法的泛化性。
表1:五个医学图像分割基准上与最新方法的对比结果
表1:在五个医学图像分割基准上与最新方法的对比结果。最优结果加粗,次优结果加下划线。所有结果均报告图像级 Dice 和 IoU。Matched Scaffold 表示图3中完整分割架构在去掉 FS-JEPA 分支后的训练结果。
从表1看,FS-JEPA 在五个数据集上的平均 Dice 达到 83.37%,平均 IoU 达到 75.04%,都是全场最高。把最强KAN类方法 UUEKAN(平均 Dice 81.12%)甩开了 2.25 个百分点。这个提升幅度放在医学分割领域不算小。更值得关注的是,FS-JEPA 的参数量只有 7.74M,而 UUEKAN 是 35.02M,参数少了将近 4.5 倍,精度反而更高。
图4:分割结果定性对比
图4:分割结果定性对比。从左到右依次为输入图像、真实标注以及不同方法的预测结果。白色、红色和蓝色区域分别表示真阳性、假阳性和假阴性区域。
从图4的定性结果能直观看到,FS-JEPA 在边界勾勒和病灶定位上确实更精准,假阳性(红色)和假阴性(蓝色)区域明显更少,尤其是在超声这种对比度低、噪声重的模态下优势更突出。这跟方法设计是吻合的:多半径签名提供了聚合前的功能监督,等于对每个边函数的局部行为加了“约束力”,学出来的表征自然更细致。

消融实验揭示关键设计:为什么单点响应预测反而有害

论文的消融实验设计得比较扎实,核心是回答三个问题:预测目标到底该放在哪个空间?多半径签名是否真的比单点响应好?不同的签名构造方式会带来什么影响?
表2:不同预测目标空间的对比结果
表2及图4补充:在相同分割骨架和300轮训练预算下,不同预测目标空间在 BUSI 上的对比。其中“Pre-sum”表示预测发生在 KAN 边聚合之前。
先看第一个问题。表2把预测目标分成了四种:Token-JEPA(token 特征)、Node-JEPA(KAN 节点特征)、Edge-JEPA(单点边响应)、Ours(多半径边函数签名)。结果很有意思:Token-JEPA 跟不加预测目标完全持平,Node-JEPA 只涨了不到 0.4 个点,而 Edge-JEPA 反而比基线低了 0.37 个点。说明在错误的空间做预测不但没帮助,还可能引入噪声。只有多半径签名带来了实打实的 1.18 个点提升。
表3及图5:函数预测诊断与机制分析
表3及图5:不同边函数签名构造在 BUSI 上的函数预测诊断,以及 FS-JEPA 的机制分析和跨骨干泛化实验。(a)FS-JEPA 应用于 U-KAN、UUEKAN、KMUNet 在 BUSI、CVC、GlaS 上的配对 Dice 增益;(b)聚合 KAN 响应、分割损失与 FS-JEPA 目标对补偿扰动和对照扰动的敏感性;(c)BUSI 上 U-KAN 与 U-KAN+FS-JEPA 的边级函数响应配对分析。
第二个问题,为什么单点响应预测反而有害?因为单点响应本身就是聚合后监督的反向传播能提供的信息,再拿它当自监督目标,等于重复学习已经有的约束,同时还把模型的注意力引向了“背诵锚点答案”这条路,忽略了函数邻域行为。这解释了为什么 Edge-JEPA 会掉点。多半径签名因为包含了邻域信息,等于给了模型一个“超纲但有用”的目标,逼着边函数学到更平滑、更有结构的局部几何。
表4:不同边函数签名变体在BUSI上的分割性能
表4:不同边函数签名变体在 BUSI 上的分割性能对比。
第三个问题,签名的构造方式怎么选?表4对比了原始多点签名、中心化签名、对角签名和 ZCA 签名(一种去相关白化变换)。结果原始多点签名效果最好,分割 Dice 达到 79.26%,比中心化签名高了 1.4 个百分点。原因也不难理解:中心化和 ZCA 这类特征变换会把函数响应的绝对尺度信息抹掉,而对于医学图像分割,边函数响应的绝对幅度本身就携带重要的语义信息,过度“标准化”反而有害。
图5a:跨骨干Dice增益
图5(a):FS-JEPA 应用于 U-KAN、UUEKAN 和 KMUNet 时,在 BUSI、CVC 和 GlaS 上带来的配对 Dice 增益。
图5b:扰动敏感性分析
图5(b):聚合 KAN 响应、分割损失和 FS-JEPA 目标对补偿扰动及对照扰动的敏感性对比。
图5c:边级函数响应配对分析
图5(c):BUSI 上 U-KAN 与 U-KAN+FS-JEPA 的配对边函数响应分析,包括逐边差异和代表性配对曲线。
图5d:配对函数曲线对比
图5(d):代表性配对边函数曲线对比,展示 FS-JEPA 对边函数形状的直接影响。
论文还做了机制验证(图5)。他们在保持聚合响应和分割损失几乎不变的前提下施加成对补偿扰动,结果 FS-JEPA 目标依然对这些边级扰动保持敏感。这说明 FS-JEPA 提供的确实是聚合后监督“看不到”的额外信号,而不是简单重复已有的梯度信息。跨骨干实验也证明了这一点:把 FS-JEPA 分别接到 U-KAN、UUEKAN、KMUNet 上,9 组设置里有 8 组 Dice 提升,平均涨了 0.47 个点。这说明方法不是某个特定骨架的专属补丁,而是可以当“外挂”用的一般性训练策略。

总结与展望:函数空间预测学习的下一步

FS-JEPA 这篇工作最大的价值,在于把 JEPA 的预测目标从“特征空间”推进到了“函数空间”。以前的 JEPA 变体,不管是 I-JEPA 还是 V-JEPA,预测的都是 token 或 patch 级别的特征嵌入;而 FS-JEPA 预测的是 KAN 边函数的多半径签名。这个转变不是简单的换了个预测目标,而是从“学习什么样的表征”进化到了“学习什么样的函数”。对于 KAN 这类以函数为基本计算单元的网络,这个思路可以说是打到了七寸上。
从训练成本看,FS-JEPA 只增加了采样边的签名计算和一个轻量预测器,推理时完全移除,对部署非常友好。参数量控制在 7.74M,对医学影像设备(尤其是超声这类边缘设备)来说,算是一个很务实的量级。
不过也得说句公道话,FS-JEPA 目前的所有实验都是基于“同一个分割骨架 + 不同预测目标”的对比,以及“同一套数据划分 + 从零训练”的设置。论文的对比方法还算全面,包含了 CNN 系和 KAN 系的主流方法,但缺少跟更大规模预训练模型的对比。另外,多半径签名里的偏移量集合是手工设计的,±0.025 到 ±0.10 的尺度是否在所有数据集、所有 KAN 层上都是最优的,论文没有给出自适应方案,这是未来可以探索的方向。
另一个值得注意的点是 PaperDaily 已收录论文范围内的辅助判断:在同基准对比中,FS-JEPA 相对其他 KAN 系方法确实表现突出,但由于各论文的数据划分和训练细节可能不同,这里的对比只能作为参考,不能等同于在完全同一协议下的逐点碾压。论文本身在统一的协议下做了公平对比,这个说服力是够的。

龙迷三问

下面是龙哥对于大家可能的一些问题的解答:
这篇论文到底在解决什么问题?哈尔滨工业大学(深圳)与香港大学提出FS-JEPA框架,将自监督预测学习从特征空间拓展到KAN聚合前的边函数空间,用多半径函数签名作为预测目标。在五个医学图像分割基准上平均Dice达83.37%,超过最强KAN方法2.25个百分点
这篇工作最值得看的点是什么?在五个医学图像分割基准上取得最佳平均Dice(83.37%)和IoU(75.04%),比最强KAN方法UUEKAN高2.25个百分点Dice,比匹配骨架高0.85个百分点Dice。
这篇工作的边界或风险在哪里?优点:(1)首次将JEPA扩展到KAN函数空间,提出预聚合边函数签名预测的新范式;(2)多半径签名能捕获局部函数变化,提供更丰富的预测目标;(3)确定性边坐标保证预测与目标的对应关系;(4)训练后移除预测分支,推理无额外开销。缺点:(1)偏移集合大小和采样边数K的选择缺乏系统分析;(2)EMA更新率等超参数敏感性未充分探讨;(3)跨数据集泛化实验有限。
如果你还有哪些想要了解的,欢迎在评论区留言或者讨论~

龙哥点评

论文创新性分数:★★★★☆

提出FS-JEPA框架,将联合嵌入预测学习从特征空间扩展到KAN的聚合前函数空间,通过预测采样KAN边函数的多半径签名来实现显式的边级预聚合学习目标。

实验合理度:★★★★☆

Dice系数, IoU

学术研究价值:★★★★☆

提出FS-JEPA框架,将联合嵌入预测学习从特征空间扩展到KAN的聚合前函数空间,通过预测采样KAN边函数的多半径签名来实现显式的边级预聚合学习目标;更关键的是问题定义是否可复用到同类任务。

稳定性:★★★☆☆

现有材料未提供充分的极端条件、重复运行或扰动测试,稳定性暂按中性评价。

适应性以及泛化能力:★★★☆☆

现有材料未完整展示跨数据集、跨场景或分布外实验,泛化能力仍需进一步验证。

硬件需求及成本:★★★☆☆

训练时增加O(BNK)的辅助激活成本(K为采样边数),推理时无额外计算开销。模型参数量为7.74M。

复现难度:★★★☆☆

现有材料未确认完整代码、配置、数据处理脚本和权重是否齐备,复现难度暂按中性评价。

产品化成熟度:★★★☆☆

论文验证以研究实验为主,真实部署中的时延、成本、维护和异常场景仍需补充验证。

可能的问题:(1)偏移集合大小和采样边数K的选择缺乏系统分析;(2)EMA更新率等超参数敏感性未充分探讨;(3)跨数据集泛化实验有限。

主要参考文献

[1] Liu, Y., Fang, X., Zhang, Y., Ren, S., Zeng, H., Chen, Y. Predicting Functions, Not Features: KANs with Function-Space Joint-Embedding Predictive Learning for Medical Image Segmentation. arXiv:2608.12050.
[2] Liu, Z. et al. KAN: Kolmogorov-Arnold Networks. arXiv:2404.19756, 2025.
[3] Assran, M. et al. Self-supervised learning from images with a joint-embedding predictive architecture. CVPR 2023.
[4] Li, C. et al. U-KAN makes strong medical image segmentation. arXiv:2405.10178, 2025.
[5] Yang, Y., Wang, H. KAT: A KAN-augmented transformer for visual token processing. 2025.
[6] Ronneberger, O., Fischer, P., Brox, T. U-Net: Convolutional networks for biomedical image segmentation. MICCAI 2015.
[7] Zhou, Z. et al. UNet++: A nested U-Net architecture for medical image segmentation. DLMIA 2018.

*本文仅代表个人理解及观点,不构成任何论文审核或者项目落地推荐意见,具体以相关组织评审结果为准。欢迎就论文内容交流探讨,理性发言哦~ 想了解更多原文细节的小伙伴,可以点击"阅读原文",查看更多原论文细节哦!       

end
每次读KAN相关的论文,都有一种“明明每个字都认识,连起来却很有趣”的奇妙体验。这篇FS-JEPA把预测学习搬进了函数空间,思路清奇还涨点明显。想跟龙哥一起品品更多涩涩的架构创新和医学分割新姿势吗?
欢迎加入龙哥读论文粉丝群,扫描下方二维码或者添加龙哥助手微信号加群:kangjinlonghelper。一定要备注:研究方向+地点+学校/公司+昵称(如 图像分割+深圳+哈工大+龙哥),根据格式备注,可更快被通过且邀请进群。 『龙哥读论文』微信群目前包含:图像处理、大模型及智能体、自动驾驶及机器人、AI医疗及AI金融5个群
wechat_helper dianzan

转发文章 微博 X LinkedIn Facebook
龙哥读论文 · PaperDaily

本文基于龙哥读论文 PaperDaily 数据库整理,结合论文原文与工程视角进行解读。