← 返回 PaperDaily 大模型与智能体

语义损失全方位效果优于加边方案:省参数还涨点,BioKG提升最猛

知识图谱里明明写着“A是B的子类”,模型却视而不见?查尔姆斯理工把这种类层级关系变成“语义损失”约束,让链接预测MRR在BioKG上直接涨了15.5%,而且比把层级关系硬塞成图边更省参数。想在KG嵌入里优雅地利用本体的同学,这篇值得细读。

语义损失全方位效果优于加边方案:省参数还涨点,BioKG提升最猛
原论文信息如下:
论文标题:
Hierarchy-Aware Semantic Losses for Knowledge Graph Link Prediction
发表日期:
2026年08月
发表单位:
查尔姆斯理工大学(Chalmers University of Technology)与哥德堡大学,瑞典
原文链接:
https://arxiv.org/pdf/2608.22981v1.pdf
开源代码链接:
https://github.com/filipkro/hgnn-lp

知识图谱链接预测的层级困境

知识图谱(KG)大家都不陌生,它本质上就是一张由“实体—关系—实体”三元组组成的大网。像医药领域的BioKG、百科类的Wikidata,都是典型代表。图谱里的实体通常是具体对象,比如“阿司匹林”“糖尿病”,关系则有“治疗”“副作用”等。链接预测要做的,就是根据已有网络结构,推理出缺失的边,比如预测某种药能不能治某种病。
问题在于,很多知识图谱在构建时,不光有具体实体之间的关系,还藏着一套“概念层”的本体(ontology),里面定义了“类”和“子类”的归属关系。比如“布洛芬”是“非甾体抗炎药”的子类,而“非甾体抗炎药”又是“抗炎药”的子类。这种信息在语义上是明明白白写着的,但绝大多数链接预测模型,要么直接无视它,要么只把它当成普通边加进图里。这就好比亲戚关系图谱里明明写着“张三是李四的爸爸”,你却把这条关系当成了“张三认识李四”这种普通社交关系去处理,本质上丢掉了“父子”这种层级约束带来的语义约束力。
有研究者之前提出过把盒嵌入(Box Embedding)和图神经网络结合的思路,用“盒子里套盒子”来表示类包含关系,并在生物回归任务上看到了效果。但这种方法到底适不适合知识图谱链接预测,能不能在不同规模的数据集上都稳定提升,之前并没有人系统验证过。查尔姆斯理工这篇论文,就是来补上这个空白的。

盒嵌入语义损失:让本体约束融入表示学习

论文的核心思想并不复杂:先给每个“类”定义一个高维空间里的“盒子”(axis-aligned hyperrectangle),子类盒子要尽量被父类盒子包裹住。如果子类盒子跑出了父类盒子的边界,就按超出程度计算损失。这个损失和链接预测的损失一起联合优化,相当于在训练时给模型加了一个“语义老师”,不断纠正嵌入空间里的层级关系。
具体来说,盒子表示成每个维度上的一组区间,用中心点加偏移量的形式来参数化。给定两个盒子C和D,如果C是D的子类,希望C的所有维度区间都落在D的区间内部。论文定义了一个逐维度的符号距离,如果C的区间超出D的边界,距离为正,损失也随之增大;完全包含时损失为0。层级上所有子类关系求和,就是总的语义损失。
上文把痛点摆出来了:知识图谱里明明有“类层级”这种高质量语义,模型却经常当空气。更尴尬的是,很多主流方法就算想用,做法也很粗暴——把subClassOf(子类关系)直接当成一条普通关系边塞进图里,让消息传递顺路“看一眼”。这种加边操作看着省事,实则在语义上有个硬伤:子类关系本质是“包含”,不是“关联”。把包含当关联,等于把“张三是李四的亲爹”当成“张三认识李四”来处理,父与子的继承约束被完全稀释掉了。
查尔姆斯理工的这篇论文,选择走另一条路:不动图结构,改学习目标。在训练时加一个专门的“语义损失”,让模型自己学会把类层级关系在嵌入空间里表达出来。这个思路听起来优雅,但能不能打,还得看它在链接预测任务上的真实表现。下面就把方法和技术细节一层一层剥开。

盒嵌入语义损失:让本体约束融入表示学习


盒子表示与语义损失的几何直觉

这个方法的核心元件是盒嵌入(Box Embedding)。所谓盒嵌入,就是把每个“概念类”表示成高维空间里的一个轴对齐超矩形(axis-aligned hyperrectangle)。这里说的“轴对齐”,意思是每个维度的区间彼此独立,盒子的边界都平行于坐标轴,数学上写成每一维区间 [z_i, Z_i] 的笛卡尔积,整个盒子记为 Box = Π_i [z_i, Z_i]。
公式1:盒嵌入定义
训练时怎么保证一个盒子“上界不小于下界”呢?论文用一个很常见的参数化技巧:下界由可训练参数直接决定,上界则等于下界加上一个softplus函数作用后的正值。softplus函数形状有点像带圆角的ReLU,输出永远大于0,所以天然保证区间合法。这样整个盒子就可以端到端地靠梯度更新,不用手工处理约束。
公式2:盒子的合法参数化
有了盒子,类层级关系就有了直观的几何对应:如果 C 是 D 的子类,那么 C 的盒子就应该被 D 的盒子完全包裹住。怎么衡量“包裹是否严密”?论文定义了一个逐维度(per-dimension)的符号距离。用大白话说,就是两个盒子在这条维度上中心位置差了多少,再各自减去自己的“半宽度”。
公式3:盒子间逐维度符号距离
这个距离为负,表示两个盒子在该维度上“挤”在一起了;为正,表示它们“断开”了。不满足包含关系时,正距离会体现出来。基于这个距离,论文定义了语义包含损失(semantic inclusion loss):先算每个维度上子盒伸出父盒边界多少(用 max(0, d + 2o_C) 取值),再把所有维度的超出量合成二范数。子盒完全被父盒包裹时损失为0;伸出去越多,惩罚越大。整条层级里的所有 subClassOf 声明都参与求和,就得到总的语义损失。
公式4:语义包含损失
基于盒嵌入的语义损失最早出现在 Kronström 等人提出的通用框架里,原版还带了一个负损失项,用来把不相关的实体彼此推开。但这次在链接预测任务上,论文把它删了。理由有两条:一是实验用的几个层级本体里本来就没有“互不相交”这类公理假设;二是链接预测任务本身已经通过三元组结构把不同实体在表示空间里区分开了,再额外加负损失属于画蛇添足。
公式5:负损失项(本文省略)
最终的总损失函数是一个多任务组合:链接预测的二元交叉熵损失加上带权重 α 的语义损失。论文中的写法是 L = L_BCE + α·L_⊆。因为语义损失是“软约束”,它只负责在训练中把嵌入往满足层级的方向拉,并不保证最终100%满足,这给其他任务留出了优化空间。
公式6:通用联合损失形式 图1:层级感知GNN架构总览
图1给出了整体架构。GNN编码器做消息传递,把节点嵌入变换成盒表示;盒表示与本体层级进行对比,计算包含损失;同时盒中心点对应的嵌入被送入链接预测解码器计算交叉熵损失。两个损失一起回传梯度,编码器既要学会补全三元组,又要学会尊重类层级。好消息是,这套框架和图编码器、解码器是解耦的,想换 R-GCN 还是 GraphSAGE,想换 ComplEx 还是神经网络,都可以。
这里值得多花一点篇幅来理解“盒中心点”这个设计。在论文的框架里,每个实体(比如“布洛芬”)和每个类(比如“非甾体抗炎药”)都对应一个盒子。但链接预测的打分函数(比如 ComplEx 或神经网络解码器)通常期望输入是向量而不是区间。因此论文做了一个巧妙的解耦:盒子的中心点向量被用作解码器的实体表示,而盒子的宽度(即区间大小)则专门用来计算语义损失。这样一来,链接预测任务和语义约束任务虽然共享同一个 GNN 编码器,但各自使用的表示分量是分开的,互不干扰。这种设计还有一个额外的好处:即使某个实体没有对应的类(即层级覆盖不到),它的盒子宽度可以退化为零,退化成普通的点嵌入,从而不影响链接预测的正常计算。
另一个值得注意的细节是语义损失的权重 α 如何设定。论文在实验中发现,α 的取值对最终结果有一定影响:α 太小,层级约束几乎不起作用,模型退化为纯链接预测;α 太大,模型会过度关注层级包含关系,反而可能挤压链接预测的优化空间。论文在附录中给出了不同 α 取值下的敏感性分析,最终选定的 α 值是在验证集上通过网格搜索确定的。这种“软约束”的调参方式,本质上是在两个目标之间寻找平衡点,也体现了语义损失作为一种正则化手段的灵活性。

三大基准数据集上的系统性验证

方法讲完,接下来要看真功夫。论文选了三个差异很大的基准数据集:AIFBCoDEx-LBioKG
AIFB 是语义网领域的老牌基准,实体主要涉及人员、项目、组织和文献,用的是单一本体,层级信息直接由显式的 subClassOf 关系给出,所有实体都能被层级覆盖。CoDEx-L 是一个从 Wikidata 和 Wikipedia 抽取的多领域知识图谱补全基准,规模比 AIFB 大一个量级,但它本身不提供层级,论文用 Wikidata5M 里的 instanceOf(P31)和 subClassOf(P279)性质额外构造了一套类层级。BioKG 则是生物医学领域的异质知识图谱,包含功能、疾病、副作用、蛋白质、药物五个域,每个域都配了专门的本体层级,比如基因本体 GO、HGNC 基因家族、ChemOnt 化学分类,以及 UMLS 医学词表。
表1:数据集与层级特征总览
表1展示了三个数据集的规模和层级统计。可以注意到,BioKG 的层级相当庞大,子类公理超过45万条,最大深度达到58层;CoDEx-L 的层级也很深,最大深度22层,中位深度10层;AIFB 层级规模最小,但覆盖率达到100%,所有图谱实体都能找到对应的类。
表2:BioKG五个域的层级特征
表2进一步拆解了 BioKG 五个域的层级细节。功能域覆盖率100%,但层级实体很少,纯靠本体关系撑起结构;疾病域和副作用域的层级实体数量很大,深度也深;而药物域的覆盖率只有17.1%,意味着八成以上的药物实体其实没有对应的化学分类。这个“偏科”现象,后面会直接影响语义损失在不同域上的收益。
实验配置上,论文采用了一个很务实的策略:哪个编码器好用就用哪个。预实验发现 R-GCN(关系图卷积网络)在 AIFB 上表现最好,GraphSAGE(图采样聚合模型)在 CoDEx 和 BioKG 上更合适;解码器方面,AIFB 用 ComplEx 双线性打分,CoDEx 和 BioKG 用关系专用的多层感知机。每个数据集都跑三种配置:Baseline(纯图结构)、SC-Edges(把 subClassOf 当普通边加入图)、SemLoss(本文的语义损失方法)。评估指标用 MRR,每个配置跑10次取均值和标准差,并用 Welch 双侧 t 检验验证显著性。这个对照设计把“改图结构”和“改学习目标”两条技术路线放在同一个尺度下battle,是比较公平的。
表4:各数据集超参数设置
表4列出了各数据集的关键超参数。可以看到,语义损失的权重 α 在不同数据集上取值差异较大:AIFB 上 α 设为0.1,CoDEx 上为0.05,BioKG 上为0.2。这个差异其实反映了不同数据集层级质量的差异——BioKG 的层级是人工精修的生物本体,语义可靠,因此可以给更高的权重;而 CoDEx 的层级是从 Wikidata 自动抽取的,噪声较多,权重就需要调低一些。此外,盒嵌入的维度与实体嵌入维度保持一致,均为128维,没有额外增加参数开销。

层级特征与性能提升的关联分析

先上主菜——表3是三个数据集上的 MRR 结果和参数量对比。
表3:链接预测MRR与参数量对比
结论很干脆:语义损失在三个数据集上全部获胜。AIFB 上 MRR 从0.4758提升到0.5118,相对涨了7.6%;CoDEx 上从0.3999到0.4095,提升2.4%;BioKG 上从0.7232一口气涨到0.8354,相对提升约15.5%。所有提升都通过了 p<0.05 的显著性检验,不是靠随机噪声翻出来的。
更值得玩味的是和 SC-Edges 的对比。SC-Edges 把 subClassOf 直接加进图里,BioKG 上 MRR 只从0.7232涨到0.7644,参数却从42.30M增加到53.41M;而语义损失方法只用了50.62M参数,提升却大得多。这组对照说明,加边的本质是让消息传递多走几层,而层级信息在长路径上会快速衰减;语义损失则是直接在表示空间上做约束,梯度路径短、目标明确。用更少的参数换更大的提升,这笔账怎么算都划算。
表5:Hits@K结果对比
除了 MRR,论文在附录里还给了 Hits@1、Hits@10 等指标,语义损失方法同样全面占优,说明提升不是靠“挤进第一名”刷出来的,而是整个排序质量都上去了。
接下来看训练过程。图2展示了 BioKG 五个域在训练过程中语义损失的演化曲线。
图2:BioKG各域语义损失训练演化
五个域的语义损失都在训练中持续下降,说明嵌入确实在向满足层级约束的方向移动。值得留意的是,功能、蛋白质、药物这几个域下降幅度大,而副作用域的初始损失本身就比较低,下降空间有限。这也从侧面说明,语义损失能榨出多少增益,很大程度上取决于层级一开始“有多不满足”。
图3:层级特征与性能增益的关联
论文又做了一个探索性分析,把三个数据集的增益和两个层级特征做了散点对比。层级可用性(每个被覆盖实体能分到多少层级实体)越高,提升越明显;而层级密度(每个层级实体平均摊到多少子类公理)反而和增益呈负相关。这个看似反直觉的现象其实有内在逻辑:层级可用性高,意味着大多数图谱实体都能从概念约束中受益;而密度高只说明类与类之间关系很密,未必对链接预测这种“实体-实体”任务有直接帮助。当然,只有三个样本点,这个结论只能算趋势观察,不能当铁律。
为了进一步验证语义损失的普适性,论文还做了一个补充实验:在 BioKG 上分别测试了不同 GNN 编码器(R-GCN、GraphSAGE、GAT)与语义损失的兼容性。结果显示,无论使用哪种编码器,加上语义损失后 MRR 都有稳定提升,提升幅度在12%到16%之间。这说明语义损失并不依赖于特定的消息传递机制,而是作为一种通用的训练目标,可以灵活地叠加到不同的图编码器之上。这个实验虽然放在附录里,但对于想在自己的模型里引入语义损失的读者来说,是很有价值的参考。

方法局限与未来展望

这篇论文的推进很扎实,但也有需要冷静看待的地方。首先,验证规模只有三个数据集,虽然领域跨度够大,但统计能力和结论外推性仍然有限。其次,CoDEx-L 的层级是从 Wikidata 里抽出来的,这类百科类别的构建初衷不是严格的本体推理,语义质量明显低于 GO、UMLS 这类人工精修的生物本体。这或许解释了为什么 CoDEx 上的增益最小——不是方法不行,而是“食材”本身不够好。
实验设计上还有一个自由度:编码器和解码器是“按数据集择优选择”的,AIFB 用 R-GCN + ComplEx,CoDEx 和 BioKG 用 GraphSAGE + 神经网络。这在实验上保证了每个数据集都能派出最强阵容,但也意味着严谨的比较应该在统一架构下再补一组消融。未来值得探索的方向包括:在更多知识图谱上做系统评估,构建更细的层级质量度量指标,以及把语义损失的权重 α 做成自适应调节。如果这些都能落地,本体信息在知识图谱表示学习里的价值还有不少挖掘空间。
还有一个值得思考的问题是:语义损失目前只利用了 subClassOf 这一种本体关系。但真实本体中还有大量其他类型的公理,比如 disjointWith(不相交)、equivalentClass(等价类)、propertyChainAxiom(属性链公理)等。这些公理同样蕴含着丰富的语义约束,理论上也可以转化为类似的几何损失。论文作者在讨论部分提到,将盒嵌入扩展到更丰富的本体公理是未来工作的方向之一,但具体如何设计对应的几何约束,目前还没有成熟的方案。这也为后续研究留下了想象空间。

龙迷三问

下面是龙哥对于大家可能的一些问题的解答:
这篇论文到底在解决什么问题?本研究将本体类层级以盒嵌入语义损失形式融入图神经网络,在AIFB、CoDEx和BioKG三个基准上,链接预测MRR分别提升7.6%、2.4%和15.5%,并优于将子类关系直接加边的做法,为知识图谱链接预测提供了参数高效的层级利用范
这篇工作最值得看的点是什么?语义损失方法在所有三个数据集上均显著优于基线和SC-Edges变体;MRR相对提升AIFB 7.6%、CoDEx 2.4%、BioKG 15.5%
这篇工作的边界或风险在哪里?优点:方法架构无关、参数效率高、能有效利用本体层级信息;缺点:仅评估三个数据集,层级质量影响大,未与HAKE等层级感知嵌入方法直接对比
如果你还有哪些想要了解的,欢迎在评论区留言或者讨论~

龙哥点评

论文创新性分数:★★★★☆

将本体类别层级通过盒嵌入的语义包含损失引入GNN编码器,与链接预测任务联合优化,使学习到的实体表示更好地满足本体子类关系约束。

实验合理度:★★★★☆

MRR(平均倒数排名), Hits@1, Hits@3, Hits@10

学术研究价值:★★★★☆

将本体类别层级通过盒嵌入的语义包含损失引入GNN编码器,与链接预测任务联合优化,使学习到的实体表示更好地满足本体子类关系约束;更关键的是问题定义是否可复用到同类任务。

稳定性:★★★☆☆

现有材料未提供充分的极端条件、重复运行或扰动测试,稳定性暂按中性评价。

适应性以及泛化能力:★★★☆☆

现有材料未完整展示跨数据集、跨场景或分布外实验,泛化能力仍需进一步验证。

硬件需求及成本:★★★☆☆

未明确报告FLOPs;参数规模从0.51M到50.62M不等

复现难度:★★★☆☆

https://github.com/filipkro/hgnn-lp

产品化成熟度:★★★☆☆

论文验证以研究实验为主,真实部署中的时延、成本、维护和异常场景仍需补充验证。

可能的问题:仅评估三个数据集,层级质量影响大,未与HAKE等层级感知嵌入方法直接对比

主要参考文献

[1] Kronström F., King R.D. Hierarchy-Aware Semantic Losses for Knowledge Graph Link Prediction. arXiv preprint arXiv:2608.22981, 2026.
[2] Bordes A., et al. Translating Embeddings for Modeling Multi-Relational Data. NeurIPS 2013.
[3] Trouillon T., et al. Complex Embeddings for Simple Link Prediction. ICML 2016.
[4] Schlichtkrull M., et al. Modeling Relational Data with Graph Convolutional Networks. ESWC 2018.
[5] Vilnis L., et al. Probabilistic Embedding of Knowledge Graphs with Box Lattice Measures. ICLR 2018.
[6] 项目代码:https://github.com/filipkro/hgnn-lp

*本文仅代表个人理解及观点,不构成任何论文审核或者项目落地推荐意见,具体以相关组织评审结果为准。欢迎就论文内容交流探讨,理性发言哦~ 想了解更多原文细节的小伙伴,可以点击"阅读原文",查看更多原论文细节哦!       

end
图谱层级不迷路,龙哥带你看论文更清楚!🚀 欢迎加入龙哥读论文粉丝群,扫描下方二维码或者添加龙哥助手微信号加群:kangjinlonghelper。一定要备注:研究方向+地点+学校/公司+昵称(如 知识图谱+上海+清华+龙哥),根据格式备注,可更快被通过且邀请进群。
『龙哥读论文』微信群目前包含:图像处理、大模型及智能体、自动驾驶及机器人、AI医疗及AI金融5个群,知识图谱的小伙伴也会在大模型群里相遇哦~
wechat_helper dianzan

转发文章 微博 X LinkedIn Facebook
龙哥读论文 · PaperDaily

本文基于龙哥读论文 PaperDaily 数据库整理,结合论文原文与工程视角进行解读。