← 返回 PaperDaily
大模型与智能体
语义损失全方位效果优于加边方案:省参数还涨点,BioKG提升最猛
知识图谱里明明写着“A是B的子类”,模型却视而不见?查尔姆斯理工把这种类层级关系变成“语义损失”约束,让链接预测MRR在BioKG上直接涨了15.5%,而且比把层级关系硬塞成图边更省参数。想在KG嵌入里优雅地利用本体的同学,这篇值得细读。
龙哥读论文
发布于 2026-08-27 00:20:15
阅读 1
查看原文
原论文信息如下:
知识图谱链接预测的层级困境
知识图谱(KG)大家都不陌生,它本质上就是一张由“实体—关系—实体”三元组组成的大网。像医药领域的BioKG、百科类的Wikidata,都是典型代表。图谱里的实体通常是具体对象,比如“阿司匹林”“糖尿病”,关系则有“治疗”“副作用”等。链接预测要做的,就是根据已有网络结构,推理出缺失的边,比如预测某种药能不能治某种病。
问题在于,很多知识图谱在构建时,不光有具体实体之间的关系,还藏着一套“概念层”的本体(ontology),里面定义了“类”和“子类”的归属关系。比如“布洛芬”是“非甾体抗炎药”的子类,而“非甾体抗炎药”又是“抗炎药”的子类。这种信息在语义上是明明白白写着的,但绝大多数链接预测模型,要么直接无视它,要么只把它当成普通边加进图里。这就好比亲戚关系图谱里明明写着“张三是李四的爸爸”,你却把这条关系当成了“张三认识李四”这种普通社交关系去处理,本质上丢掉了“父子”这种层级约束带来的语义约束力。
有研究者之前提出过把盒嵌入(Box Embedding)和图神经网络结合的思路,用“盒子里套盒子”来表示类包含关系,并在生物回归任务上看到了效果。但这种方法到底适不适合知识图谱链接预测,能不能在不同规模的数据集上都稳定提升,之前并没有人系统验证过。查尔姆斯理工这篇论文,就是来补上这个空白的。
盒嵌入语义损失:让本体约束融入表示学习
论文的核心思想并不复杂:先给每个“类”定义一个高维空间里的“盒子”(axis-aligned hyperrectangle),子类盒子要尽量被父类盒子包裹住。如果子类盒子跑出了父类盒子的边界,就按超出程度计算损失。这个损失和链接预测的损失一起联合优化,相当于在训练时给模型加了一个“语义老师”,不断纠正嵌入空间里的层级关系。
具体来说,盒子表示成每个维度上的一组区间,用中心点加偏移量的形式来参数化。给定两个盒子C和D,如果C是D的子类,希望C的所有维度区间都落在D的区间内部。论文定义了一个逐维度的符号距离,如果C的区间超出D的边界,距离为正,损失也随之增大;完全包含时损失为0。层级上所有子类关系求和,就是总的语义损失。
上文把痛点摆出来了:知识图谱里明明有“类层级”这种高质量语义,模型却经常当空气。更尴尬的是,很多主流方法就算想用,做法也很粗暴——把subClassOf (子类关系)直接当成一条普通关系边塞进图里,让消息传递顺路“看一眼”。这种加边操作看着省事,实则在语义上有个硬伤:子类关系本质是“包含”,不是“关联”。把包含当关联,等于把“张三是李四的亲爹”当成“张三认识李四”来处理,父与子的继承约束被完全稀释掉了。
查尔姆斯理工的这篇论文,选择走另一条路:不动图结构,改学习目标 。在训练时加一个专门的“语义损失”,让模型自己学会把类层级关系在嵌入空间里表达出来。这个思路听起来优雅,但能不能打,还得看它在链接预测任务上的真实表现。下面就把方法和技术细节一层一层剥开。
盒嵌入语义损失:让本体约束融入表示学习
这个方法的核心元件是盒嵌入(Box Embedding) 。所谓盒嵌入,就是把每个“概念类”表示成高维空间里的一个轴对齐超矩形(axis-aligned hyperrectangle)。这里说的“轴对齐”,意思是每个维度的区间彼此独立,盒子的边界都平行于坐标轴,数学上写成每一维区间 [z_i, Z_i] 的笛卡尔积,整个盒子记为 Box = Π_i [z_i, Z_i]。
这里值得多花一点篇幅来理解“盒中心点”这个设计。在论文的框架里,每个实体(比如“布洛芬”)和每个类(比如“非甾体抗炎药”)都对应一个盒子。但链接预测的打分函数(比如 ComplEx 或神经网络解码器)通常期望输入是向量而不是区间。因此论文做了一个巧妙的解耦:盒子的中心点向量被用作解码器的实体表示,而盒子的宽度(即区间大小)则专门用来计算语义损失。这样一来,链接预测任务和语义约束任务虽然共享同一个 GNN 编码器,但各自使用的表示分量是分开的,互不干扰。这种设计还有一个额外的好处:即使某个实体没有对应的类(即层级覆盖不到),它的盒子宽度可以退化为零,退化成普通的点嵌入,从而不影响链接预测的正常计算。
另一个值得注意的细节是语义损失的权重 α 如何设定。论文在实验中发现,α 的取值对最终结果有一定影响:α 太小,层级约束几乎不起作用,模型退化为纯链接预测;α 太大,模型会过度关注层级包含关系,反而可能挤压链接预测的优化空间。论文在附录中给出了不同 α 取值下的敏感性分析,最终选定的 α 值是在验证集上通过网格搜索确定的。这种“软约束”的调参方式,本质上是在两个目标之间寻找平衡点,也体现了语义损失作为一种正则化手段的灵活性。
三大基准数据集上的系统性验证
方法讲完,接下来要看真功夫。论文选了三个差异很大的基准数据集:AIFB 、CoDEx-L 和 BioKG 。
AIFB 是语义网领域的老牌基准,实体主要涉及人员、项目、组织和文献,用的是单一本体,层级信息直接由显式的 subClassOf 关系给出,所有实体都能被层级覆盖。CoDEx-L 是一个从 Wikidata 和 Wikipedia 抽取的多领域知识图谱补全基准,规模比 AIFB 大一个量级,但它本身不提供层级,论文用 Wikidata5M 里的 instanceOf(P31)和 subClassOf(P279)性质额外构造了一套类层级。BioKG 则是生物医学领域的异质知识图谱,包含功能、疾病、副作用、蛋白质、药物五个域,每个域都配了专门的本体层级,比如基因本体 GO、HGNC 基因家族、ChemOnt 化学分类,以及 UMLS 医学词表。
实验配置上,论文采用了一个很务实的策略:哪个编码器好用就用哪个 。预实验发现 R-GCN(关系图卷积网络)在 AIFB 上表现最好,GraphSAGE(图采样聚合模型)在 CoDEx 和 BioKG 上更合适;解码器方面,AIFB 用 ComplEx 双线性打分,CoDEx 和 BioKG 用关系专用的多层感知机。每个数据集都跑三种配置:Baseline(纯图结构)、SC-Edges(把 subClassOf 当普通边加入图)、SemLoss(本文的语义损失方法)。评估指标用 MRR,每个配置跑10次取均值和标准差,并用 Welch 双侧 t 检验验证显著性。这个对照设计把“改图结构”和“改学习目标”两条技术路线放在同一个尺度下battle,是比较公平的。
层级特征与性能提升的关联分析
先上主菜——表3是三个数据集上的 MRR 结果和参数量对比。
更值得玩味的是和 SC-Edges 的对比。SC-Edges 把 subClassOf 直接加进图里,BioKG 上 MRR 只从0.7232涨到0.7644,参数却从42.30M增加到53.41M;而语义损失方法只用了50.62M参数,提升却大得多。这组对照说明,加边的本质是让消息传递多走几层,而层级信息在长路径上会快速衰减;语义损失则是直接在表示空间上做约束,梯度路径短、目标明确。用更少的参数换更大的提升,这笔账怎么算都划算。
接下来看训练过程。图2展示了 BioKG 五个域在训练过程中语义损失的演化曲线。
为了进一步验证语义损失的普适性,论文还做了一个补充实验:在 BioKG 上分别测试了不同 GNN 编码器(R-GCN、GraphSAGE、GAT)与语义损失的兼容性。结果显示,无论使用哪种编码器,加上语义损失后 MRR 都有稳定提升,提升幅度在12%到16%之间。这说明语义损失并不依赖于特定的消息传递机制,而是作为一种通用的训练目标,可以灵活地叠加到不同的图编码器之上。这个实验虽然放在附录里,但对于想在自己的模型里引入语义损失的读者来说,是很有价值的参考。
方法局限与未来展望
这篇论文的推进很扎实,但也有需要冷静看待的地方。首先,验证规模只有三个数据集,虽然领域跨度够大,但统计能力和结论外推性仍然有限。其次,CoDEx-L 的层级是从 Wikidata 里抽出来的,这类百科类别的构建初衷不是严格的本体推理,语义质量明显低于 GO、UMLS 这类人工精修的生物本体。这或许解释了为什么 CoDEx 上的增益最小——不是方法不行,而是“食材”本身不够好。
实验设计上还有一个自由度:编码器和解码器是“按数据集择优选择”的,AIFB 用 R-GCN + ComplEx,CoDEx 和 BioKG 用 GraphSAGE + 神经网络。这在实验上保证了每个数据集都能派出最强阵容,但也意味着严谨的比较应该在统一架构下再补一组消融。未来值得探索的方向包括:在更多知识图谱上做系统评估,构建更细的层级质量度量指标,以及把语义损失的权重 α 做成自适应调节。如果这些都能落地,本体信息在知识图谱表示学习里的价值还有不少挖掘空间。
还有一个值得思考的问题是:语义损失目前只利用了 subClassOf 这一种本体关系。但真实本体中还有大量其他类型的公理,比如 disjointWith(不相交)、equivalentClass(等价类)、propertyChainAxiom(属性链公理)等。这些公理同样蕴含着丰富的语义约束,理论上也可以转化为类似的几何损失。论文作者在讨论部分提到,将盒嵌入扩展到更丰富的本体公理是未来工作的方向之一,但具体如何设计对应的几何约束,目前还没有成熟的方案。这也为后续研究留下了想象空间。
龙迷三问
这篇论文到底在解决什么问题? 本研究将本体类层级以盒嵌入语义损失形式融入图神经网络,在AIFB、CoDEx和BioKG三个基准上,链接预测MRR分别提升7.6%、2.4%和15.5%,并优于将子类关系直接加边的做法,为知识图谱链接预测提供了参数高效的层级利用范
这篇工作最值得看的点是什么? 语义损失方法在所有三个数据集上均显著优于基线和SC-Edges变体;MRR相对提升AIFB 7.6%、CoDEx 2.4%、BioKG 15.5%
这篇工作的边界或风险在哪里? 优点:方法架构无关、参数效率高、能有效利用本体层级信息;缺点:仅评估三个数据集,层级质量影响大,未与HAKE等层级感知嵌入方法直接对比
如果你还有哪些想要了解的,欢迎在评论区留言或者讨论~
龙哥点评 论文创新性分数: ★★★★☆
将本体类别层级通过盒嵌入的语义包含损失引入GNN编码器,与链接预测任务联合优化,使学习到的实体表示更好地满足本体子类关系约束。
实验合理度: ★★★★☆
MRR(平均倒数排名), Hits@1, Hits@3, Hits@10
学术研究价值: ★★★★☆
将本体类别层级通过盒嵌入的语义包含损失引入GNN编码器,与链接预测任务联合优化,使学习到的实体表示更好地满足本体子类关系约束;更关键的是问题定义是否可复用到同类任务。
稳定性: ★★★☆☆
现有材料未提供充分的极端条件、重复运行或扰动测试,稳定性暂按中性评价。
适应性以及泛化能力: ★★★☆☆
现有材料未完整展示跨数据集、跨场景或分布外实验,泛化能力仍需进一步验证。
硬件需求及成本: ★★★☆☆
未明确报告FLOPs;参数规模从0.51M到50.62M不等
复现难度: ★★★☆☆
https://github.com/filipkro/hgnn-lp
产品化成熟度: ★★★☆☆
论文验证以研究实验为主,真实部署中的时延、成本、维护和异常场景仍需补充验证。
可能的问题: 仅评估三个数据集,层级质量影响大,未与HAKE等层级感知嵌入方法直接对比
主要参考文献
[1] Kronström F., King R.D. Hierarchy-Aware Semantic Losses for Knowledge Graph Link Prediction. arXiv preprint arXiv:2608.22981, 2026.
[2] Bordes A., et al. Translating Embeddings for Modeling Multi-Relational Data. NeurIPS 2013.
[3] Trouillon T., et al. Complex Embeddings for Simple Link Prediction. ICML 2016.
[4] Schlichtkrull M., et al. Modeling Relational Data with Graph Convolutional Networks. ESWC 2018.
[5] Vilnis L., et al. Probabilistic Embedding of Knowledge Graphs with Box Lattice Measures. ICLR 2018.
[6] 项目代码:https://github.com/filipkro/hgnn-lp
*本文仅代表个人理解及观点,不构成任何论文审核或者项目落地推荐意见,具体以相关组织评审结果为准。欢迎就论文内容交流探讨,理性发言哦~ 想了解更多原文细节的小伙伴,可以点击 "阅读原文", 查看更多原论文细节哦!
图谱层级不迷路,龙哥带你看论文更清楚!🚀 欢迎加入龙哥读论文粉丝群,
扫描下方二维码或者添加龙哥助手微信号加群 :kangjinlonghelper。
一定要备注:研究方向+地点+学校/公司+昵称(如 知识图谱+上海+清华+龙哥) ,根据格式备注,可更快被通过且邀请进群。
『龙哥读论文』微信群目前包含:图像处理、大模型及智能体、自动驾驶及机器人、AI医疗及AI金融5个群,知识图谱的小伙伴也会在大模型群里相遇哦~