← 返回 PaperDaily
视觉与图像
电子科大等提出FreqDiff:频域扩散让四大基准16项指标全面SOTA
想象一个场景:某情报分析系统正在滚动监测全球事件流,屏幕突然弹出一条提示——“未来一周,A国可能与B国启动贸易谈判”。
龙哥读论文
发布于 2026-08-26 00:20:12
阅读 2
查看原文
原论文信息如下:
想象一个场景:某情报分析系统正在滚动监测全球事件流,屏幕突然弹出一条提示——“未来一周,A国可能与B国启动贸易谈判”。这不是科幻片情节,而是时间知识图谱外推(Temporal Knowledge Graph Extrapolation)想解决的真实问题:从海量历史事件中捕捉演化规律,去预测尚未发生的事实。
但这事儿远比听起来麻烦。一个主体(比如某个国家)的历史事件浩如烟海:跟C国打过嘴仗、跟D国签过合作协议、跟E国搞过联合军演……当模型要预测“A国将与谁开展合作”时,那些指责、抗议、制裁等历史记录虽然都与A国相关,但对于“合作”这个查询却基本是干扰信息。如果模型不加区分地把所有历史事件一视同仁地塞进编码器,真正关键的证据信号反而会被淹没在“相关但不重要”的噪声里。
今天要聊的这篇论文,正是冲着这个痛点来的。电子科技大学、浙江大学、腾讯微信团队等单位的研究者提出了一种名为FreqDiff(Frequency-aware Diffusion,频率感知扩散框架)的新方法,在时间知识图谱外推任务上直接拿下四大公开基准的16项指标全面最优。结果确实能打,但更让龙哥眼前一亮的是它的思路——把频域建模引入扩散去噪过程,用“频谱校准”的方式来过滤历史上下文中的噪声信号。
时间知识图谱预测的困境:噪声历史如何干扰未来推理
先补个基础概念。所谓时间知识图谱,可以理解为一张记录了“谁在什么时间对谁做了什么”的大网。它把现实世界的事件表示成四元组 (s, r, o, t),意思是主体 s 和客体 o 在时间戳 t 发生了关系 r。比如 (中国, 签署协议, 法国, 2026-01-15) 就是一条典型的事件记录。如果把每个时间点的三元组集合看成一张静态知识图谱快照,那么整个时间知识图谱就是一系列按时间排列的快照组成的长序列。
本论文研究的是其中的外推(Extrapolation)任务,也就是使用截至当前时刻 t 之前的历史事件窗口,去预测 t 时刻之后即将发生的事实。打个比方:就像看了一个人过去十年的社交动态,要预测他下周大概率会跟谁吃饭、聊什么话题。这个问题也被称为未来事实预测,在舆情预警、金融风险研判、国际关系分析等场景里都有实际价值。
图1很形象:当查询是“美国将与谁开展合作”时,美国过去几个月里与其他国家发生的所有事件都会被模型当作上下文。但其中那些指责、抗议、制裁类的事件,跟“合作”这个查询在语义上几乎是反着的。把它们不加区分地混进历史编码,非但不能提供有效的证据,反而会把表示空间搅浑,让模型难以锁定真正有判别力的信号。这就是论文里提到的第一个问题——查询特定证据的区分度不足。
第二个问题则出在损失函数上。以往的扩散式TKG推理方法,主要是用重建损失或排序损失来监督去噪过程。这些损失函数约束了去噪后的表示在嵌入空间中要接近金标准实体,却没有显式地保持表示在频域上的结构。也就是说,模型并不知道未来对象在频域上应该长什么样,只能靠隐式地学习。论文作者敏锐地意识到:如果能把频域的信息利用起来,给去噪过程多一个维度的约束,效果可能更好。
FreqDiff核心机制:双流去噪器如何实现上下文感知频谱校准
要说清楚FreqDiff的设计,得先对扩散模型有个大概的印象。扩散模型包含两个过程:前向过程逐步向干净数据注入高斯噪声,直到数据被破坏成接近纯噪声;反向过程则训练一个神经网络,学会从带噪数据中一步步去噪,还原出干净数据。用于时间知识图谱外推时,模型把“未来要预测的对象实体表示”当作目标,在训练时给它加噪,然后让去噪网络根据历史条件把它还原出来。
FreqDiff在整体流程上延续了这条路线,但做了一个关键改造:去噪网络不再是单一的Transformer编码器,而是拆成双流结构——一个时间流负责建模事件序列的依赖关系,一个频谱流负责从频域角度重新校准表示。两条流的信息最后融合,共同预测未来对象。
先看前向过程。与传统扩散模型对整个输入加噪不同,FreqDiff只对查询位置的目标对象表示加噪,历史事件部分保持确定性不动。这样一来,模型在反向去噪时就有一个明确的“锚”,知道要还原的只是查询槽位的那个对象,而不是整段序列。这就叫“查询槽去噪”(query-slot denoising)。噪声强度由累计噪声调度控制,论文里还设计了一个全局缩放因子δ来调节整体扩散强度。
接下来是核心的双流去噪器。输入构造时,模型把历史对象的嵌入序列与带噪的目标表示拼接在一起,再叠加关系序列、相对时间序列以及扩散步数的嵌入,得到条件化的隐藏状态。这个状态被同时送入两个分支。
时间分支比较好理解,就是用一个标准Transformer编码器来做时序依赖建模,捕捉事件前后顺序、关系之间的转移规律。
真正有看头的是频谱分支。这里涉及一个关键操作——快速傅里叶变换(Fast Fourier Transform,FFT)。FFT可以将一个时域信号分解成不同频率分量的叠加,让模型看到“什么频率的成分占主导”。类比来说,一段音乐可以分解成低音、中音、高音,FFT就是在干这个事。
FreqDiff的频谱分支运作流程是这样的:先把历史部分的隐藏状态做平均池化(mean pooling),压缩成一条上下文向量,再经过一个MLP映射成路由系数(routing coefficients)。这些路由系数不是直接去修改特征,而是用来“合成”滤波器——从一组可学习的基滤波器里按权重线性组合出当前上下文特有的频谱滤波器。也就是说,不同查询、不同历史会得到不同的滤波器,这比所有样本共享一个静态滤波器要灵活得多。
滤波器构造好之后,模型把隐藏状态按特征维度分成G个组,对每一组单独做FFT变换到频域,然后用对应的滤波器逐元素调制频谱的实部和虚部。再把调制后的各组拼接起来,通过逆FFT(Inverse FFT)映射回时域,就得到了频谱校准后的表示。这个过程可以理解为:模型在频域上决定哪些频率成分要保留、哪些要压制,从而实现对历史上下文的“去噪”。
最后,时间分支和频谱分支的输出通过一个可调节的融合系数α做加权和,得到融合表示,查询位置的那个向量就是去噪后的目标对象表示。
频域正则化:为何在频谱空间对齐目标表示能提升判别力
双流去噪器负责把目标对象“生成”出来,那怎么保证生成的结果真的接近金标准对象呢?FreqDiff用了两重约束。
第一重是常规的重建损失。去噪得到的表示与实体嵌入矩阵做点积,再经过Softmax归一化得到每个候选实体的概率,用交叉熵损失拉近金标准对象的概率。这个损失函数在嵌入空间约束模型,是判别任务的标准做法。
第二重就很有意思了——频率域一致性正则化。简单说,模型不仅要求去噪后的表示在嵌入空间接近金标准对象,还要求它们在做FFT变换后,频域的实部和虚部分别也接近。也就是说,在频谱空间里再来一次对齐。这就像不仅要求两个人长得像,还要求他们的“声纹”也一致,多了一个判别维度。
为什么这样做有效?论文里给了很关键的分析:实体嵌入是模型从数据里学出来的连续向量,其特征维度之间往往存在某种结构性的频率模式。某些频率分量可能对应着“周期性出现的交互模式”,另一些则对应着“一次性事件”。如果把去噪表示在这些频率分量上拉近,模型就能更精细地保留那些对区分实体至关重要的频谱线索。消融实验中,去掉这个频域正则化项(w/o. L_fft)后,ICEWS14上的MRR从50.85%掉到49.30%,说明提供了实实在在的增益。
这里还有一个值得注意的细节:论文在频域正则化器中用的是ℓ1距离而不是ℓ2距离。消融实验表明,换用ℓ2距离(w. ℓ2 Distance)后效果反而下降。原因在于ℓ1对离群点更鲁棒,当某些频率分量上有较大的异常波动时,ℓ2会把损失过度放大,影响训练稳定性。这种细节上的考量体现了作者对频域特性的深入理解。
实验全面验证:四大基准全面领先,消融与泛化分析支撑设计合理性
实验部分,论文选用了时间知识图谱推理领域最常用的四个公开基准:ICEWS14、ICEWS05-15、ICEWS18和GDELT。前三个来自综合危机早期预警系统(Integrated Crisis Early Warning System,ICEWS),记录全球范围内的政治事件;GDELT则来自全球事件、语言和语调数据库(Global Database of Events, Language, and Tone),规模更大、事件类型更复杂。评价指标采用标准的MRR(Mean Reciprocal Rank,平均倒数排名)和Hits@1/3/10(前1/3/10名命中率)。
表1给出了FreqDiff与近20个基线模型的对比结果。这里包含静态方法(如DistMult、ConvE、RotatE)、插值方法(如TTransE、TA-DistMult、DE-SimpIE)和外推方法(如RE-NET、RE-GCN、CEN、TiRGN、CENET、THCN、DiffuTKG、NADEx等)。结果显示,FreqDiff在四个数据集、全部16项指标上均取得最优成绩,相对最强基线的提升幅度在1.14%到16.14%之间。
龙哥特别注意到GDELT上的涨幅:MRR相对提升6.73%,Hits@1更是暴涨16.14%。GDELT是四个基准中事件演化最复杂、噪声最多的数据集,这个结果恰恰说明频域建模在处理复杂时序模式时的独特优势——越是混乱的场景,通过频域分离信号与噪声的价值就越凸显。这就像在嘈杂的鸡尾酒会上,普通人可能什么也听不清,但一个训练有素的调音师却能准确分离出每一条声轨。
消融实验一共设计了七个变体,分别验证频域分支、时间分支、频域正则化损失、距离函数选择、滤波器类型以及池化方式的作用。表2的结果有几个关键信息点:去掉时间分支(w/o. Time)伤害最大,说明时间依赖建模依然是整个模型的核心支柱;去掉频域分支(w/o. Freq)也会带来一致性的性能下降,说明频谱信息确实提供了时间域之外的互补信号;把上下文感知滤波器换成全局滤波器或静态滤波器,效果都有明显回落,证明“上下文感知”这个设计不是花架子——让滤波器随查询历史动态变化,比任何固定的滤波器都更能抓住当前查询需要的特定频谱模式。
论文还专门分析了频域正则化的有效性。在表3中,可以看到加入频域正则化项后,在不同查询类别(如合作、谈判、对抗等)上的命中率都有不同程度提升,其中部分类别的提升幅度相当可观。这说明频域对齐带来的增益不是集中在某几类简单模式上,而是对不同类型的未来事件预测都有帮助。
除了标准评测,论文还做了一系列扩展分析。图4的序列损坏实验很有意思:随机损坏历史序列中一定比例的事件,再测试模型性能。结果显示FreqDiff在损坏比例增大时性能下降更平缓,说明它对历史噪声的鲁棒性确实更强,这也从侧面验证了频谱校准的“抗噪”能力。
图6的频谱能量分布可视化则更加直观地展示了频域建模的效果。对比FreqDiff和去掉频域分支的变体,可以看到完整模型学到的频谱能量分布更加集中、更有结构性,而缺少频域分支时,频谱能量分布显得更弥散、噪声更多。这从可视化层面印证了频域校准确实在“整理”表示空间的频谱结构。
在超参数分析中,论文分别探讨了特征组数G、基滤波器数量F、频域正则化权重λ以及双流融合权重α的影响。结果显示模型对这些超参数整体比较稳定,在相当宽的取值范围内都能保持较好性能,只有在极端取值时才会出现明显下降。这说明FreqDiff不需要精细调参就能工作得不错,工程实用性有保障。
此外,论文还在YAGO和WIKI两个数据集上做了额外验证,证明FreqDiff不是只在ICEWS系列上有效,对通用知识图谱数据同样有提升。与LLM基线的对比实验中,FreqDiff也全面超过了GPT-4等大模型的零样本预测效果。在计算效率方面,得益于一步推理策略,FreqDiff在保持SOTA精度的同时,推理速度也相当可观。案例研究进一步展示了FreqDiff在具体查询上的预测质量——对于真实的未来事件,FreqDiff给出的Top-5候选命中金标准实体的概率更高,预测结果更合理。
从FreqDiff看TKG推理的未来方向与可迁移启示
FreqDiff的出现,释放了一个值得关注的信号:频域建模正在从信号处理和图像修复等领域,向知识图谱推理渗透。过去大家习惯在时域(或者说嵌入空间)里做文章,但时间序列数据本身就有丰富的频域特征——周期性、趋势性、突发性,这些在时域上纠缠不清的模式,到了频域往往能被干净地区分开。这个思路不仅适用于TKG外推,对于一般的时序预测任务都有参考价值。
龙哥觉得,FreqDiff最值得借鉴的不是某个具体模块,而是它的设计哲学:不要只在一个表征空间里做文章。时域建模擅长捕捉顺序依赖,频域建模擅长分离周期与噪声,两者结合往往能产生1+1>2的效果。当前大模型研究也呈现出类似的趋势——多模态、多视角、多尺度的融合正在成为性能突破的重要来源。FreqDiff在TKG这个垂直领域验证了这种“时频双流”范式的有效性,后续完全可以迁移到事件预测、推荐系统、金融时序分析等更广泛的场景中。
当然,FreqDiff也有它的局限。比如上下文感知滤波器的可解释性还比较有限——我们只知道模型在频域上“做了什么”,但很难直观解释“为什么这个查询需要保留这些频率分量”。此外,虽然论文在多个数据集上验证了有效性,但真实业务场景中的数据分布漂移、事件类型稀疏等问题,还需要更充分的验证。
龙迷三问
这篇论文到底在解决什么问题? 电子科大等机构提出FreqDiff,将时间知识图谱外推中的未来对象预测建模为查询槽去噪,通过双流去噪器融合时间建模与上下文感知频谱校准,并以频域一致性正则化对齐目标表示。
这篇工作最值得看的点是什么? 在四个基准数据集上全面取得最优结果,16项评估指标全部第一,相对最强基线提升1.14%-16.14%;在YAGO和WIKI知识中心数据集上也取得一致最优;与LLM基方法对比在11/16组合上最优。
这篇工作的边界或风险在哪里? 优点:1) 创新性地将频域建模引入TKG扩散推理,提供互补于时域建模的判别信号;2) 上下文感知频谱滤波器能自适应调整去噪表示,有效区分查询相关证据与非显著历史事实;3) 频域正则化具有即插即用性,可迁移至其他模型;4) 推理效率高,参数开销小。缺点:1) 依赖有限的可学习基滤波器,对高度不规则或领域特定的时序动态建模灵活性受限;2) 数据集主要集中于政治国际关系事件,泛化性有待验证;3) 频谱分支的均值池化可能丢失部分细粒度历史信息。
如果你还有哪些想要了解的,欢迎在评论区留言或者讨论~
龙哥点评 论文创新性分数: ★★★★☆
提出FreqDiff框架,将未来对象预测建模为查询槽去噪过程,通过双流去噪器结合时序依赖建模与上下文感知频谱校准,并引入频域一致性正则化来增强扩散模型对时间知识图谱外推的判别能力。
实验合理度: ★★★★☆
MRR, Hits@1, Hits@3, Hits@10(时间感知过滤协议)
学术研究价值: ★★★★☆
提出FreqDiff框架,将未来对象预测建模为查询槽去噪过程,通过双流去噪器结合时序依赖建模与上下文感知频谱校准,并引入频域一致性正则化来增强扩散模型对时间知识图谱外推的判别能力;更关键的是问题定义是否可复用到同类任务。
稳定性: ★★★☆☆
现有材料未提供充分的极端条件、重复运行或扰动测试,稳定性暂按中性评价。
适应性以及泛化能力: ★★★☆☆
现有材料未完整展示跨数据集、跨场景或分布外实验,泛化能力仍需进一步验证。
硬件需求及成本: ★★★☆☆
在ICEWS14上推理时间7.28s,参数量17.00Mb;在ICEWS18上推理时间81.24s,参数量32.83Mb(NVIDIA A100 GPU)。
复现难度: ★★★☆☆
现有材料未确认完整代码、配置、数据处理脚本和权重是否齐备,复现难度暂按中性评价。
产品化成熟度: ★★★☆☆
论文验证以研究实验为主,真实部署中的时延、成本、维护和异常场景仍需补充验证。
可能的问题: 1) 依赖有限的可学习基滤波器,对高度不规则或领域特定的时序动态建模灵活性受限;
主要参考文献
Yanglei Gan, Peng He, Run Lin, Peiyuan Jiang, Yifan Wang, Qiao Liu. Denoising the Future: Context-Aware Spectral Diffusion for Temporal Knowledge Graph Extrapolation. arXiv preprint arXiv:2608.20804, 2026.
Cai et al. DiffuTKG: Uncertainty-aware temporal knowledge graph reasoning with diffusion models. 2024.
Gan et al. NADEx: Negative-aware diffusion for temporal knowledge graph extrapolation. 2026.
Li et al. Temporal knowledge graph reasoning based on evolutional representation learning (RE-GCN). SIGIR, 2021.
Jin et al. Recurrent event network: Autoregressive structure inference over temporal knowledge graphs (RE-NET). 2020.
*本文仅代表个人理解及观点,不构成任何论文审核或者项目落地推荐意见,具体以相关组织评审结果为准。欢迎就论文内容交流探讨,理性发言哦~ 想了解更多原文细节的小伙伴,可以点击 "阅读原文", 查看更多原论文细节哦!