← 返回 PaperDaily 视觉与图像

组合图像检索去噪新范式:全局结构与动态价值双校准,20%噪声下SOTA

组合图像检索(CIR)领域一直被“三元组噪声”困扰。山东大学这篇ICMR'26的RankVR,别出心裁地用“有效秩”来度量全局结构一致性,再配合课程学习思想动态感知样本价值,思路清奇,效果硬核,值得一读!

组合图像检索去噪新范式:全局结构与动态价值双校准,20%噪声下SOTA
🐉 龙哥读论文知识星球来了!
公众号每日8篇拆解不够看?星球无上限更AI领域论文、资讯、招聘、招博、开源代码,一站式干货,每日2分钟刷完即赚! 👇扫码加入「龙哥读论文」知识星球,前沿干货、实用资源一站式拿捏~ xingqiu_header

龙哥推荐理由:
组合图像检索(CIR)领域一直被“三元组噪声”困扰。山东大学这篇ICMR'26的RankVR,别出心裁地用“有效秩”来度量全局结构一致性,再配合课程学习思想动态感知样本价值,思路清奇,效果硬核,值得一读!


原论文信息如下:
论文标题:
RankVR: Low-Rank Structure Perception and Value Recalibration for Robust Composed Image Retrieval
发表日期:
2026年06月
发表单位:
山东大学
原文链接:
https://arxiv.org/pdf/2606.11689v1.pdf
假设你是一个用户,想搜一件衣服:你给出一张参考图(比如一件蓝色短袖),再像聊天一样补一句“把袖子改长,变成白色”。系统需要从海量商品里精准找到那件修改后的新衣服——这就是组合图像检索(Composed Image Retrieval, CIR)要做的事情。它比传统文本搜图更灵活,比图搜图更可控,被认为是未来交互式电商、视觉搜索的关键技术。
但理想很丰满,现实很骨感:大规模CIR数据集的标注成本高得吓人,标注员手一抖,三元组(参考图+修改文本+目标图)就可能对不上号——要么目标图压根不是想要的,要么只对了部分属性。这种Noisy Triplet Correspondence (NTC, 噪声三元组对应)在真实数据中无处不在,直接把模型的性能拖下水。
早期的去噪方法要么只会处理“二元不匹配”,要么只盯着单个样本的loss值做点估计,完全忽略了样本之间丰富的全局结构关联。结果是:干净样本的全局结构被噪声破坏,困难样本和噪声傻傻分不清。
山东大学团队在ICMR'26发表的RankVR,就是要终结这种混乱。核心思路:用有效秩(Effective Rank)这把标尺,量出全局结构的“健康度”,再结合课程学习思想给每个样本打价值分,从而在噪声中精准识别高价值困难样本。听起来很玄乎?往下看。

组合图像检索的“罗生门”:三元组噪声的混乱如何破局?

先看一张图,直观感受下NTC给CIR带来的灾难:
图1:(a) 带有NTC的CIR任务;(b) 全局结构不一致性:噪声批次导致奇异值谱能量溢出,造成显著的结构破坏;(c) 困难样本判别:联合利用内在价值Ri和可靠度分数wi来解耦困难干净样本与噪声
图1:(a) 带有NTC的CIR任务;(b) 全局结构不一致性:噪声批次导致奇异值谱能量溢出,造成显著的结构破坏;(c) 困难样本判别:联合利用内在价值Ri和可靠度分数wi来解耦困难干净样本与噪声
图1(a)展示了几种典型的噪声类型:完全无关的硬噪声、部分属性匹配但整体不对的局部匹配噪声——这些“罗生门”让模型很难学会正确表征。图1(b) 对干净批次和噪声批次的全球相关性矩阵做了奇异值分解,发现干净批次的能量高度集中在前几个主奇异值(低秩结构),而噪声批次的谱非常平坦(能量溢出),说明噪声把全局结构捅了个大窟窿。
图1(c) 揭示了第二个难题:困难样本判别不确定性。同样是低可靠度,有些是因为修改变化太大(高价值困难样本),有些则纯粹是噪声。之前的方法一刀切,要么把困难样本当噪声扔掉(损失性能上限),要么把噪声当困难样本重用(污染模型)。
为了解决这两大挑战,RankVR提出了两个核心模块:全局结构一致性感知(GSCP)自适应语义值校准(ASVC)。整体框架见图2。
图2:RankVR框架总览。包含两个关键组件:(a) GSCP,通过有效秩差值解耦噪声;(b) ASVC,动态识别高价值样本并校准监督信号
图2:RankVR框架总览。包含两个关键组件:(a) GSCP,通过有效秩差值解耦噪声;(b) ASVC,动态识别高价值样本并校准监督信号

破解挑战一:利用“有效秩”感知全局的语义结构崩塌

想象一下:你在一个聚会上,所有客人应该成双成对地站着聊天。现在混进来几个“独行侠”,他们乱跑乱撞,把原本对称的社交结构彻底破坏。干净样本之间的“成对聊天”结构应该是低秩的(只需少量维度就能描述),而噪声样本就像独行侠,引入了额外的独立维度,让整体结构变得“高秩”了。
GSCP模块正是抓住了这个直觉。它首先为每个batch构建一个全局相关性矩阵P,这个矩阵包含了查询(query)和目标(target)各自内部以及两者之间的相关性。具体公式如下:
公式1:全局相关性矩阵P的定义,由四个分块矩阵组成
公式1:全局相关性矩阵P,R_QQ和R_KK分别是查询和目标的自身相关性,R_QK/R_KQ是两者之间的交叉相关性。
在理想对齐情况下,查询和目标的特征很接近,矩阵P会呈现明显的低秩特性。但噪声会导致线性独立维度增加,矩阵的代数秩会上升。不过代数秩太脆弱,论文改用有效秩(Effective Rank, eRank)——它通过奇异值分布的香农熵来度量矩阵的“有效维度”。公式如下:
公式2:有效秩eRank(P)的计算,基于奇异值的归一化熵
公式2:有效秩eRank(P),σj是奇异值。对于低秩矩阵,能量集中在前几个奇异值,熵小,eRank小;噪声矩阵能量分布均匀,熵大,eRank大。
接下来,GSCP采用留一法来识别具体哪个样本在搞破坏:移除某个样本对后,计算eRank的下降量δi。干净样本移除后eRank几乎不变,而噪声样本移除后eRank会显著下降(因为它贡献了约两个独立维度)。公式如下:
公式3:δi = eRank(P) - eRank(P\i)
公式3:δi表示移除第i个样本对后eRank的下降量。(P\i)表示移除对应的行和列后的子矩阵。
然后把这个扰动值映射成一个样本可靠度分数wi
公式4:wi = exp(-δi / (γ·δ̄))
公式4:wi∈[0,1],扰动越大,wi越趋近0,表示该样本可靠性低。γ是超参数,控制敏感度。
光识别还不够,还要主动强制约束整体结构更紧凑。论文引入一个低秩正则化损失,直接最小化eRank(P),让特征空间的全局结构更纯净:
公式5:L_rank = eRank(P)
公式5:L_rank直接惩罚全局相关性矩阵的有效秩,迫使模型保持低秩结构。
这样,GSCP就从宏观结构上把噪声揪出来了,并为下一个模块提供了可靠的可靠度分数wi

破解挑战二:将训练样本分“三六九等”,自动识别高价值困难样本

有了GSCP给出的可靠度分数wi,我们就能区分开“干净易学样本”和“破坏结构噪声”,但还有一类“困难干净样本”仍然卡在中间:它们语义匹配正确,但修改幅度大,模型学起来很吃力,预测熵很高,看起来和噪声几乎一样。
ASVC模块的核心思想:就像课程学习一样,先学简单的,再攻克困难的,但决不能把困难样本当噪声扔掉。它通过两步来给每个样本打“语义价值分”。
第一步:评估内在训练潜力Ri。对于每个查询,计算它与batch内所有目标的相似度分布,再求该分布的香农熵。熵越低,说明模型对该样本越有把握(低熵 = 干净易学样本)。熵越高,说明模型很困惑——可能是困难样本,也可能是噪声。
公式6:归一化相似度分布p_{i,j}
公式6:p_{i,j}是查询i与目标j的归一化相似度(softmax后的概率)。
公式7:Hi = -Σ p_{i,j} log p_{i,j}
公式7:Hi是预测分布的香农熵。
公式8:Ri = 1 - Hi / log B
公式8:Ri∈[0,1],Ri越高代表模型对这个样本把握越大(内在训练潜力高)。
第二步:定义语义价值方程,将内在潜力Ri和可靠度分数wi融合起来:
公式9:Âi = 1 - (1 - Ri)^{wi+σ}
公式9:Âi是最终语义价值,σ是预训练积累的先验认知基(一个常数)。指数(wi+σ)称为有效认知动量。
这个指数函数的妙处在于:

干净易学样本:Ri≈1, wi≈1 → Âi→1 (高价值,全力训练)

噪声样本:Ri≈0, wi≈0 → 指数≈σ(很小)→ Âi≈0 (低价值,抑制)

困难干净样本:Ri≈0, wi≈1 → 指数≈1+σ → Âi在0~1之间(中等价值,动态利用)

这样一来,三类样本的价值被清晰地拉开差距。ASVC接着用这个Âi来校准目标分布,构造一个知识一致性损失(Knowledge Consistency Loss, KCL):对高价值样本,鼓励模型把正样本拉近;对低价值噪声,让目标分布变得平滑,降低其影响。
公式10:L_KCL = (1/B) Σ D_KL(y_i || p_i)
公式10:KCL,其中y_i是校准后的目标分布(对角线上为Âi,其余为(1-Âi)/(B-1)),p_i是模型预测的相似度分布。
同时,还使用一个经典的鲁棒对比损失(负学习)来进一步抑制噪声。总损失为:
公式11:总损失 = L_task + λ1*L_rank + λ2*L_KCL
公式11:总损失,L_task为鲁棒对比损失(公式略),λ1, λ2是平衡超参数。
插图
这个“有效认知动量”的设计确实很有新意,用一个简洁的指数函数就把三类样本的价值同步区分开来,避免了复杂的门控网络或阈值设置。

“降噪”与“提速”的双赢:实验证明RankVR高效且鲁棒

理论说得天花乱坠,还得看实验效果。论文在FashionIQ(服装领域)和CIRR(开放域)两个标准基准上进行了全面评估,并模拟了0%、20%、50%三种噪声比例。
先看主实验结果表:
表1:在CIRR测试集和FashionIQ验证集上的性能对比(R@K%和Rsub@K%)。粗体为最好,下划线为第二好。
表1:主实验结果。RankVR(ours)在20%和50%噪声下全面超越前SOTA方法TME,尤其在CIRR 20%噪声下R@5达到81.72%,比TME高0.7%;在FashionIQ 50%噪声下平均R@10/R@50达到62.61%,比TME高0.75%。注意在0%噪声下RankVR略逊于TME,说明额外模块在无噪声时有一定副作用,但差距极小。
除了精度,计算效率也是落地关键。RankVR虽然在训练时多了eRank计算,但总体参数量和推理速度都不差:
表2:SPRC、TME和RankVR的计算复杂度和效率对比
表2:RankVR的模型大小仅比TME大0.2M,训练时间略增,但推理速度(FPS)几乎不变,说明额外模块主要增加训练计算量,推理时几乎无负担。
消融实验进一步验证了各组件的必要性:
表3:不同损失组件在CIRR和FashionIQ上的消融研究。粗体为最好。
表3:移除L_rank或L_KCL后性能均有下降,说明GSCP和ASVC都贡献了各自的作用。同时使用两者达到最佳。
论文还做了大量详细分析,包括GSCP消融(图3)、超参数敏感度(图6)等,限于篇幅不一一展开,但所有结果都一致表明:在噪声场景下,RankVR的优势非常稳健。
最后,一个直观的案例研究展示了修正效果:
图7:(a) FashionIQ和(b) CIRR上的案例研究。红色框表示检索错误,绿色框表示正确。
图7:案例对比。第一行为其他方法的Top-1结果,第二行为RankVR的Top-1结果。可以看到在噪声比例20%下,TME等基线经常检索出完全不相关的图片,而RankVR能正确找到目标。

龙迷三问

下面是龙哥对于大家可能的一些问题的解答:

问题1:有效秩(Effective Rank)和传统矩阵的秩有什么区别?传统秩是离散的整数,通过行列式非零的最大子式大小定义,对轻微的数值扰动非常敏感。有效秩基于奇异值分布的信息熵,是一个连续实数,可以平滑地度量矩阵的“有效维度”。这在深度学习中非常有用——矩阵几乎总是满秩的,但有效秩可以反映其内在低秩结构的程度。

问题2:为什么GSCP模块在干净数据(0%噪声)下反而会导致性能略微下降?因为低秩正则化损失L_rank强制压缩矩阵的有效秩,这在无噪声时其实是一个多余的约束,可能会轻微干扰特征的学习自由度。表1中0%噪声下RankVR的指标确实比TME略低0.5~1%,但差距很小。在实际应用中,我们总会有噪声,所以这点代价完全可以接受。

问题3:ASVC模块中的σ(先验认知基)如何设定?论文设定σ=1.0,这个值来自预训练模型(如BLIP)本身已经具备的对齐知识。实际上,σ只要是一个正数即可,它保证了即使wi=0时,有效认知动量也不为零,从而让噪声样本的Âi略大于0,而不是完全丢弃。消融显示σ在0.5~2.0范围内性能稳定。

如果你还有哪些想要了解的,欢迎在评论区留言或者讨论~

龙哥点评

论文创新性分数:★★★★✰将有效秩引入CIR噪声检测是一个新颖的思路,ASVC的指数函数融合设计也很有巧思,但整体框架沿用了“检测-重加权”范式,并非完全颠覆性创新。

实验合理度:★★★★★对比基线包括近年来最相关的SOTA方法(TME、RCL、RDE等),在两种数据集、三种噪声比例下做了完整对比,消融实验和超参数分析充分,结论可靠。

学术研究价值:★★★★✰为CIR噪声问题提供了全局结构视角的解决方案,有效秩的应用具有跨领域推广潜力,对多模态鲁棒学习有参考价值。但方法本身的通用性还需更多验证。

稳定性:★★★✰✰在20%和50%噪声下性能提升明显且稳定,但在0%噪声下有轻微下降。依赖批量大小,小batch下eRank估计可能不稳定。实际应用的鲁棒性需要更大规模数据的测试。

适应性以及泛化能力:★★★★✰在服装和开放域两个完全不同领域的数据集上都取得了提升,说明方法不局限于特定域。但仅在CIR任务上验证,能否推广到其他三元组组合任务(如VQA、视觉推理)未知。

硬件需求及成本:★★★★✰推理时几乎无额外计算(不执行eRank),训练时每次迭代需计算一次SVD,对于batch size=64这样的大小开销不大。无需特殊硬件,单卡V100可训练。

复现难度:★★★★✰论文详细给出了公式和算法流程,关键组件清晰。基于BLIP和Q-Former,代码在合理范围内。但未提供开源代码,且eRank的稳定实现需要小心数值处理。

产品化成熟度:★★✰✰✰目前处于学术研究阶段,需要在实际的电商搜索等场景中验证噪声比例和分布。GSCP依赖batch内样本数量,在在线推理时无法直接使用。

可能的问题:1)ASVC中的σ固定为1.0,理论上应与预训练模型相关,缺乏自适应机制;2)留一法计算eRank需要遍历batch,复杂度为O(B^3),当batch很大时(如256)训练效率会明显下降;3)在极端高噪声(如80%)时,全局低秩假设本身可能被大量噪声破坏,GSCP的有效性需要验证。


主要参考文献

[1] Jiale Huang, Zixu Li, Zhiheng Fu, et al. RankVR: Low-Rank Structure Perception and Value Recalibration for Robust Composed Image Retrieval. ICMR 2026.
[2] S. Ha, et al. TME: Composed Image Retrieval with Noisy Correspondence. CVPR 2025.
[3] Z. Wen, et al. Effective Rank: A Measure of Effective Dimensionality. NeurIPS 2019.
[4] Y. Bengio, et al. Curriculum Learning. ICML 2009.

*本文仅代表个人理解及观点,不构成任何论文审核或者项目落地推荐意见,具体以相关组织评审结果为准。欢迎就论文内容交流探讨,理性发言哦~ 想了解更多原文细节的小伙伴,可以点击"阅读原文",查看更多原论文细节哦!       

end
欢迎加入龙哥读论文粉丝群,扫描下方二维码或者添加龙哥助手微信号加群:kangjinlonghelper。一定要备注:研究方向+地点+学校/公司+昵称(如 图像处理+上海+清华+龙哥),根据格式备注,可更快被通过且邀请进群。
『龙哥读论文』微信群目前包含:图像处理、大模型及智能体、自动驾驶及机器人、AI医疗及AI金融5个群
wechat_helper dianzan
转发文章 微博 X LinkedIn Facebook
龙哥读论文 · PaperDaily

本文基于龙哥读论文 PaperDaily 数据库整理,结合论文原文与工程视角进行解读。