← 返回 PaperDaily
视觉与图像
组合图像检索去噪新范式:全局结构与动态价值双校准,20%噪声下SOTA
组合图像检索(CIR)领域一直被“三元组噪声”困扰。山东大学这篇ICMR'26的RankVR,别出心裁地用“有效秩”来度量全局结构一致性,再配合课程学习思想动态感知样本价值,思路清奇,效果硬核,值得一读!
龙哥读论文
发布于 2026-08-16 11:00:51
阅读 3
查看原文
🐉 龙哥读论文知识星球来了! 公众号每日8篇拆解不够看?星球 无上限更AI领域论文、资讯、招聘、招博、开源代码, 一站式干货,每日2分钟刷完即赚!
👇扫码加入「龙哥读论文」知识星球,前沿干货、实用资源一站式拿捏~
龙哥推荐理由: 组合图像检索(CIR)领域一直被“三元组噪声”困扰。山东大学这篇ICMR'26的RankVR,别出心裁地用“有效秩”来度量全局结构一致性,再配合课程学习思想动态感知样本价值,思路清奇,效果硬核,值得一读!
原论文信息如下:
假设你是一个用户,想搜一件衣服:你给出一张参考图(比如一件蓝色短袖),再像聊天一样补一句“把袖子改长,变成白色”。系统需要从海量商品里精准找到那件修改后的新衣服——这就是组合图像检索(Composed Image Retrieval, CIR) 要做的事情。它比传统文本搜图更灵活,比图搜图更可控,被认为是未来交互式电商、视觉搜索的关键技术。
但理想很丰满,现实很骨感:大规模CIR数据集的标注成本高得吓人,标注员手一抖,三元组(参考图+修改文本+目标图)就可能对不上号——要么目标图压根不是想要的,要么只对了部分属性。这种Noisy Triplet Correspondence (NTC, 噪声三元组对应) 在真实数据中无处不在,直接把模型的性能拖下水。
早期的去噪方法要么只会处理“二元不匹配”,要么只盯着单个样本的loss值做点估计,完全忽略了样本之间丰富的全局结构关联。结果是:干净样本的全局结构被噪声破坏,困难样本和噪声傻傻分不清。
山东大学团队在ICMR'26发表的RankVR ,就是要终结这种混乱。核心思路:用有效秩(Effective Rank) 这把标尺,量出全局结构的“健康度”,再结合课程学习思想给每个样本打价值分,从而在噪声中精准识别高价值困难样本。听起来很玄乎?往下看。
组合图像检索的“罗生门”:三元组噪声的混乱如何破局?
图1(a)展示了几种典型的噪声类型:完全无关的硬噪声、部分属性匹配但整体不对的局部匹配噪声——这些“罗生门”让模型很难学会正确表征。图1(b) 对干净批次和噪声批次的全球相关性矩阵 做了奇异值分解,发现干净批次的能量高度集中在前几个主奇异值(低秩结构),而噪声批次的谱非常平坦(能量溢出),说明噪声把全局结构捅了个大窟窿。
图1(c) 揭示了第二个难题:困难样本判别不确定性 。同样是低可靠度,有些是因为修改变化太大(高价值困难样本),有些则纯粹是噪声。之前的方法一刀切,要么把困难样本当噪声扔掉(损失性能上限),要么把噪声当困难样本重用(污染模型)。
为了解决这两大挑战,RankVR提出了两个核心模块:全局结构一致性感知(GSCP) 和自适应语义值校准(ASVC) 。整体框架见图2。
破解挑战一:利用“有效秩”感知全局的语义结构崩塌
想象一下:你在一个聚会上,所有客人应该成双成对地站着聊天。现在混进来几个“独行侠”,他们乱跑乱撞,把原本对称的社交结构彻底破坏。干净样本之间的“成对聊天”结构应该是低秩 的(只需少量维度就能描述),而噪声样本就像独行侠,引入了额外的独立维度,让整体结构变得“高秩”了。
GSCP模块正是抓住了这个直觉。它首先为每个batch构建一个全局相关性矩阵P ,这个矩阵包含了查询(query)和目标(target)各自内部以及两者之间的相关性。具体公式如下:
在理想对齐情况下,查询和目标的特征很接近,矩阵P会呈现明显的低秩特性。但噪声会导致线性独立维度增加,矩阵的代数秩会上升。不过代数秩太脆弱,论文改用有效秩(Effective Rank, eRank) ——它通过奇异值分布的香农熵来度量矩阵的“有效维度”。公式如下:
接下来,GSCP采用留一法 来识别具体哪个样本在搞破坏:移除某个样本对后,计算eRank的下降量δi。干净样本移除后eRank几乎不变,而噪声样本移除后eRank会显著下降(因为它贡献了约两个独立维度)。公式如下:
光识别还不够,还要主动强制约束 整体结构更紧凑。论文引入一个低秩正则化损失,直接最小化eRank(P),让特征空间的全局结构更纯净:
这样,GSCP就从宏观结构上把噪声揪出来了,并为下一个模块提供了可靠的可靠度分数wi 。
破解挑战二:将训练样本分“三六九等”,自动识别高价值困难样本
有了GSCP给出的可靠度分数wi,我们就能区分开“干净易学样本”和“破坏结构噪声”,但还有一类“困难干净样本”仍然卡在中间:它们语义匹配正确,但修改幅度大,模型学起来很吃力,预测熵很高,看起来和噪声几乎一样。
ASVC模块的核心思想:就像课程学习一样,先学简单的,再攻克困难的,但决不能把困难样本当噪声扔掉 。它通过两步来给每个样本打“语义价值分”。
第一步:评估内在训练潜力Ri 。对于每个查询,计算它与batch内所有目标的相似度分布,再求该分布的香农熵。熵越低,说明模型对该样本越有把握(低熵 = 干净易学样本)。熵越高,说明模型很困惑——可能是困难样本,也可能是噪声。
第二步:定义语义价值方程 ,将内在潜力Ri和可靠度分数wi融合起来:
干净易学样本 :Ri≈1, wi≈1 → Âi→1 (高价值,全力训练)
噪声样本 :Ri≈0, wi≈0 → 指数≈σ(很小)→ Âi≈0 (低价值,抑制)
困难干净样本 :Ri≈0, wi≈1 → 指数≈1+σ → Âi在0~1之间(中等价值,动态利用)
这样一来,三类样本的价值被清晰地拉开差距。ASVC接着用这个Âi来校准目标分布,构造一个知识一致性损失(Knowledge Consistency Loss, KCL) :对高价值样本,鼓励模型把正样本拉近;对低价值噪声,让目标分布变得平滑,降低其影响。
同时,还使用一个经典的鲁棒对比损失(负学习)来进一步抑制噪声。总损失为:
“降噪”与“提速”的双赢:实验证明RankVR高效且鲁棒
理论说得天花乱坠,还得看实验效果。论文在FashionIQ (服装领域)和CIRR (开放域)两个标准基准上进行了全面评估,并模拟了0%、20%、50%三种噪声比例。
除了精度,计算效率也是落地关键。RankVR虽然在训练时多了eRank计算,但总体参数量和推理速度都不差:
论文还做了大量详细分析,包括GSCP消融(图3)、超参数敏感度(图6)等,限于篇幅不一一展开,但所有结果都一致表明:在噪声场景下,RankVR的优势非常稳健。
龙迷三问
问题1:有效秩(Effective Rank)和传统矩阵的秩有什么区别? 传统秩是离散的整数,通过行列式非零的最大子式大小定义,对轻微的数值扰动非常敏感。有效秩基于奇异值分布的信息熵,是一个连续实数,可以平滑地度量矩阵的“有效维度”。这在深度学习中非常有用——矩阵几乎总是满秩的,但有效秩可以反映其内在低秩结构的程度。
问题2:为什么GSCP模块在干净数据(0%噪声)下反而会导致性能略微下降? 因为低秩正则化损失L_rank强制压缩矩阵的有效秩,这在无噪声时其实是一个多余的约束,可能会轻微干扰特征的学习自由度。表1中0%噪声下RankVR的指标确实比TME略低0.5~1%,但差距很小。在实际应用中,我们总会有噪声,所以这点代价完全可以接受。
问题3:ASVC模块中的σ(先验认知基)如何设定? 论文设定σ=1.0,这个值来自预训练模型(如BLIP)本身已经具备的对齐知识。实际上,σ只要是一个正数即可,它保证了即使wi=0时,有效认知动量也不为零,从而让噪声样本的Âi略大于0,而不是完全丢弃。消融显示σ在0.5~2.0范围内性能稳定。
如果你还有哪些想要了解的,欢迎在评论区留言或者讨论~
龙哥点评
论文创新性分数:★★★★✰ 将有效秩引入CIR噪声检测是一个新颖的思路,ASVC的指数函数融合设计也很有巧思,但整体框架沿用了“检测-重加权”范式,并非完全颠覆性创新。
实验合理度:★★★★★ 对比基线包括近年来最相关的SOTA方法(TME、RCL、RDE等),在两种数据集、三种噪声比例下做了完整对比,消融实验和超参数分析充分,结论可靠。
学术研究价值:★★★★✰ 为CIR噪声问题提供了全局结构视角的解决方案,有效秩的应用具有跨领域推广潜力,对多模态鲁棒学习有参考价值。但方法本身的通用性还需更多验证。
稳定性:★★★✰✰ 在20%和50%噪声下性能提升明显且稳定,但在0%噪声下有轻微下降。依赖批量大小,小batch下eRank估计可能不稳定。实际应用的鲁棒性需要更大规模数据的测试。
适应性以及泛化能力:★★★★✰ 在服装和开放域两个完全不同领域的数据集上都取得了提升,说明方法不局限于特定域。但仅在CIR任务上验证,能否推广到其他三元组组合任务(如VQA、视觉推理)未知。
硬件需求及成本:★★★★✰ 推理时几乎无额外计算(不执行eRank),训练时每次迭代需计算一次SVD,对于batch size=64这样的大小开销不大。无需特殊硬件,单卡V100可训练。
复现难度:★★★★✰ 论文详细给出了公式和算法流程,关键组件清晰。基于BLIP和Q-Former,代码在合理范围内。但未提供开源代码,且eRank的稳定实现需要小心数值处理。
产品化成熟度:★★✰✰✰ 目前处于学术研究阶段,需要在实际的电商搜索等场景中验证噪声比例和分布。GSCP依赖batch内样本数量,在在线推理时无法直接使用。
可能的问题: 1)ASVC中的σ固定为1.0,理论上应与预训练模型相关,缺乏自适应机制;2)留一法计算eRank需要遍历batch,复杂度为O(B^3),当batch很大时(如256)训练效率会明显下降;3)在极端高噪声(如80%)时,全局低秩假设本身可能被大量噪声破坏,GSCP的有效性需要验证。
主要参考文献
[1] Jiale Huang, Zixu Li, Zhiheng Fu, et al. RankVR: Low-Rank Structure Perception and Value Recalibration for Robust Composed Image Retrieval. ICMR 2026.
[2] S. Ha, et al. TME: Composed Image Retrieval with Noisy Correspondence. CVPR 2025.
[3] Z. Wen, et al. Effective Rank: A Measure of Effective Dimensionality. NeurIPS 2019.
[4] Y. Bengio, et al. Curriculum Learning. ICML 2009.
*本文仅代表个人理解及观点,不构成任何论文审核或者项目落地推荐意见,具体以相关组织评审结果为准。欢迎就论文内容交流探讨,理性发言哦~ 想了解更多原文细节的小伙伴,可以点击 "阅读原文", 查看更多原论文细节哦!
欢迎加入龙哥读论文粉丝群,
扫描下方二维码或者添加龙哥助手微信号加群 :kangjinlonghelper。
一定要备注:研究方向+地点+学校/公司+昵称(如 图像处理+上海+清华+龙哥) ,根据格式备注,可更快被通过且邀请进群。
『龙哥读论文』微信群目前包含:图像处理、大模型及智能体、自动驾驶及机器人、AI医疗及AI金融5个群