
模态缺失时VLM性能骤降?问题比想象的更麻烦
测试时logit提示带来无源适应新方案
冻结模型也能高效适应缺失模态
即插即用:与现有提示学习方法无缝集成
实验验证:三大基准全面超越基线
*表格超出部分左右可以滑动
Table 1: Comparison with the baseline on MM-IMDb (Arevalo et al. 2017), UPMC Food-101 (Wang et al. 2015), and Hateful Memes (Kiela et al. 2020) under diferent missing-modality conditions with missing rate \eta = 7 0 \% . “Time (s)” denotes the total adaptation time over the test set with one optimization step. Ours (1) and Ours (5) indicate TLP with 1 and 5 test-time optimization steps, respectively. The best results are highlighted in bold.
龙迷三问
龙哥点评
论文创新性分数:★★★★☆
提出测试时logit提示(TLP)框架,在推理阶段通过优化轻量级logit提示池直接调整冻结视觉语言模型的决策空间,实现无源缺失模态适应。实验合理度:★★★★☆
F1-Macro(MM-IMDb多标签分类)、Top-1准确率(Food-101)、AUROC(Hateful Memes)学术研究价值:★★★★☆
提出测试时logit提示(TLP)框架,在推理阶段通过优化轻量级logit提示池直接调整冻结视觉语言模型的决策空间,实现无源缺失模态适应;更关键的是问题定义是否可复用到同类任务。稳定性:★★★☆☆
现有材料未提供充分的极端条件、重复运行或扰动测试,稳定性暂按中性评价。适应性以及泛化能力:★★★☆☆
现有材料未完整展示跨数据集、跨场景或分布外实验,泛化能力仍需进一步验证。硬件需求及成本:★★★☆☆
仅需优化3C个参数(C为类别数),单步适应时间3-90秒,5步优化即可达到最佳效果。复现难度:★★★☆☆
现有材料未确认完整代码、配置、数据处理脚本和权重是否齐备,复现难度暂按中性评价。产品化成熟度:★★★☆☆
论文验证以研究实验为主,真实部署中的时延、成本、维护和异常场景仍需补充验证。可能的问题:依赖完整模态样本作为语义锚点,当测试批次中完整模态样本极少时可能影响效果;logit级适应对严重分布偏移的建模能力有限。
*本文仅代表个人理解及观点,不构成任何论文审核或者项目落地推荐意见,具体以相关组织评审结果为准。欢迎就论文内容交流探讨,理性发言哦~ 想了解更多原文细节的小伙伴,可以点击"阅读原文",查看更多原论文细节哦!