
视觉幻觉的“稀疏化悖论”:剪枝与保真的两难困境
RVSD核心机制:语义引导稀疏化+按需检索补偿
动态稀疏性模块:什么该留,什么该“下放”
SSVR机制:解码“心虚”时,自动翻记忆库
单次前向传播算法(RVSD):
输入:LVLM模型M,图像v,文本查询x
1. 编码视觉token集合Z_v
2. 循环 t = 1, 2, ... :
3. 用公式(4)-(6)更新文本显著性和平滑视觉相关度分数
4. 将视觉token划分为活跃集S_t和延迟记忆库P_t
5. 定义触发标志trigger
6. 遍历中间层 l 从 l_s 到 l_e:
7. 用公式(8)计算该层的不确定性分数
8. 如果 trigger 为真且 不确定性 > 阈值γ:
9. 用公式(9)以当前隐藏状态查询延迟记忆库
10. 取top-k个token并按公式(10)聚合特征
11. 按公式(11)构建瞬态适配器权重
12. 按公式(13)融合检索到的视觉证据
13. 重置trigger
14. 结束
15. 用公式(3)在活跃集S_t上进行token预测
16. 循环结束
输出:生成的响应序列公式(13)的融合策略
三大骨干模型上的全面验证:效果与效率兼得
判别式幻觉基准:POPE、MME与AMBER-判别
生成式幻觉基准:CHAIR与AMBER-生成
通用能力不掉队:MM-Vet验证
效率优势:延迟降低,峰值显存不升反降
消融与超参分析:每个组件都不可或缺
从RVSD到未来:可信赖LVLM推理的新范式
融会贯通
龙迷三问
龙哥点评
论文创新性分数:★★★★☆
提出RVSD框架,通过语义引导的token稀疏化与语义空间视觉检索机制,在单次前向传播中实现视觉token的动态剪枝与按需补偿,以缓解大视觉语言模型中的视觉幻觉。实验合理度:★★★★☆
POPE准确率与F1分数,MME感知与认知分数,CHAIR_S与CHAIR_I,AMBER准确率/F1/CHAIR/HalRate/Score,MM-Vet总分及各维度分数学术研究价值:★★★★☆
提出RVSD框架,通过语义引导的token稀疏化与语义空间视觉检索机制,在单次前向传播中实现视觉token的动态剪枝与按需补偿,以缓解大视觉语言模型中的视觉幻觉;更关键的是问题定义是否可复用到同类任务。稳定性:★★★☆☆
现有材料未提供充分的极端条件、重复运行或扰动测试,稳定性暂按中性评价。适应性以及泛化能力:★★★☆☆
现有材料未完整展示跨数据集、跨场景或分布外实验,泛化能力仍需进一步验证。硬件需求及成本:★★★☆☆
相比Vanilla解码,RVSD将TFLOPs降低15.6%,TTFT降低20.2%,内存使用减少2.2%,延迟保持与Vanilla相同(1.00×)复现难度:★★★☆☆
现有材料未确认完整代码、配置、数据处理脚本和权重是否齐备,复现难度暂按中性评价。产品化成熟度:★★★☆☆
论文验证以研究实验为主,真实部署中的时延、成本、维护和异常场景仍需补充验证。可能的问题:(1) 熵阈值需要针对不同骨干网络手动调整;
*本文仅代表个人理解及观点,不构成任何论文审核或者项目落地推荐意见,具体以相关组织评审结果为准。欢迎就论文内容交流探讨,理性发言哦~ 想了解更多原文细节的小伙伴,可以点击"阅读原文",查看更多原论文细节哦!