← 返回 PaperDaily
视觉与图像
北京理工大学新方法:让模型“说实话”再追求精准
这篇论文把一个很现实的问题挑明了:多模态大模型不是不会说细节,而是细节一多就更容易“翻车”。GRANFACT、层级评测和RP-DPO三件套,正好把“说得更细”和“说得更准”这对老冤家拎到台面上狠狠干一架。
龙哥读论文
发布于 2026-08-27 00:20:07
阅读 3
查看原文
🐉 龙哥读论文知识星球来了! 公众号每日8篇拆解不够看?星球 无上限更AI领域论文、资讯、招聘、招博、开源代码, 一站式干货,每日2分钟刷完即赚! 👇扫码加入「龙哥读论文」知识星球,前沿干货、实用资源一站式拿捏~
龙哥推荐理由: 这篇论文把一个很现实的问题挑明了:多模态大模型不是不会说细节,而是细节一多就更容易“翻车”。GRANFACT、层级评测和RP-DPO三件套,正好把“说得更细”和“说得更准”这对老冤家拎到台面上狠狠干一架。
原论文信息如下:
01. 让“大模型”开口说话:从“胡说八道”到“言之有物”的细粒度革命?
多模态大模型现在最常见的毛病,不是“看不见”,而是“看见了还不敢说准”。说大白话就是:让它描述一张图时,先说“这是个手机”通常没问题;一旦追问到“这是哪一代、什么型号、哪个细节”,模型就开始表演“自信地猜”。这篇论文盯住的,正是这个很现实的矛盾:细粒度描述越具体,出错风险越高 ,而不是越细越高级。
这件事听着像“要求模型少说点”,其实恰恰相反。论文提出的目标不是让模型变得保守到只会说“这是个东西”,而是让它学会一个更像人类的策略:先确认自己真的看懂了,再往更细的层级走 。能说“iPhone”就别硬拗“iPhone 17 Pro”;能说“轿车”就别急着报具体车系。细节不是越多越好,细节得是“站得住”的细节。
为了把这个问题说清楚,论文做了三件事:先造了一个专门考“细粒度可靠性”的数据集 GRANFACT;再做了一套能跨层级判断对错的评测方法;最后用 RP-DPO 把模型训练成“先保真,再求精”的风格。三板斧很朴素,但方向很对,因为它抓住了大模型落地里最烦人的那类问题:不是不会说,而是不知道该说到多细才算稳 。
02. 一个棘手的矛盾:为什么模型越“细”,就越容易“错”?
这篇论文最关键的判断,是把“细粒度生成”从单纯的能力问题,改写成了一个可靠性—细粒度权衡 问题。直白点说,模型往更细的层级走,就像把导航从“到北京”切到“到某条胡同门牌号”,路线越具体,走错的概率也越高。因为细粒度类别之间往往视觉差异小、语义边界窄,模型很容易把“像”当成“是”。
论文在理论上也给了一个很干脆的结论。用语义树表示类别层级后,越细的切分集合,其最优语义风险不会更低。对应原文里的结论就是:粗粒度的最优风险 ≤ 细粒度的最优风险 。翻译成人话,就是“层级越细,天然越难做对”。这不是训练不努力,而是问题本身就更难。
论文还指出了一个容易被忽略的坑:开放式多目标描述里,评测不能只看“说了什么”,还得先搞清楚“这句话到底在指谁”。如果一张图里有多个对象,模型的回答可能把不同对象混在一起,或者把一个对象说成另一个相近对象。只要评测不做全局对齐,就容易把“重复说了一堆”误当成“真的说对了”。这个问题不解决,后面的训练优化就像在雾里开车,踩油门踩得再猛也不一定往对的方向走。
03. GRANFACT登场:一个让模型“说实话”的“公平秤”和“度量衡”
既然问题是“细粒度越细越容易错”,那就得有一个专门的考场来测。GRANFACT 就是这篇论文做出来的“细粒度可靠性考场”。它不是普通图像问答集,而是带层级标注、带多对象、带专家核验 的多模态基准,专门用来考模型能不能在多层语义树里稳稳地说对。
这个数据集一共 581 张图,覆盖 7 个领域:日常物品、植物、动物、汽车、电子产品、地标和游戏。每个图里的实体都不是简单贴一个标签,而是给出从粗到细的一串类别路径,还会标注数量和视觉属性。换句话说,它不是在问“这是什么”,而是在问“这东西能说到哪一层,而且还能说对吗”。
评测这件事,论文也没有偷懒。它先把模型自由生成的回答解析成结构化实体,再把这些预测实体和真实实体做分配。难点在于,模型可能说多了、说少了、说串了,甚至说出根本不存在的东西。于是论文引入一个“虚拟幻觉实体”,把不靠谱的预测统统接住,避免评测系统瞎给分。
更妙的是,论文不是简单地把“对”与“错”二分,而是把评分拆成两层:可靠性优先 ,然后在可靠的前提下再看细粒度程度。这个设计很像一个严苛但讲理的老师:先问“你说的是不是事实”,再问“你说得够不够细”。
04. 核心绝招:RP-DPO——如何教模型在“正确”的基础上追求“精准”?
方法部分的重点,是一个叫 RP-DPO 的训练策略。这里的 DPO 是 Direct Preference Optimization,直接偏好优化 ,一种不显式训练奖励模型、而是直接利用偏好对来优化策略模型的方法。RP-DPO 的意思更直白:先优先保证可靠,再在可靠样本里鼓励更细的表达 。
第一步叫 RSR,也就是 Reliability-Guided Semantic Rollback,可靠性引导的语义回滚 。名字听着像游戏读档,逻辑也差不多:如果模型把某个对象说错了,就把这个错误描述“回滚”到更粗但仍然正确的祖先类别;如果连祖先类别都对不上,那就直接删掉。这样做的目的不是“洗白错误答案”,而是从错误回答里构造出一个尽可能可靠的正样本。
第二步是构造偏好对。论文把偏好分成两类:一类是可靠性偏好,优先让模型学会“别乱说”;另一类是细粒度偏好,在都可靠的前提下再比较谁说得更细。这个顺序很关键,因为如果先鼓励细,模型很可能学成“越细越敢编”;如果先守住可靠性,再谈细节,训练方向就稳了。
第三步是带边际的 DPO 损失。普通 DPO 只是让“好回答”的偏好概率高于“坏回答”,而这里还额外加了一个 margin,也就是“至少要赢多少”的要求。对可靠性偏好,margin 设得更大;对细粒度偏好,margin 设得更小。这个设计很像在公司里排优先级:先把不能出事的任务做稳,再去卷体验和精度 。
这套方法的气质很明确:不追求花里胡哨,先把“别乱说”这件事做扎实,再谈“说得更细”。这才像真正能落地的训练策略。
05. 实验结果:不仅“准”了,还更“精”了,甚至比肩科幻级模型!
实验部分先回答了一个很现实的问题:别的方法是不是也能靠提示词把模型“逼细”?答案是,能提升一点,但代价通常是可靠性下降。也就是说,单靠提示词只能调风格,调不出稳定的层级判断能力 。这就像让一个人“说得更像专家”,不等于他真的更懂。
从表1可以看出,Qwen3-VL-8B-Instruct 在激进提示下虽然更“细”,但 IR 明显下滑;而经过 RP-DPO 后,模型在相近设置下能够把可靠性拉回去,同时细粒度指标也不掉。这个结果的价值不在于某个数值多漂亮,而在于它证明了一件事:训练目标改对了,模型就不必在“说细”和“说对”之间二选一 。
数据集本身的统计也说明,这不是一个“随便挑几张图”的小玩具。实体层级深度、对象数量、属性标注都比较丰富,所以能逼出模型在真实多对象场景里的短板。辅助训练集则是从 GRANFACT 的类别标签出发,额外检索和合成了 525 张结构化单对象图像,和测试集严格分开,用来支撑 RP-DPO 的训练。
06. 总结与展望:大模型可靠性的“最后一公里”,我们走到哪了?
这篇论文的价值,不在于又发明了一个“更会吹”的提示词技巧,而在于它把一个被很多工作轻轻带过的问题挑明了:细粒度生成不是单纯的能力炫技,而是可靠性与精确性之间的工程权衡 。如果模型只会粗略地说对,那离真正可用还差一截;如果模型为了细节开始乱猜,那就更麻烦。
GRANFACT 的意义,是给这个问题立了一个更公平的尺子;RP-DPO 的意义,是告诉模型训练时该先守哪条底线。它们合在一起,像是在给多模态大模型补一门很基础但很重要的课:别急着把话说满,先把话说真 。
当然,这类方法也不是没有边界。GRANFACT 规模还不算大,覆盖的领域也有限;RP-DPO 依赖高质量层级标注和回滚构造,想直接迁移到所有开放域场景,还得看数据和标注成本是否跟得上。但从研究方向上看,它至少把路标插对了:未来如果多模态系统要在检索、助手、工业质检、内容生成等场景真正落地,“可靠地说细”一定会比“大胆地乱细”更值钱 。
龙迷三问
这篇论文到底解决什么问题? 它解决的是“多模态大模型说得越细,越容易说错”这个现实矛盾。论文不是让模型少说,而是让模型先说对,再尽量说细。
GRANFACT 里的“层级标注”是什么意思? 就是每个对象不只给一个标签,而是给一串从粗到细的类别路径,比如从“电子产品”到“手机”再到更具体的型号。这样才能判断模型到底说到了哪一层。
RP-DPO 和普通 DPO 有什么区别? 普通 DPO 只管偏好谁更好,RP-DPO 先用语义回滚把错误回答修成可靠候选,再分“可靠性偏好”和“细粒度偏好”两层优化,而且可靠性那层的优先级更高。
如果你还有哪些想要了解的,欢迎在评论区留言或者讨论~
龙哥点评
论文创新性分数: ★★★☆☆ 不是凭空造一个新任务,而是把“细粒度生成的可靠性问题”讲透了,并且配了数据、评测和训练方法,完整度不错。
实验合理度: ★★★★☆ 评测框架和提示对照做得比较扎实,尤其把可靠性和细粒度分开看,比较能说明问题。
学术研究价值: ★★★★☆ 这类工作对多模态生成很有启发,尤其适合后续研究“先保真、再求精”的对齐目标。
稳定性: ★★★☆☆ 方法思路合理,但仍依赖层级标注、回滚构造和特定评测流程,离通用落地还有距离。
适应性以及泛化能力: ★★★☆☆ 在多对象细粒度描述上有意义,但是否适合更开放、更复杂的真实业务,还需要更大规模验证。
硬件需求及成本: ★★★☆☆ 训练成本不算离谱,但需要额外构造训练数据和偏好对,工程上比“直接提示词调参”重一些。
复现难度: ★★★☆☆ 论文把方法讲清楚了,但没有开源代码,复现主要卡在数据构造和评测实现。
产品化成熟度: ★★★☆☆ 适合做多模态生成系统的质量控制模块或训练思路参考,但还不是开箱即用的工业件。
可能的问题: 问题抓得准,但数据规模和场景覆盖还有限;如果真实业务里类别体系更复杂,回滚与评测规则可能会变得很重。
主要参考文献
Fan, X., Wu, W., Wu, Y., Gao, Z., Luo, S., Gao, M., Zhao, H., Diao, Z., Ba, Y., Feng, L., Jia, Y., & Harandi, M. Reliability-Prioritized Fine-Grained Generation in Multimodal Large Language Models. arXiv:2606.29573, 2026.
Rafailov, R., Sharma, A., Mitchell, E., Ermon, S., Manning, C. D., & Finn, C. Direct Preference Optimization: Your Language Model is Secretly a Reward Model. NeurIPS, 2023.
*本文仅代表个人理解及观点,不构成任何论文审核或者项目落地推荐意见,具体以相关组织评审结果为准。欢迎就论文内容交流探讨,理性发言哦~ 想了解更多原文细节的小伙伴,可以点击 "阅读原文", 查看更多原论文细节哦!
欢迎加入龙哥读论文粉丝群,
扫描下方二维码或者添加龙哥助手微信号加群 :kangjinlonghelper。
一定要备注:研究方向+地点+学校/公司+昵称(如 图像处理+上海+清华+龙哥) ,根据格式备注,可更快被通过且邀请进群。
『龙哥读论文』微信群目前包含:图像处理、大模型及智能体、自动驾驶及机器人、AI医疗及AI金融5个群
细粒度生成这事,别光追“更细”,先把“别瞎说”守住。想看大模型怎么在“准确”和“具体”之间找平衡,进群继续聊。