← 返回 PaperDaily 视觉与图像

北京理工大学新方法:让模型“说实话”再追求精准

这篇论文把一个很现实的问题挑明了:多模态大模型不是不会说细节,而是细节一多就更容易“翻车”。GRANFACT、层级评测和RP-DPO三件套,正好把“说得更细”和“说得更准”这对老冤家拎到台面上狠狠干一架。

北京理工大学新方法:让模型“说实话”再追求精准
🐉 龙哥读论文知识星球来了!
公众号每日8篇拆解不够看?星球无上限更AI领域论文、资讯、招聘、招博、开源代码,一站式干货,每日2分钟刷完即赚!
👇扫码加入「龙哥读论文」知识星球,前沿干货、实用资源一站式拿捏~ xingqiu_header

龙哥推荐理由:
这篇论文把一个很现实的问题挑明了:多模态大模型不是不会说细节,而是细节一多就更容易“翻车”。GRANFACT、层级评测和RP-DPO三件套,正好把“说得更细”和“说得更准”这对老冤家拎到台面上狠狠干一架。


原论文信息如下:
论文标题:
Reliability-Prioritized Fine-Grained Generation in Multimodal Large Language Models
发表日期:
2026年06月
发表单位:
北京理工大学、深圳北大-莫斯科大学深圳联合研究生院、莫纳什大学
原文链接:
https://arxiv.org/pdf/2606.29573v1.pdf
开源代码链接:
没有

01. 让“大模型”开口说话:从“胡说八道”到“言之有物”的细粒度革命?

多模态大模型现在最常见的毛病,不是“看不见”,而是“看见了还不敢说准”。说大白话就是:让它描述一张图时,先说“这是个手机”通常没问题;一旦追问到“这是哪一代、什么型号、哪个细节”,模型就开始表演“自信地猜”。这篇论文盯住的,正是这个很现实的矛盾:细粒度描述越具体,出错风险越高,而不是越细越高级。
Figure 1:可靠性优先的细粒度生成动机图
图1:可靠性优先的细粒度生成动机图。模型不该一味追求“越细越好”,而应该先保证正确,再尽量给出最细但仍然可靠的描述。
这件事听着像“要求模型少说点”,其实恰恰相反。论文提出的目标不是让模型变得保守到只会说“这是个东西”,而是让它学会一个更像人类的策略:先确认自己真的看懂了,再往更细的层级走。能说“iPhone”就别硬拗“iPhone 17 Pro”;能说“轿车”就别急着报具体车系。细节不是越多越好,细节得是“站得住”的细节。
为了把这个问题说清楚,论文做了三件事:先造了一个专门考“细粒度可靠性”的数据集 GRANFACT;再做了一套能跨层级判断对错的评测方法;最后用 RP-DPO 把模型训练成“先保真,再求精”的风格。三板斧很朴素,但方向很对,因为它抓住了大模型落地里最烦人的那类问题:不是不会说,而是不知道该说到多细才算稳

02. 一个棘手的矛盾:为什么模型越“细”,就越容易“错”?

这篇论文最关键的判断,是把“细粒度生成”从单纯的能力问题,改写成了一个可靠性—细粒度权衡问题。直白点说,模型往更细的层级走,就像把导航从“到北京”切到“到某条胡同门牌号”,路线越具体,走错的概率也越高。因为细粒度类别之间往往视觉差异小、语义边界窄,模型很容易把“像”当成“是”。
论文在理论上也给了一个很干脆的结论。用语义树表示类别层级后,越细的切分集合,其最优语义风险不会更低。对应原文里的结论就是:粗粒度的最优风险 ≤ 细粒度的最优风险。翻译成人话,就是“层级越细,天然越难做对”。这不是训练不努力,而是问题本身就更难。
公式:粗粒度最优风险不高于细粒度最优风险
这条公式表达的是:在同一棵语义树里,粗粒度切分的最优风险不会比细粒度切分更高。也就是说,想把类别说得越细,理论上就越容易犯错。
Figure 2:保守到激进提示下的可靠性变化
图2:从保守提示到激进提示,模型的细粒度收益与可靠性变化。图里最扎眼的地方就是:提示越“逼它细说”,细节确实更丰富了,但可靠性也常常跟着掉。这个现象很像考试里“答得越长,错得越多”——不是因为废话有用,而是因为多说一句就多一个翻车点。
论文还指出了一个容易被忽略的坑:开放式多目标描述里,评测不能只看“说了什么”,还得先搞清楚“这句话到底在指谁”。如果一张图里有多个对象,模型的回答可能把不同对象混在一起,或者把一个对象说成另一个相近对象。只要评测不做全局对齐,就容易把“重复说了一堆”误当成“真的说对了”。这个问题不解决,后面的训练优化就像在雾里开车,踩油门踩得再猛也不一定往对的方向走。

03. GRANFACT登场:一个让模型“说实话”的“公平秤”和“度量衡”

既然问题是“细粒度越细越容易错”,那就得有一个专门的考场来测。GRANFACT 就是这篇论文做出来的“细粒度可靠性考场”。它不是普通图像问答集,而是带层级标注、带多对象、带专家核验的多模态基准,专门用来考模型能不能在多层语义树里稳稳地说对。
这个数据集一共 581 张图,覆盖 7 个领域:日常物品、植物、动物、汽车、电子产品、地标和游戏。每个图里的实体都不是简单贴一个标签,而是给出从粗到细的一串类别路径,还会标注数量和视觉属性。换句话说,它不是在问“这是什么”,而是在问“这东西能说到哪一层,而且还能说对吗”。
Figure 3:GRANFACT 不同领域的标注示例
图3:GRANFACT 在不同领域的标注示例。可以看到,同一对象不只是一个标签,而是从粗到细的层级路径加上属性信息。这个设计的好处很直接:模型说“对”只是及格,说“对到哪一级”才算开始认真。
Figure 4:GRANFACT 数据统计
图4:GRANFACT 的统计分布,包括每个实体的最大层级深度、每张图里的标注对象数量,以及领域分布。这个统计图很重要,因为它说明这个基准不是“单对象玩具题”,而是更接近真实场景的多对象开放式描述。
评测这件事,论文也没有偷懒。它先把模型自由生成的回答解析成结构化实体,再把这些预测实体和真实实体做分配。难点在于,模型可能说多了、说少了、说串了,甚至说出根本不存在的东西。于是论文引入一个“虚拟幻觉实体”,把不靠谱的预测统统接住,避免评测系统瞎给分。
公式:预测实体到真实实体的可行分配约束
这条公式定义了预测实体到真实实体的分配约束:每个预测数量都必须被分配出去,而每个真实实体也有自己的容量上限。说白了,就是不能让一个预测“无限分身”,也不能让一个真实对象被重复薅到超额。
更妙的是,论文不是简单地把“对”与“错”二分,而是把评分拆成两层:可靠性优先,然后在可靠的前提下再看细粒度程度。这个设计很像一个严苛但讲理的老师:先问“你说的是不是事实”,再问“你说得够不够细”。
公式:可靠性分数与细粒度分数
这里的两个分数分别衡量:有多少预测能匹配到类别兼容的真实实体,以及这些匹配有多细、多一致。前者管“说没说对”,后者管“说得够不够精”。
公式:精确率、召回率与F1
这里是常规的精确率、召回率和 F1,衡量的是“说对了多少、漏了多少、综合表现如何”。
公式:图像可靠率 IR
IR 是图像级可靠率,意思是一张图里只要有一个预测不靠谱,这张图就不能算“全身都稳”。这比只看局部命中更严格,也更贴近真实应用。
公式:细粒度加权指标
细粒度加权指标进一步把“说得细”纳入评分,不再让“粗对就算赢”这种偷懒策略混过去。
公式:图像级细粒度可靠率 GIR
GIR 是图像级细粒度可靠率,只有整张图都可靠时才给细粒度奖励。这个指标很“抠门”,但也正因为抠门,才更能看出模型是不是真的稳。
公式:可靠预测的平均细粒度分数
G_avg 则看可靠预测平均有多细,适合观察模型是不是在“稳”的前提下真的学会了更具体的表达。

04. 核心绝招:RP-DPO——如何教模型在“正确”的基础上追求“精准”?

方法部分的重点,是一个叫 RP-DPO 的训练策略。这里的 DPO 是 Direct Preference Optimization,直接偏好优化,一种不显式训练奖励模型、而是直接利用偏好对来优化策略模型的方法。RP-DPO 的意思更直白:先优先保证可靠,再在可靠样本里鼓励更细的表达
第一步叫 RSR,也就是 Reliability-Guided Semantic Rollback,可靠性引导的语义回滚。名字听着像游戏读档,逻辑也差不多:如果模型把某个对象说错了,就把这个错误描述“回滚”到更粗但仍然正确的祖先类别;如果连祖先类别都对不上,那就直接删掉。这样做的目的不是“洗白错误答案”,而是从错误回答里构造出一个尽可能可靠的正样本。
Figure 5:DELETE 与 ROLLBACK 的语义回滚示意
图5:RSR 中的 DELETE 和 ROLLBACK 操作示意。DELETE 用来删掉完全不靠谱的对象,ROLLBACK 用来把过细但不稳的说法退回到更安全的上级类别。
第二步是构造偏好对。论文把偏好分成两类:一类是可靠性偏好,优先让模型学会“别乱说”;另一类是细粒度偏好,在都可靠的前提下再比较谁说得更细。这个顺序很关键,因为如果先鼓励细,模型很可能学成“越细越敢编”;如果先守住可靠性,再谈细节,训练方向就稳了。
公式:可靠性偏好的间隔归一化
这条公式是在算可靠性偏好对的间隔归一化,间隔越大,说明“好答案”和“坏答案”差得越明显,训练时惩罚也会更明确。
第三步是带边际的 DPO 损失。普通 DPO 只是让“好回答”的偏好概率高于“坏回答”,而这里还额外加了一个 margin,也就是“至少要赢多少”的要求。对可靠性偏好,margin 设得更大;对细粒度偏好,margin 设得更小。这个设计很像在公司里排优先级:先把不能出事的任务做稳,再去卷体验和精度
公式:带边际的DPO损失
这个损失函数的核心意思是:让模型更偏向优质回答,同时要求这种偏向至少超过一个 margin。margin 越大,训练越“较真”。
公式:DPO 隐式奖励
这里的隐式奖励来自策略模型和参考模型的对数概率比,简单理解就是:当前模型对某个回答“更偏爱”多少。
公式:可靠性与细粒度两类损失
最终损失由可靠性损失和细粒度损失组成。前者权重大,后者负责锦上添花。这个结构的精髓就是:别让模型为了“更细”把“更对”给丢了。
这套方法的气质很明确:不追求花里胡哨,先把“别乱说”这件事做扎实,再谈“说得更细”。这才像真正能落地的训练策略。

05. 实验结果:不仅“准”了,还更“精”了,甚至比肩科幻级模型!

实验部分先回答了一个很现实的问题:别的方法是不是也能靠提示词把模型“逼细”?答案是,能提升一点,但代价通常是可靠性下降。也就是说,单靠提示词只能调风格,调不出稳定的层级判断能力。这就像让一个人“说得更像专家”,不等于他真的更懂。
Table 1:不同提示风格下的 GRANFACT 主结果
表1:不同提示风格下的 GRANFACT 主结果。表里最重要的信号有两个:一是激进提示往往让细粒度指标变高,但可靠性变差;二是 RP-DPO 能在同样的提示条件下,把可靠性和细粒度一起往上拉,而不是顾此失彼。
从表1可以看出,Qwen3-VL-8B-Instruct 在激进提示下虽然更“细”,但 IR 明显下滑;而经过 RP-DPO 后,模型在相近设置下能够把可靠性拉回去,同时细粒度指标也不掉。这个结果的价值不在于某个数值多漂亮,而在于它证明了一件事:训练目标改对了,模型就不必在“说细”和“说对”之间二选一
表格截图:实验结果补充表
这张补充表进一步展示了不同模型与提示风格下的表现差异。整体趋势和主表一致:越激进,越容易把细节和幻觉一起抬上来。
表格截图:实验结果补充表2
这张补充表主要用来对照不同模型族在细粒度生成上的脆弱性。结果说明,前沿模型虽然更强,但在细粒度场景里也不是铁板一块。
数据集本身的统计也说明,这不是一个“随便挑几张图”的小玩具。实体层级深度、对象数量、属性标注都比较丰富,所以能逼出模型在真实多对象场景里的短板。辅助训练集则是从 GRANFACT 的类别标签出发,额外检索和合成了 525 张结构化单对象图像,和测试集严格分开,用来支撑 RP-DPO 的训练。
Table 4:GRANFACT 实体级统计
表4:GRANFACT 的实体级统计。它说明这个基准不是只考单个目标,而是考多实体、多层级、多属性的综合描述能力。
Table 5:类别路径深度分布
表5:类别路径深度分布。层级越深,越考验模型对细粒度语义边界的把握。
Table 6:属性标注统计
表6:属性标注统计。属性信息让评测不再只看类别,还能看描述是否真的“像那么回事”。
Table 7:参与评测的模型
表7:参与评测的多模态大模型。这里既有开源模型,也有闭源前沿模型,方便看出不同能力层级的横向差异。
Table 8:三种提示风格的评测提示词
表8:三种提示风格的评测提示词。保守、普通、激进三档设置,正好用来观察“说得更细”到底是能力提升,还是幻觉放大器。
Table 9:辅助训练集类别过滤统计
表9:辅助训练集的类别过滤统计。说明训练数据并不是随便拼出来的,而是经过筛选和结构化处理的。
Table 10:辅助训练集领域统计
表10:辅助训练集的领域统计。它帮助 RP-DPO 覆盖更广的视觉场景,而不是只在单一领域里“刷题”。
Table 11:RP-DPO 训练设置
表11:RP-DPO 的训练设置。对复现来说,这张表很关键,因为它把训练细节交代得比较清楚。
Figure 6:地标和汽车领域的更多定性示例
图6:地标和汽车领域的更多定性示例。细粒度描述一旦写错,往往就是“看着很像,实际不是”。
Figure 7:日常物品和植物领域的更多定性示例
图7:日常物品和植物领域的更多定性示例。这里最能体现“粗对不难,细对很难”的现实。
Figure 8:游戏领域的定性示例
图8:游戏领域的定性示例。这个领域更容易出现细节混淆,也更能看出模型对视觉线索的把握是否扎实。
Figure 16:细粒度偏好对示例
图16:一个细粒度偏好对示例。两个回答都来自同一张图的回滚候选池,优选项因为细粒度得分更高而胜出。
Figure 18:定性示例的评测结果
图18:定性示例的评测结果。保守回答虽然更稳,但细节较粗;激进回答更细,却引入了不被支持的细粒度说法。这个对比几乎把论文的核心矛盾写在脸上了。

06. 总结与展望:大模型可靠性的“最后一公里”,我们走到哪了?

这篇论文的价值,不在于又发明了一个“更会吹”的提示词技巧,而在于它把一个被很多工作轻轻带过的问题挑明了:细粒度生成不是单纯的能力炫技,而是可靠性与精确性之间的工程权衡。如果模型只会粗略地说对,那离真正可用还差一截;如果模型为了细节开始乱猜,那就更麻烦。
GRANFACT 的意义,是给这个问题立了一个更公平的尺子;RP-DPO 的意义,是告诉模型训练时该先守哪条底线。它们合在一起,像是在给多模态大模型补一门很基础但很重要的课:别急着把话说满,先把话说真
当然,这类方法也不是没有边界。GRANFACT 规模还不算大,覆盖的领域也有限;RP-DPO 依赖高质量层级标注和回滚构造,想直接迁移到所有开放域场景,还得看数据和标注成本是否跟得上。但从研究方向上看,它至少把路标插对了:未来如果多模态系统要在检索、助手、工业质检、内容生成等场景真正落地,“可靠地说细”一定会比“大胆地乱细”更值钱

龙迷三问

下面是龙哥对于大家可能的一些问题的解答:

这篇论文到底解决什么问题?它解决的是“多模态大模型说得越细,越容易说错”这个现实矛盾。论文不是让模型少说,而是让模型先说对,再尽量说细。

GRANFACT 里的“层级标注”是什么意思?就是每个对象不只给一个标签,而是给一串从粗到细的类别路径,比如从“电子产品”到“手机”再到更具体的型号。这样才能判断模型到底说到了哪一层。

RP-DPO 和普通 DPO 有什么区别?普通 DPO 只管偏好谁更好,RP-DPO 先用语义回滚把错误回答修成可靠候选,再分“可靠性偏好”和“细粒度偏好”两层优化,而且可靠性那层的优先级更高。

如果你还有哪些想要了解的,欢迎在评论区留言或者讨论~

龙哥点评

论文创新性分数:★★★☆☆ 不是凭空造一个新任务,而是把“细粒度生成的可靠性问题”讲透了,并且配了数据、评测和训练方法,完整度不错。

实验合理度:★★★★☆ 评测框架和提示对照做得比较扎实,尤其把可靠性和细粒度分开看,比较能说明问题。

学术研究价值:★★★★☆ 这类工作对多模态生成很有启发,尤其适合后续研究“先保真、再求精”的对齐目标。

稳定性:★★★☆☆ 方法思路合理,但仍依赖层级标注、回滚构造和特定评测流程,离通用落地还有距离。

适应性以及泛化能力:★★★☆☆ 在多对象细粒度描述上有意义,但是否适合更开放、更复杂的真实业务,还需要更大规模验证。

硬件需求及成本:★★★☆☆ 训练成本不算离谱,但需要额外构造训练数据和偏好对,工程上比“直接提示词调参”重一些。

复现难度:★★★☆☆ 论文把方法讲清楚了,但没有开源代码,复现主要卡在数据构造和评测实现。

产品化成熟度:★★★☆☆ 适合做多模态生成系统的质量控制模块或训练思路参考,但还不是开箱即用的工业件。

可能的问题:问题抓得准,但数据规模和场景覆盖还有限;如果真实业务里类别体系更复杂,回滚与评测规则可能会变得很重。


主要参考文献

Fan, X., Wu, W., Wu, Y., Gao, Z., Luo, S., Gao, M., Zhao, H., Diao, Z., Ba, Y., Feng, L., Jia, Y., & Harandi, M. Reliability-Prioritized Fine-Grained Generation in Multimodal Large Language Models. arXiv:2606.29573, 2026.
Rafailov, R., Sharma, A., Mitchell, E., Ermon, S., Manning, C. D., & Finn, C. Direct Preference Optimization: Your Language Model is Secretly a Reward Model. NeurIPS, 2023.

*本文仅代表个人理解及观点,不构成任何论文审核或者项目落地推荐意见,具体以相关组织评审结果为准。欢迎就论文内容交流探讨,理性发言哦~ 想了解更多原文细节的小伙伴,可以点击"阅读原文",查看更多原论文细节哦!       

end
欢迎加入龙哥读论文粉丝群,扫描下方二维码或者添加龙哥助手微信号加群:kangjinlonghelper。一定要备注:研究方向+地点+学校/公司+昵称(如 图像处理+上海+清华+龙哥),根据格式备注,可更快被通过且邀请进群。
『龙哥读论文』微信群目前包含:图像处理、大模型及智能体、自动驾驶及机器人、AI医疗及AI金融5个群
细粒度生成这事,别光追“更细”,先把“别瞎说”守住。想看大模型怎么在“准确”和“具体”之间找平衡,进群继续聊。
wechat_helperdianzan
转发文章 微博 X LinkedIn Facebook
龙哥读论文 · PaperDaily

本文基于龙哥读论文 PaperDaily 数据库整理,结合论文原文与工程视角进行解读。