← 返回 PaperDaily 视觉与图像

Apple最新研究:不靠GPT-4V,BDHS免费造出高质量幻觉数据

苹果出品,必属精品?这篇论文直接把多模态对齐的“水分”挤干了——不靠GPT-4V、不靠人工标注,用一招“蒙住眼睛”的BDHS方法就能生成高质量偏好数据,效果还能打。对于想低成本做多模态对齐的人来说,这绝对是值得读的“省钱秘籍”。

Apple最新研究:不靠GPT-4V,BDHS免费造出高质量幻觉数据
原论文信息如下:
论文标题:
UNDERSTANDING ALIGNMENT IN MULTIMODAL LLMS: A COMPREHENSIVE STUDY
发表日期:
2024年07月
论文作者:
Elmira Amirloo, Jean-Philippe Fauconnier, Christoph Roesmann, Christian Kerl, Rinu Boney, Yusu Qian, Zirui Wang, Afshin Dehghan, Yinfei Yang, Zhe Gan, Peter Grasch
发表单位:
Apple Inc.
原文链接:
https://arxiv.org/pdf/2407.02477

多模态大模型为何"睁眼说瞎话"?——幻觉问题的根源剖析

先来一个"名场面":你给模型一张平平无奇的街道照片,照片里只有一辆车和一棵树。结果模型一本正经地告诉你"图中有一个人在撑伞"。伞呢?没有伞,纯纯的"脑补"。
这就是多模态大模型里的幻觉问题。文本大模型可能一本正经地编造事实,而多模态大模型则更过分:睁着眼睛"说瞎话"。明明图像里没有的东西,它能说得有鼻子有眼;明明属性对不上,它也能理直气壮地描述。这种幻觉轻则闹笑话,重则在医疗、自动驾驶等场景里直接埋雷。
为什么会出现这种情况?论文里的分析很直接:多模态模型的底座是文本大模型,而文本大模型在预训练时压根没见过那么多图像,它对世界的"先验知识"主要来自文本语料。面对一张图时,模型内部存在一个"懒惰"倾向——比起仔细核对图像证据,它更愿意依赖语言上的高频共现和常识去"猜"。比如,看到"公园"就联想到"有人在草地上野餐",哪怕图里根本没有人。
那咋办?靠"对齐"。所谓对齐,就是让模型的输出偏好尽量贴近图像内容和人类偏好。下图展示了多模态对齐的核心目标:把对齐问题看作对策略模型参数的奖励最大化,同时用KL散度正则化让模型不要跑偏太远。
图1:多模态大模型对齐目标示意图
图1:多模态大模型对齐目标示意图。对齐问题被形式化为关于策略参数θ的奖励最大化,同时通过KL散度正则项约束策略不要离参考策略太远。
更麻烦的是,现有评测幻觉的基准也不是万能的。下图是论文中举的例子:有些话模型明明白白说错了,但流行的CHAIR和ObjHalBench基准居然没能识别出来,有的甚至把正确答案标成幻觉,也是让人哭笑不得。
图5:CHAIR和ObjHalBench基准未能检测出幻觉的示例
图5:CHAIR和ObjHalBench基准失效示例。绿色标注的幻觉被基准成功识别,红色代表基准漏检,橙色则是基准压根不关注的但影响回答质量的幻觉。这说明现有评估工具本身就不完美。
既然问题这么扎手,苹果这篇论文就是要把"对齐"这件事掰开揉碎,看看里面到底什么在起作用。

对齐方法大盘点:离线DPO、在线Online-DPO、混合策略谁更强?

对齐的核心原料是偏好数据:给模型一个输入(文本+图像),然后把生成的响应分成"好的"(chosen)和"差的"(rejected)。至于怎么用这些数据,学术界大体分成两大流派:离线和在线。
离线方法的代表是DPO(Direct Preference Optimization,直接偏好优化)。这类方法用预先收集好的偏好数据直接微调模型,不需要训练奖励模型。DPO的损失函数长这样:
DPO损失函数公式
DPO损失函数公式。β是缩放系数,πθ是当前模型,πref是参考模型。本质上是让模型在给定输入x时,正样本响应y⁺的概率相对负样本响应y⁻的概率尽可能拉大。DPO把奖励建模和策略优化合并成一步,省掉了强化学习的负担。
离线方法的问题也藏在名字里:数据是"死"的。对齐过程中模型一直在更新,但训练数据里的正负样本是之前生成的,跟当前模型有分布偏移,效果难免打折扣。
在线方法则聪明一些:训练过程中直接从当前模型采样新响应,再用奖励模型或更强模型排序,这样样本永远跟得上模型的变化。典型的代表就是Online-DPO(在线直接偏好优化)和RLHF(Reinforcement Learning from Human Feedback,基于人类反馈的强化学习)。RLHF要先训练奖励模型,奖励模型的损失如下:
奖励模型训练损失公式
奖励模型训练损失公式。这里rφ(x,y)是奖励模型对响应y的打分,σ是逻辑斯蒂函数。目的很简单:让正样本的分数高于负样本。但奖励模型终究是"二手信号",优化过头反而会把模型带沟里。
苹果这篇论文还试了一个混合策略——Mixed-DPO:每次训练时以一半概率从离线数据里取样本,一半概率从当前模型在线生成样本,让两边的优势互补。目标函数长这样:
Mixed-DPO损失函数公式
Mixed-DPO损失函数公式。其中α服从伯努利分布(p=0.5),前一项用离线固定的偏好对,后一项用在线采样的偏好对,相当于在"啃老本"和"尝鲜"之间找了平衡。
整体看下来,这几种方法各有各的脾气:离线方法简单但样本陈旧;在线方法新鲜但实现更复杂;混合策略理论上取长补短,但能不能奏效,还得看实验表现。论文后面的主实验里,混合策略确实在特定场景下搞出了惊喜,这个后面细说。

不花钱的"黑科技"BDHS:蒙住模型的"眼睛",让它自己暴露幻觉

现在大模型偏好数据怎么来?主流路子绕不开两条:找人类标注,累且贵;或者请GPT-4V这样的老师模型生成,费且慢。苹果这篇论文偏要"特异功能":啥也不花,让模型自己暴露幻觉。这就是标题里说的BDHS(Bias-Driven Hallucination Sampling,偏见驱动的幻觉采样)
BDHS的思路灵感来自一个"坏主意":既然模型不看图就会瞎编,那就故意让它在生成负样本的时候"看不了图",把幻觉逼出来。但怎么个"看不了"法,有门道。
之前有一篇POVID的工作,用的是给图像加高斯噪声——像素被搅成一团糊,模型自然只能瞎猜。但问题在于:噪声加多少是个玄学,加少了骗不过模型,加多了模型直接认出"这图被污染了"并回答"图片模糊看不清"——反而给了个正确的废话,负样本就没意义了。
BDHS的第一招,注意力掩码(Attention Masking)。不破坏像素,而是在模型的特征空间里动手脚:把图像token的注意力头随机屏蔽一部分,让模型只"瞄到"图像的一小部分信息。信息不够了,它只能靠语言模型先验脑补,幻觉就这么被钓出来了。论文里还提到,屏蔽比例ρth越接近1效果越好,这跟LLaVA 1.6的"AnyRes"技术导致图像token高度冗余有关,模型仍然能看到足够多的信息来编出逼真的"瞎话"。
光让模型瞎编还不够,负样本还得"结构像样",不然DPO学起来没抓手。BDHS的第二招,参考引导生成(Reference-Guided Generation)。具体做法是:把正响应y⁺按句子切分,在每个句子里随机选一个位置"咔嚓"一分为二,前半句话照抄y⁺的原句,后半句话才让模型在"被蒙住眼睛"的输入下重新生成。这样一来,负样本跟正样本前半句完全一致,风格和结构对齐,只有后半句在"编瞎话",DPO训练时就能把注意力集中在真正分歧的内容上。
第三招是语义相似度过滤。负样本生成后,用一个现成的句子嵌入模型算算它跟正样本的余弦相似度,如果太像(超过阈值εs),那就重新生成。防止负样本跟正样本只是同义改写的"水货"。下图是BDHS的整体流程图和生成效果示例。
图2:BDHS方法概览
图2:BDHS方法整体流程。每次重新生成时,图像注意力掩码和句子切分位置都会重新采样。灰色部分是可选的迭代变体。
图3:不同方法和超参数下生成的响应示例
图3:不同方法生成的负样本对比。可以看到,注意力掩码方法能让模型编出更"自然"的幻觉,而POVID风格加噪声多了模型就会说"图片模糊"这种正确的废话,少了又骗不过模型。
这个"蒙眼诱导幻觉"的招数,妙就妙在完全绕开了外部依赖。不需要人工标注答案,不需要GPT-4V当裁判,甚至不需要额外训练一个奖励模型。生成的负样本还能在训练中在线产生,耗不了多少算力。整个BDHS的在线变体就很自然地嵌进了Online-DPO的流程里,属于是"花小钱办大事"的典型代表了。
图10:BDHS解决相似响应数量统计
图10:BDHS重新生成相似响应的次数。通过语义相似度过滤,BDHS能自动识别并丢弃与正样本过于接近的负样本,保证偏好信号有足够的"信息量"。

三大公开数据集深度拆解:prompt、chosen、rejected如何影响对齐效果?

偏好数据听起来简单,不就是把好回答和坏回答配对嘛。但苹果这篇论文把数据集拆开揉碎,发现门道多得惊人。一个偏好数据样本由三部分构成:prompt(提示词)chosen response(首选响应)rejected response(拒绝响应)。prompt包含文本指令和图像;chosen是希望模型学习的好回答,rejected是要压下去的坏回答。
论文把目前主流的多模态偏好数据集放在一张表里对比,信息量很大:
表1:近年来发布的多模态偏好数据集
表1:近年发布的多模态偏好数据集。可以看到,人类标注的数据集(LLaVA-RLHF、RLHF-V)规模较小,但标注质量高;合成数据(VLFeedback、NLF、POVID)动辄几万到几十万条,主要靠GPT-4V筛选或构造。
你会发现,这些数据集跟"三要素"暗线相关:prompt的来源决定了模型面对的任务分布;chosen响应是人工修正过还是SFT(Supervised Fine-Tuning,监督微调)的原始输出,决定了"标准答案"的质量;rejected响应是另采样的差响应还是故意把好响应"改坏",决定了DPO学到的边界。
苹果设计了一组受控实验,把数据集三要素拆开交叉验证,具体请看表4:
表4:多模态偏好数据集受控实验设置
表4:多模态偏好数据集受控实验设置。论文将偏好数据集拆解为prompt、chosen响应和rejected响应三个维度,分别研究每个维度对数据集质量的影响。
实验发现,chosen响应的质量远比想象中重要——如果正样本本身就有幻觉,那模型学到的"好"也是错的。rejected响应的类型同样关键:如果负样本是在正样本基础上故意加入幻觉构造出来的(比如POVID的做法),比直接采样其他模型回答的效果更好,因为二者的差异更集中、更干净。下表是数据集维度的消融结果:
表5:数据集消融实验
表5:数据集消融实验。以VLFeedback为基础,论文通过筛选prompt、替换正样本、改造负样本等操作,定位了影响数据集质量的关键因素。
这个"三要素"框架的价值不只是用来吐槽老数据集的内部差异,更重要的是给新数据集的设计提供了路标:prompt要多样且覆盖图像细节,chosen必须干净,rejected要跟chosen"同源异流",这样模型才能学到精准的"该做什么、不该做什么"。

实验结果全解读:哪些基准涨了?RL对齐为何翻车?

论文实验全部基于LLaVA 1.6-7B Vicuna模型,这可比之前对齐文献里常用的LLaVA 1.5-7B强不少。评测基准覆盖了VQAv2、GQA、TextVQA、MMVet、LLaVA-in-the-wild、MMHALBench等主流任务。先看主结果表:
表2:主实验结果对比
表2:主实验对比。加粗和加下划线分别代表最佳和次佳结果。蓝色行是本文贡献的BDHS相关结果。可以看到,在不使用任何外部监督的情况下,BDHS在多个基准上拿到了相当亮眼的成绩。
BDHS到底有几个版本?论文里区分了Offline-BDHS(用预先生成的数据做DPO)和Online-BDHS(在线生成负样本)。同时还和POVID、VLFeedback等现存数据集的复现结果做了对齐比较:
表3:不同偏好数据集上DPO对齐结果
表3:LLaVA 1.6-7B在不同数据集上用DPO对齐的结果。灰色背景是原论文作者报告的数字。在公平控制基线和训练设置的条件下,BDHS在幻觉相关指标上的表现不输甚至超过了此前发布的专用数据集。
比较有意思的是RL对齐"翻车"现象。论文在LLaVA 1.6-7B上尝试了PPO(Proximal Policy Optimization,近端策略优化)和RLOO(REINFORCE Leave-One-Out,一种基于REINFORCE的方差缩减变体)两种RL算法,结果如下表:
表8:RL对齐实验结果
表8:基于RL的对齐结果。其中奖励模型基于LLaVA 1.6-7B构建。可以看到,PPO和RLOO在多项基准上不仅没能带来提升,反而出现了性能回退。RLHF在LLaVA 1.6-7B上表现不佳,这在多模态对齐实验里是个重要警示。
为什么会翻车?龙哥觉得核心原因有三个:第一,奖励模型本身的准确率就有限,Table 7里奖励模型在验证集上的准确率并不高,拿一个不完美的"裁判"去引导RL,等于戴着有色眼镜开车;第二,LLaVA 1.6-7B参数量只有7B,RL优化策略的探索空间小,稍有不慎模型直接"学歪";第三,多模态场景里图像和文本的奖励信号耦合更复杂,KL散度控制稍弱一点模型就开始漂移。
表7:奖励模型在验证集上的准确率
表7:奖励模型在验证集上的准确率。从数字上看,奖励模型的排序能力和理想水平仍有差距,这在一定程度上解释了RL对齐效果不佳的原因。
那么混合策略吃不吃香?Mixed-DPO的实验结果表明,在离线数据上叠加在线数据,并不是无脑加成效。下面表9和表11给出了更细的信息:
表9:Mixed-DPO效果
表9:Mixed-DPO效果。用一半离线偏好对、一半在线采样偏好对的组合方式,在某些指标上优于只用离线或只用在线,说明两种来源的偏好数据确实有互补效应。
表11:强弱标注器对在线DPO的影响
表11:在线DPO中,强标注器(LLaVA 1.6-34B)和弱标注器(LLaVA 1.6-7B)的效果对比。结果表明,标注器的能力直接影响在线对齐的效果,强标注器提供的偏好信号更可靠。
还有一个挺关键的实验是关于偏好数据规模的。论文比较了在LLaVA-RLHF和VLFeedback不同子集大小下,BDHS和其他数据构建方式的效果对比。结论很微妙:数据量不是越大越好,BDHS用更少的数据依然能取得有竞争力的效果,性价比非常高。
图7:偏好数据集规模的影响
图7:偏好数据集规模的影响。横轴是数据量,纵轴是不同指标。曲线显示,BDHS风格的负样本构造方式在幻觉率指标上始终优于其他方案,说明"数据质量比数量更重要"。
另外,论文还比较了三种离线直接对齐方法:DPO、IPO(Identity Preference Optimization,身份偏好优化)和SLiC(Sequence Likelihood Calibration,序列似然校准),结果如下表12所示。
表12:不同离线对齐方法比较
表12:基于LLaVA 1.6-7B的不同离线对齐方法比较。DPO依旧是最稳的选择,IPO和SLiC各有小幅波动,但没有出现压倒性优势。
最后把BDHS的各个组件单独拎出来做消融(Table 6),看看注意力掩码、参考引导生成和语义过滤分别贡献了多少。实验证明,注意力掩码是核心,去掉它模型几乎恢复不到原始幻觉水平;参考引导生成保证了负样本结构合理;语义相似度过滤则进一步剔除了低质量负样本。
表6:BDHS消融实验
表6:BDHS消融实验结果。包括基线、参考方法以及不同模块组合下的效果,完整呈现了每个设计决策的贡献。

总结与展望:MLLM对齐还有哪些未解之谜?

回头看,苹果这篇论文最大的价值不是刷了多少个SOTA,而是把多模态对齐这个黑盒拆成了透明的零件:对齐方法离线/在线两条路线的影响、偏好数据三要素的影响、以及一个不需要外部监督的BDHS数据生成方案。这三板斧下来,大家对"多模态对齐到底什么在起作用"的认知清晰了不少。
当然,局限也很明显:所有结论都建立在LLaVA 1.6-7B这一个基座上,换成Qwen-VL或者更强的闭源模型,结论未必成立;评测基准本身也有各种"盲区",比如前面说的CHAIR和MMHALBench都会漏检或误检,导致实验结论的信度打了折扣。
未来值得探索的方向大致有三条:一是把BDHS推广到更大规模、更多样的模型上去验证;二是把在线对齐和RL类的稳定算法结合得更好,让"翻车"变成"冲刺";三是设计更靠谱的多模态幻觉评估基准,不然模型自己都不知道自己哪儿错了。

龙迷三问

下面是龙哥对于大家可能的一些问题的解答:
这篇论文到底在解决什么问题?苹果最新研究全面拆解多模态大模型对齐的各个要素,并提出BDHS数据生成法:无需人工标注和GPT-4V,仅靠注意力掩码“蒙住”模型的眼睛生成偏好数据,性能即可比肩甚至超越更大规模的…
这篇工作最值得看的点是什么?BDHS在无需额外标注和外部模型的条件下,在POPE、LLaVABench-in-the-Wild、Recall_coco等多个基准上超越使用更大POVID数据集的离线DPO与Mixed-DPO方案;Online-BDHS∪POVID在大…
这篇工作的边界或风险在哪里?优点:(1)BDHS完全不需要人工标注、外部GPT-4V等教师模型,仅依赖SFT数据即可构造偏好对,成本极低;(2)通过注意力掩码而非像素噪声注入,更直接地触发LLM内在语言偏置,生成的被拒绝响应更真实、非语义怪异;(3)参考引导生成保证…
如果你还有哪些想要了解的,欢迎在评论区留言或者讨论~

龙哥点评

论文创新性分数:★★★★☆

BDHS把"注意力掩码诱导幻觉"这个思路落地成了完整的全自动数据生成方案,并综合了参考引导和语义过滤,设计巧妙、实用性高。扣一星是因为其核心动机跟POVID一脉相承,属于改进型创新。

实验合理度:★★★★☆

在统一基座LLaVA 1.6-7B上系统对比多种对齐方法和数据集,控制变量的意识很强。但部分实验只跑了单一基座,通用性验证不够充分,RL对齐的失败也只在一个规模上观察,略欠说服力。

学术研究价值:★★★★☆

这是首次对MLLM偏好对齐进行拆解级研究,把"方法-数据-评估"三个维度拉到同一框架下审视,对后续研究者设计对齐方案非常有参考价值。

稳定性:★★★★☆

BDHS不依赖外部模型和人工标注,流程可控、复现门槛低。但注意力屏蔽比例、语义相似度阈值等超参数对最终效果有一定影响,需要根据模型调整,鲁棒性还有提升空间。

适应性以及泛化能力:★★★☆☆

目前只在LLaVA系列上做过验证,其他架构(如Qwen-VL、InternVL)下是否依然有效尚未证明。注意力掩码的效果高度依赖模型内部的token冗余度,跨架构迁移存在不确定性。

硬件需求及成本:★★★★★

整个BDHS数据生成过程只需要调用基座模型做前向生成,不需要额外训练奖励模型或调用商用API,成本控制在同类方法里属于最低一档。

复现难度:★★★☆☆

论文给出了完整的算法流程和超参设置,但代码尚未开源。句子嵌入过滤和注意力掩码实现虽然不复杂,但要完全复现论文中的细节仍需一定工作量。

产品化成熟度:★★★☆☆

BDHS适合作为数据增强模块嵌入模型迭代流程,工程接入成本不高。但目前主要面向研究和通用对话场景,在垂直领域的鲁棒性尚需进一步打磨。

可能的问题:单一基座验证、评测基准存在盲区、部分结论统计显著性未说明。论文对RL对齐失败的分析还不够深入,未能给出改进方向。


主要参考文献

[1] Liu H, Li C, Li Y, et al. Improved Baselines with Visual Instruction Tuning. 2024.
[2] Rafailov R, Sharma A, Mitchell E, et al. Direct Preference Optimization: Your Language Model is Secretly a Reward Model. NeurIPS 2023.
[3] Ouyang L, Wu J, Jiang X, et al. Training language models to follow instructions with human feedback. NeurIPS 2022.
[4] Schulman J, Wolski F, Dhariwal P, et al. Proximal Policy Optimization Algorithms. 2017.
[5] Zhou Y, Cui C, Rafailov R, et al. Aligning Modalities in Vision Large Language Models via Preference Fine-tuning. 2024.
[6] Sun Z, Shen S, Cao S, et al. Aligning Large Multimodal Models with Factually Augmented RLHF. 2023.
[7] Yu T, Yao Y, Zhang H, et al. RLHF-V: Towards Trustworthy MLLMs via Behavior Alignment from Fine-grained Correctional Human Feedback. CVPR 2024.
[8] Li L, Xie Y, et al. VLFeedback: A Large-Scale AI Feedback Dataset for Large Vision-Language Models Alignment. 2023.
[9] Chen Y, et al. Enhancing Multi-modal Large Language Models with Vision Detection Models: An Empirical Study. 2023.

*本文仅代表个人理解及观点,不构成任何论文审核或者项目落地推荐意见,具体以相关组织评审结果为准。欢迎就论文内容交流探讨,理性发言哦~ 想了解更多原文细节的小伙伴,可以点击"阅读原文",查看更多原论文细节哦!       

end
搞懂多模态对齐,就像给AI配了副合适的眼镜——看清图,少说胡话。想聊聊DPO、BDHS或者你正在踩的对齐坑?扫描下方二维码或者添加龙哥助手微信号加群:kangjinlonghelper。一定要备注:研究方向+地点+学校/公司+昵称,快来群里一起“睁大眼睛”看AI吧!
wechat_helper dianzan

转发文章 微博 X LinkedIn Facebook
龙哥读论文 · PaperDaily

本文基于龙哥读论文 PaperDaily 数据库整理,结合论文原文与工程视角进行解读。