论文标题:
UNDERSTANDING ALIGNMENT IN MULTIMODAL LLMS: A COMPREHENSIVE STUDY
发表日期:
2024年07月
论文作者:
Elmira Amirloo, Jean-Philippe Fauconnier, Christoph Roesmann, Christian Kerl, Rinu Boney, Yusu Qian, Zirui Wang, Afshin Dehghan, Yinfei Yang, Zhe Gan, Peter Grasch
发表单位:
Apple Inc.
原文链接: https://arxiv.org/pdf/2407.02477
对齐的核心原料是偏好数据:给模型一个输入(文本+图像),然后把生成的响应分成"好的"(chosen)和"差的"(rejected)。至于怎么用这些数据,学术界大体分成两大流派:离线和在线。离线方法的代表是DPO(Direct Preference Optimization,直接偏好优化)。这类方法用预先收集好的偏好数据直接微调模型,不需要训练奖励模型。DPO的损失函数长这样:DPO损失函数公式。β是缩放系数,πθ是当前模型,πref是参考模型。本质上是让模型在给定输入x时,正样本响应y⁺的概率相对负样本响应y⁻的概率尽可能拉大。DPO把奖励建模和策略优化合并成一步,省掉了强化学习的负担。离线方法的问题也藏在名字里:数据是"死"的。对齐过程中模型一直在更新,但训练数据里的正负样本是之前生成的,跟当前模型有分布偏移,效果难免打折扣。在线方法则聪明一些:训练过程中直接从当前模型采样新响应,再用奖励模型或更强模型排序,这样样本永远跟得上模型的变化。典型的代表就是Online-DPO(在线直接偏好优化)和RLHF(Reinforcement Learning from Human Feedback,基于人类反馈的强化学习)。RLHF要先训练奖励模型,奖励模型的损失如下:奖励模型训练损失公式。这里rφ(x,y)是奖励模型对响应y的打分,σ是逻辑斯蒂函数。目的很简单:让正样本的分数高于负样本。但奖励模型终究是"二手信号",优化过头反而会把模型带沟里。苹果这篇论文还试了一个混合策略——Mixed-DPO:每次训练时以一半概率从离线数据里取样本,一半概率从当前模型在线生成样本,让两边的优势互补。目标函数长这样:Mixed-DPO损失函数公式。其中α服从伯努利分布(p=0.5),前一项用离线固定的偏好对,后一项用在线采样的偏好对,相当于在"啃老本"和"尝鲜"之间找了平衡。整体看下来,这几种方法各有各的脾气:离线方法简单但样本陈旧;在线方法新鲜但实现更复杂;混合策略理论上取长补短,但能不能奏效,还得看实验表现。论文后面的主实验里,混合策略确实在特定场景下搞出了惊喜,这个后面细说。
[1] Liu H, Li C, Li Y, et al. Improved Baselines with Visual Instruction Tuning. 2024.[2] Rafailov R, Sharma A, Mitchell E, et al. Direct Preference Optimization: Your Language Model is Secretly a Reward Model. NeurIPS 2023.[3] Ouyang L, Wu J, Jiang X, et al. Training language models to follow instructions with human feedback. NeurIPS 2022.[4] Schulman J, Wolski F, Dhariwal P, et al. Proximal Policy Optimization Algorithms. 2017.[5] Zhou Y, Cui C, Rafailov R, et al. Aligning Modalities in Vision Large Language Models via Preference Fine-tuning. 2024.[6] Sun Z, Shen S, Cao S, et al. Aligning Large Multimodal Models with Factually Augmented RLHF. 2023.[7] Yu T, Yao Y, Zhang H, et al. RLHF-V: Towards Trustworthy MLLMs via Behavior Alignment from Fine-grained Correctional Human Feedback. CVPR 2024.[8] Li L, Xie Y, et al. VLFeedback: A Large-Scale AI Feedback Dataset for Large Vision-Language Models Alignment. 2023.[9] Chen Y, et al. Enhancing Multi-modal Large Language Models with Vision Detection Models: An Empirical Study. 2023.