← 返回 PaperDaily
视觉与图像
Sony AI新作:仅$2000成本,1.5B模型同时搞定图像理解与生成,SOTA还省钱!
统一多模态模型(UMM)过去要么贵得离谱(训练成本几万美元、数据上亿),要么理解与生成总得二选一。Sony AI这篇Argus-Unified直接掏出“混合视觉令牌”方案,把预训练VLM的视觉编码器冻住,只花$2000和1500万数据就训出比7B模型还强的理解能力,生成效果也不拉胯。对搞低预算落地的团队来说,这是一份很实在的参考。
龙哥读论文
发布于 2026-08-14 09:11:32
阅读 4
查看原文
原论文信息如下:
在统一多模态模型(UMM)这个赛道上,索尼AI这篇工作直接给出了一个令人咋舌的数字——训练成本仅需约2000美元 ,数据量只有1560万 。这在动辄几万美元、上亿数据的同行面前,几乎是一种“降维打击”。更让人意外的是,这个紧凑的小模型在理解任务上直接拿下GQA、POPE和VQAv2的SOTA,生成质量也完全不输那些“大块头”对手。今天龙哥就带大家看看,这2000美元到底花在了哪里。
80%成本,5倍数据压缩:Argus-Unified如何用混合令牌撬动理解与生成双SOTA?
龙哥先给大家铺个底——近年来,把视觉理解和视觉生成塞进同一个大模型(UMM)是业界公认的“圣杯”。想象一下,一个模型既能像专家一样回答你“这张图里有什么?”,又能根据你的描述变出全新的画作。听起来很美,但现实却很骨感:大多数团队连烧几万美金都未必能搞出一个好用的,更别说兼顾两项能力了。
索尼AI这篇Argus-Unified,就像是在一群追求“更大更强”的选手中,突然掏出一把“大砍刀”,直接把成本和数据量砍到了地板上。他们的核心思想其实很朴素:既然已经有那么多训练好的视觉语言模型(VLM)和视觉编码器,为什么还要从零开始对齐?直接拿来用不就行了?
主流UMM的三大困境:对齐贵、数据多、参数冗余
在聊Argus-Unified的具体设计前,龙哥觉得有必要先理清主流UMM们为什么又贵又重。说白了,它们都卡在同一个瓶颈上——视觉特征的不匹配。
目前主流的视觉语言模型(VLM)做理解时,使用的是连续视觉令牌 ,这些来自视觉编码器的特征富含语义信息,能精准地描述图片内容。但做生成时就不行了——自动回归(AR)生成模式需要的是离散视觉令牌 ,比如VQGAN或VQVAE输出的那种,它们用来重建像素。这个矛盾导致过去的方法要么选边站,要么代价巨大。
一部分方法(如Emu3、Chameleon)强制理解任务也使用离散令牌,这直接导致语义信息丢失,理解能力大打折扣。这就像是用着像素级的“点阵图”去做知识问答,自然力不从心。
另一部分方法(如Janus、Show-o系列)思想很直接:那好,我干脆放下身段用两个视觉编码器,一个给理解,一个给生成,再让量化器把它们统一成离散令牌。这虽然解决了类型匹配问题,却导致模型参数膨胀、计算负担加重,违背了“统一”的初衷。
困境三:从零开始的“对齐”烧钱又烧数据
几乎所有的UMM都需要一个从零起步的“视觉-语言对齐”阶段。这需要海量的图文对数据进行预训练,比如VILA-U用了7.26亿数据,Janus用了超过1亿数据。这就相当于你明明已经有了一个会说两种语言的翻译,却非要把他丢进语言学校从头再学一遍——费时费力。
龙哥看到这里要感慨一句,原来的做法就是典型的典型“大炮打蚊子”,但效果还很难说。
一招破局:冻结VLM + 混合令牌 + 两阶段训练
Argus-Unified的解法可以说是一套极其巧妙的组合拳 。它的核心思路是:既然预训练的VLM已经理解了图像和语言的关系,为什么还要折腾它?直接把它冻住,然后在此基础上只添加一个能兼容生成的轻量模块。
从图2可以直观看出Argus-Unified的与众不同。传统的VLM(a)只做理解;单编码器UMM(b)用量化后的离散令牌强行做理解,损失了语义;双编码器UMM(c)虽然为任务分派了专门的编码器,但参数冗余;而Argus-Unified(d)提出的混合视觉令牌 设计,仅用一个编码器,通过一个额外的量化器分支,让连续令牌(理解)和离散令牌(生成)在同一个模型内共存,互不干扰。
图3清晰地展示了这个“手术”过程。整个训练分为两个阶段,每个阶段都高效得令人耳目一新。
阶段1:统一视觉令牌化器训练 —— 这里的关键操作是“冻结”预训练VLM的视觉编码器,只额外训练一个量化器和一个图像解码器。量化器的作用是把视觉编码器输出的连续特征转化为离散代码,而解码器则负责从离散代码中重建图像。值得注意的是,由于编码器已经被VLM预训练好了,这个阶段只需要纯图像数据(比如CC3M、DALL-E 3生成图像等),不需要图像-文本配对数据,大大降低了训练成本和数据获取难度。它的损失函数包含了像素重建损失、感知损失、对抗损失和向量量化损失,这个组合是为了确保离散化的同时,图像质量不下降。
阶段2:统一多模态训练 —— 在这个阶段,模型被组装成一个“可以理解也能生成”的联合体。Argus-Unified直接从预训练VLM(例如InternVL3-2B)中加载LLM组件,同时初始化来自阶段1的量化器和图像解码器。然后,在一个相对平衡的数据集上(共970万图文对)进行联合训练。LLM的优化目标是最简单的“下一个令牌预测”,文本令牌是理解回答,离散视觉令牌是生成的像素描述。
这第二阶段最妙的地方在于:由于LLM本身已经具备了强大的视觉语言对齐能力,训练可以只聚焦于教会它如何进行视觉令牌的生成,所需的数据量大幅缩减。论文发现,在这个阶段,扩大预训练数据的规模带来的收益竟然是递减甚至负面的,而扩展监督微调(SFT)的数据反而更有效。
让我们彻底理清这个“混合令牌”到底是怎么工作的。当一张图像输入到Argus-Unified的冻结视觉编码器时,会生成一个包含丰富语义的连续特征。这个特征会兵分两路:一路直接通过一个专门的理解投影器,映射到LLM的嵌入空间,成为理解任务中的视觉输入;另一路则进入量化器,经过向量量化后变成离散代码,再通过一个生成投影器,同样映射到LLM的嵌入空间,作为生成任务的预测目标。
在训练时,模型被格式化成一个多模态令牌序列,如<image_start> + 视觉令牌 + <image_end> + 文本令牌。对于理解任务,LLM的优化目标是最大化文本令牌的似然;对于生成任务,则是最大化输出的离散视觉令牌的似然。通过这种精巧的设计,一个统一的LLM就能同时学习到图像理解和图像生成。
实验碾压:1.5B模型打爆7B+对手,理解SOTA生成不输
俗话说得好,是骡子是马拉出来遛遛。Argus-Unified在多个权威基准上的表现,可以说是让龙哥直接愣住了。
首先看数据量和成本的对比图,这比任何文字都有冲击力。
从图1可以清晰地看到,Argus-Unified的数据量(15.6M)和成本($2,032)几乎是Janus和VILA-U的零头。但它的性能不仅没有缩水,反而在GQA(62.8)、POPE(87.9)和VQAv2(79.1)三项理解指标上冠绝所有对比方法,生成指标MJHQ-30K(6.9)和GenEval(0.71)也表现优异。
论文的核心对比表(表1)信息量巨大,龙哥带大家仔细看看。
1. 理解任务全面领先 :在GQA(62.8)、POPE(87.9)和VQAv2(79.1)上,Argus-Unified-1.5B是AR模型中表现最好的。即使是更小的0.5B版本,也超越了Emu3(8B)、Chameleon(7B)等更大的模型,证明了混合令牌在保持语义完整性上的巨大优势。
2. 生成能力竞争力强 :在GenEval上,0.5B版本就追平了Emu3-8B(均为0.66),1.5B版本达到0.71,高于Janus(0.61)。与使用扩散模型的方法(如Show-o、Harmon)相比也不落下风。
3. 代际碾压式性价比 :这是一个重要的定性结论。Argus-Unified虽然用了8×H100 GPU训了4.17天,但成本仅为$2,032,约为Janus-Pro的8.83%、VILA-U的9.49%。而数据量仅为15.6M,是Janus的约15.6%、VILA-U的约2.1%。这种在成本、数据和性能三位一体上的优势,在当前追求“不计成本”的大模型竞赛中,显得非常难得。
从表2可以看出,Argus-Unified的GPU小时数(800×H100)远低于Janus(21504×A100)和VILA-U(20000×A100),差距极其显著。
论文不仅给出了数字,还提供了丰富的定性样本。在图4和图5中,我们可以看到它的理解和生成能力。
图4显示,Argus-Unified能准确完成种类识别、是否存在判断、场景描述、属性区分等任务,理解能力非常扎实。
图5展示了生成图片在风格多样性(水彩、写实、动漫、素描)和主体清晰度上都有不错的表现。虽然由于模型紧凑,图像超清细节可能不及顶级的专属生成模型,但作为一个统一模型,这个生成质量已经非常可观。
消融揭示:VLM初始化比从头训练强太多,数据不是越多越好
好的实验不能只看最终结果,还得看它为什么能work。论文做了一系列消融实验,结果非常具有启发意义。
表5的结果非常说明问题。使用预训练的VLM(InternVL3-2B)初始化,在GQA上(62.95 vs 56.54)和MME-P(1405.06 vs 1361.51)上优势明显。这说明从VLM开始训练,意味着LLM在初始时就具备了良好的视觉对齐能力,后续训练只需要“微调”新增的生成模块,而不是从零学习多模态。这就好比让一个已经学了多年英语的人去学法语,远比让一个没学过任何外语的人去学法语要高效得多。这个实验直接解释了为什么Argus-Unified能用这么少的数据达到这么好的效果。
消融2:混合令牌 vs. 纯离散令牌
表6再次印证了混合令牌的优势。在纯离散令牌方案下,理解任务全面下滑:GQA从62.95下降到60.10,MME-P从1405下降到1257。这证明了对于理解任务,保留高语义密度的连续特征是至关重要的。而生成任务的表现在两种方案下非常接近(MJHQ:8.22 vs 8.34,GenEval:0.71 vs 0.72),这说明离散令牌在建模像素空间上已经足够好用。简单来说,混合设计让模型“理解得更聪明,生成得不吃亏”。
消融3:数据规模不是越大越好
这是一个反直觉的发现。很多团队在做大模型时都默认数据越多越好,但Argus-Unified的实验发现,在预训练阶段,当数据量超过一定阈值后,增加数据引入的收益会非常有限甚至造成退化。论文认为,这是因为VLM初始化已经提供了强大的先验知识,过量的预训练数据反而可能引入噪声,干扰已经建立好的对齐关系。反而是在SFT阶段,增加数据能带来实质性的提升。这给学术界和工业界提了个醒:不要盲目追求数据多,而要根据模型特定的初始化阶段,精细化地设计数据分配比例。
消融4:Classifier-Free Guidance (CFG) 的影响
表3展示了CFG的效果。在训练中使用CFG,使生成质量(MJHQ FID)从8.2大幅改善到6.9,而几乎不损害其他指标。这给统一模型训练提供了一个值得实践的技巧。
消融5:视觉令牌化器性能不是瓶颈
表4说明,即使只用了14M图像数据、并且视觉编码器被冻结,Argus-Unified的令牌化器重建FID(rFID)也达到了1.60,远好于VILA-U(1.80)。而进一步优化(比如改用更优秀的SigLIP2编码器或扩大代码本),可以取得明显提升(rFID低至0.63)。这说明,Argus-Unified采用的这种“冻结+轻量训练”策略没有成为模型的瓶颈,提升空间还很大。
未来展望:紧凑模型的经济时代已来
Argus-Unified的意义不只是一篇论文,它实际上是一种范式的转变 。它证明了:高质量的统一多模态模型,不一定非要搭在海量算力和数据上。通过巧妙复用预训练VLM的先验知识,结合混合令牌的精巧设计,我们完全可以用学术团队也能承受的成本(2000美元)来训练一个可比甚至更强的模型。
1. 预训练VLM是未被充分利用的富矿 。很多人倾向于从零搭架子,却忽略了已经存在的大量高质量预训练模型。Argus-Unified的成功,可能会催生更多“基于VLM的UMM”工作,降低领域内的入门门槛。
2. “轻量但精准”是产品化的明智选择 。对于很多应用场景(如智能助手、AI聊天、内容创作工具),一个1.5B、推理成本低、部署方便的模型,往往比一个几十B的“巨兽”更实用。Argus-Unified在这条路线上迈出了坚实的一步。
当然,Argus-Unified也存在一些可能的局限,比如生成图像的分辨率目前限制在448×448,代码本大小和视觉编码器选择还有进一步优化的空间,以及它目前的强项更多地体现在统一建模的角度,生成图像的精细度和高分辨率场景下的表现可能还需要更多验证。但瑕不掩瑜,它的核心思想——利用预训练优势来降低成本——值得所有研究者思考。
龙迷三问
这篇论文解决什么问题? 本文解决的核心问题是统一多模态模型(UMM)训练中成本高昂、数据需求大的困境。具体来说,它提出了一种名为Argus-Unified的方法,通过混合视觉令牌(连续+离散)和两阶段训练,显著降低了UMM的训练成本和数据需求量,同时使模型在理解和生成任务上均达到SOTA水平。
什么是“连续令牌”和“离散令牌”?它们有什么区别? 连续令牌是来自视觉编码器(如ViT)的密集特征向量,可以理解为图像的“高维语义描述”,包含了丰富的上下文信息,非常适合做图像理解(如问答、分类)。离散令牌则是经过向量量化(如VQVAE、VQGAN)后得到的编码表索引,每个索引对应一个固定的“视觉词汇”,更适合做图像生成(如重建、生成),因为它明确指定了每个区域的组成。本文的关键创新就是为理解任务保留连续令牌,同时为生成任务学习离散令牌。
Argus-Unified的两阶段训练具体怎么做的? 阶段1:统一视觉令牌化器训练。冻结预训练VLM的视觉编码器,只训练一个量化器和图像解码器。量化器把编码器输出的连续特征转化为离散代码,解码器负责从离散代码重建图像。这个阶段只需要纯图像数据。阶段2:统一多模态训练。组装模型:用预训练VLM的LLM、文本编码器和文本解码器,以及阶段1训练好的量化器和图像解码器,加上两个随机初始化的任务特定投影器。然后在相对平衡的理解和生成数据上联合训练LLM,优化目标是标准的下一个令牌预测(包括文本令牌和视觉令牌的预测)。
如果你还有哪些想要了解的,欢迎在评论区留言或者讨论~
龙哥点评
论文创新性分数: ★★★★✰
提出了混合视觉令牌(Hybrid Visual Tokens)这一新颖思路,在冻结VLM的前提下实现了理解与生成的双向兼顾。本质上是找到了一个“既要又要”的平衡点,而不是简单的模型组合。
实验合理度: ★★★★★
对比实验包含20余个最新UMM,覆盖了AR、Diffusion、混合等主要范式;消融实验设计全面,涵盖了初始化策略、令牌类型、数据规模、CFG等关键变量。横向对比表格完整、数据详尽。在同基准(PaperDaily同基准MCP)对比中,Argus-Unified在多个理解任务上确实领先,生成任务也表现优秀,实验设置合理可信。
学术研究价值: ★★★★★
这项工作为UMM社区提供了一条非常清晰的“低门槛”路线。大量团队可以直接基于预训练VLM快速构建UMM,而不必投入天文数字的算力。同时也揭示了数据规模不是越大越好,VLM初始化带来的先验优势极其重要,这些发现对后续研究有很强的指导意义。
稳定性: ★★★★✰
从实验看,在不同初始化策略(VLM vs ViT+LLM)和不同令牌类型(离散 vs 混合)下,性能表现稳定,未出现大幅波动。CFG的使用也显示出一致的性能改善。但作为紧凑模型,在资源极度受限或极端Out-of-Distribution数据下的稳定性还需要更多测试。
适应性以及泛化能力: ★★★★✰
在GQA、POPE、VQAv2等多个不同维度的理解基准上表现优异,生成任务也涵盖美学评价和组合推理,说明模型具备较好的泛化能力。但仅在448×448分辨率下训练,图像生成的多样性(比如非常罕见的物体或复杂场景)可能不如大模型。
硬件需求及成本: ★★★★★
这是本文最大的亮点。仅需8×H100 GPU训约4天,总成本约2000美元,远低于现有方法。模型规模1.5B,部署和推理成本也相对较低,对资源受限的团队非常友好。
复现难度: ★★★★✰
论文使用的全部是公开数据集(CC3M、JourneyDB、ShareGPT4V等),开源了关键组件和训练细节。虽然冻结VLM的做法简化了训练,但量化器的设计和两阶段训练仍需一定的技术经验和调参技巧。预计可以复现,但需要一定动手能力。
产品化成熟度: ★★★★✰
由于成本极低、模型紧凑,非常适合作为智能助手、内容生成插件等轻量级产品的基座。但生成图像分辨率受限、缺乏更大模型规模的实验(比如拓展到7B),可能限制了它在高端计算场景的表现。在实际部署前,需要在特定场景下进行进一步的微调和质量测试。
可能的问题: 生成图像分辨率仅448×448,在精细化、高分辨率生成场景下可能不如专用模型。论文的VLM初始化方案高度依赖预训练模型的质量(如InternVL3-2B),如果换用其他VLM(如LLaVA、Qwen-VL)是否还能保持同样优势需要验证。另外,模型在GenEval上的表现(0.71)略低于Harmon(0.76),说明在组合推理和对象一致性方面可能还有改进空间。
[1] Wu, C., Chen, X., Wu, Z., et al. Janus: Autoregressive and Diffusion Unified Model for Multimodal Generation. 2025.
[2] Chen, X., Wu, Z., et al. Janus-Pro: Unified Multimodal Understanding and Generation with Data and Model Scaling. 2025.
[3] Wang, X., Zhang, X., et al. Emu3: Next-Token Prediction is All You Need. 2024.
[4] Wu, Y., et al. VILA-U: a Unified Foundation Model Integrating Visual Understanding and Generation. 2025.
[5] Team, C. Chameleon: Mixed-Modal Early-Fusion Foundation Models. 2024.
[6] Zhu, W., et al. InternVL3: Scaling up Vision Foundation Models for Open-World. 2025.
*本文仅代表个人理解及观点,不构成任何论文审核或者项目落地推荐意见,具体以相关组织评审结果为准。欢迎就论文内容交流探讨,理性发言哦~ 想了解更多原文细节的小伙伴,可以点击 "阅读原文", 查看更多原论文细节哦!
只想花小钱办大事?
Argus-Unified 用$2000干翻7B大模型!想第一时间围观低成本多模态新范式?
欢迎加入龙哥读论文粉丝群,
扫描下方二维码或者添加龙哥助手微信号加群 :kangjinlonghelper。
一定要备注:研究方向+地点+学校/公司+昵称(如 图像处理+上海+清华+龙哥) ,根据格式备注,可更快被通过且邀请进群。
『龙哥读论文』微信群目前包含:图像处理、大模型及智能体、自动驾驶及机器人、AI医疗及AI金融5个群