← 返回 PaperDaily
视觉与图像
腾讯+清华新作ViQ:离散视觉表示也能兼顾理解和重建,效率最高提速70%
ViQ这篇很像“把图像也做成词表”的认真尝试:既想保住细节,又想让视觉表示更适合多模态大模型。最有意思的是,它不是只顾理解,也没把重建丢掉,效率还真提上来了。
龙哥读论文
发布于 2026-08-14 09:10:52
阅读 3
查看原文
🐉 龙哥读论文知识星球来了! 公众号每日8篇拆解不够看?星球 无上限更AI领域论文、资讯、招聘、招博、开源代码, 一站式干货,每日2分钟刷完即赚! 👇扫码加入「龙哥读论文」知识星球,前沿干货、实用资源一站式拿捏~
龙哥推荐理由: ViQ这篇很像“把图像也做成词表”的认真尝试:既想保住细节,又想让视觉表示更适合多模态大模型。最有意思的是,它不是只顾理解,也没把重建丢掉,效率还真提上来了。
原论文信息如下:
量化视觉码的困境:鱼和熊掌如何兼得?
把图像变成离散码这件事,听起来像“给照片办身份证”——每张图都要被压缩成一串短短的视觉 token,再交给多模态大模型去理解。问题是,图像和文字不一样,文字天生就是离散的,图像却是连续的、细节密密麻麻的。你让图像也硬凑成离散码,结果往往很尴尬:要么码本更偏向重建,细节保住了,语义却像喝了稀粥;要么语义更强,理解任务能看懂一点,但边角纹理、文字、表格、图表这些“小心思”全被压没了。
这篇论文盯住的,就是这个老大难:离散视觉表示如何同时兼顾语义和细节 。更狠一点说,它还不想只在固定分辨率下玩,非要支持任意分辨率、原生分辨率输入 。这就像既要把大象装进冰箱,还要保证大象出来以后能认路,难度不低。
两阶段魔法:先用文本对齐“驯化”视觉编码器,再用渐进量化“精雕”离散码,效率暴增70%!
ViQ的核心思路不是上来就“咔嚓”量化,而是先把视觉编码器训练得更懂语言,再慢慢把它压缩成离散码。这个顺序很重要,因为如果一开始就猛压缩,信息很容易被按成“纸片人”。所以它走的是两阶段路线:先对齐语义,再做离散化 。
第一阶段叫文本对齐预训练 。这里的“文本对齐”不是让图像去背单词,而是借助图文配对数据,让视觉编码器学会把图像信息映射到更适合语言模型理解的语义空间。论文里还用了一个很实用的技巧:把原本固定分辨率的视觉塔改成能吃任意分辨率 的版本。这里借鉴了 NaViT(Native Resolution Vision Transformer,原生分辨率视觉 transformer;文中引用 Dehghani et al., 2024)和 OryxViT(文中引用 Liu et al., 2024c)的思路,核心就是:图像不用非得先裁成统一尺寸,原生比例进来,模型自己适配。
为了不让模型在多模态训练里“学着学着把老本行忘了”,论文还加了自蒸馏 。这里的蒸馏不是奶茶,是让固定分辨率的老师模型去监督任意分辨率的学生模型,尤其盯住语义 token,也就是常见架构里的 class token。这样做的好处是:学生虽然换了输入方式,但高层语义别跑偏。
第二阶段才进入真正的“量化”。这里最关键的不是直接把高维特征怼进码本,而是先做邻近表示学习 。论文里把它理解成一个“缓冲垫”:先用瓶颈层把特征降维,再用 L∞ 范数约束 把特征往一个更紧的空间里收。L∞范数就是向量里最大的那个分量的绝对值,强行把所有特征限制在超立方体表面附近。通俗点说,就是先把特征从“胖大海”捏成“方方正正的积木”,再去做离散化,误差会小很多。
这一步之后,ViQ再用有限标量量化 (FSQ,Finite Scalar Quantization,有限标量量化;文中引用 Mentzer et al.)把连续特征切成离散码。FSQ的好处是训练稳定,不像有些码本方法那样容易“码本先躺平,模型再发愁”。为了让离散码更有表达能力,ViQ还设计了位置感知的多头量化 :每个 patch 先扩展成 2×2 个视觉码,再通过多头自注意力处理,最后恢复原来的下采样率。这样做的直觉很朴素:同一小块图像内部也有细节差异,别让一个 token 把整块都“代表”得太粗糙。
还有一个细节很关键:ViQ在量化前插入了二维旋转位置编码 (2D RoPE,Rotary Position Embedding,二维旋转位置编码;文中引用 Su et al., 2024)。RoPE 原本常见于语言模型,这里把它扩展到二维图像,让高度和宽度方向的位置关系都能被编码进去。因为图像不是一维字符串,左上角和右下角可不是“隔着两个 token”这么简单,空间关系得说清楚。
从训练目标上看,ViQ不是只盯着一个损失函数猛打,而是把文本监督、蒸馏监督和重建监督一起拎上来。尤其是低层细节这块,它没有直接用像素级硬怼,而是借助预训练视觉自编码器的 latent 空间做监督,配合负对数似然损失和 VAE 风格的 latent loss。说白了,就是先让模型学会“像个靠谱的压缩器”,而不是“把图像糊成马赛克再说自己很会理解”。
九个基准全方位测试,ViQ凭什么胜过连续编码器?
论文实验的重点很清楚:ViQ不是只在某一个任务上“刷存在感”,而是放到一整套多模态理解基准里看它到底能不能打。评测覆盖了通用视觉问答、世界知识、文档识别、OCR、图表理解、科学图理解等九个方向,基本把视觉编码器会碰到的坑都摆上桌了。
为了公平,所有方法都用同一批训练数据和相近的训练流程。这个设置很重要,不然很容易出现“别人吃草,我吃牛排,然后说我更强”的假象。论文把 ViQ 和 OpenAI CLIP、SigLIP2、DINOv2、AIMv2、OryxViT、InternViT,以及 QLIP、UniTok 这些量化视觉编码器放在一起比,结论是:ViQ 在离散表示里把理解能力和压缩能力同时往前推了一截 。
再看量化视觉编码器这条线,ViQ相对 QLIP 和 UniTok 的优势就更明显了。后两者虽然也在做离散化,但在高压缩下常常出现语义和细节一起掉线的情况。ViQ之所以能稳一点,关键就在于前面的文本对齐预训练和后面的渐进式量化不是各干各的,而是前后接力:先把语义空间扶正,再把特征空间一点点压缩,最后才进入离散码阶段。
如果只看理解任务,很多人可能会问:离散化不是天然损失信息吗,怎么还能打得这么稳?答案其实藏在任务属性里。图文问答、通用理解很大程度上依赖大语言模型的推理和常识,而文档、OCR、图表任务更依赖视觉编码器把局部结构、字符和空间关系传进去。ViQ的优势,正是把这些“细枝末节”尽量留住了,所以它在细粒度任务上更容易体现出来。
一张图背后的玄机:重建与理解的完美平衡
这背后的逻辑其实挺顺。第一阶段让语义对齐,保证编码器知道“图里大概是什么”;第二阶段通过邻近表示学习和低层监督,保证编码器知道“图里细节大概长什么样”;最后才量化成离散码。这个顺序使得 ViQ 不是在“理解”和“重建”之间二选一,而是在两者之间找到了一个更像工程答案的折中:压缩足够狠,但不至于把视觉信息榨干 。
论文里还有一个容易被忽略但很重要的点:ViQ的设计不是单纯追求更小的 token 数,而是追求更合理的 token 组织方式 。如果压缩只看数量,不看空间结构和语义对齐,那很容易把图像压成“短是短了,没法用了”。ViQ通过 2D RoPE、补丁扩展、多头量化和渐进式训练,把“短”和“能用”尽量同时保住了。
龙迷三问
这篇论文到底解决了什么问题? 它主要解决的是“离散视觉表示既要懂语义,又要保细节,还要能吃任意分辨率输入”的问题。以前很多方法只能顾一头,ViQ试图把这几件事同时做成。
FSQ 和 2D RoPE 分别是干什么的? FSQ 是有限标量量化,用来把连续特征稳定地变成离散码;2D RoPE 是二维旋转位置编码,用来把图像的高宽位置信息带进量化前的特征里,避免空间关系被压扁。
为什么它能同时做到理解和重建? 因为它不是一上来就粗暴压缩,而是先文本对齐、再渐进量化,还加入了低层重建监督。这样语义和细节都被照顾到,离散码就不至于只会“背大意”,不会“看细节”。
如果你还有哪些想要了解的,欢迎在评论区留言或者讨论~
龙哥点评
论文创新性分数: ★★★★☆
ViQ把“文本对齐 + 渐进量化 + 任意分辨率”这三件事串成了一个完整框架,思路不算离谱,但组合得比较顺,且确实解决了离散视觉表示的核心痛点。
实验合理度: ★★★★☆
对比对象覆盖连续编码器和量化编码器,且尽量统一训练数据和流程,公平性比较到位。少数任务仍有差距,但论文也解释了原因,没有硬吹。
学术研究价值: ★★★★☆
它对“统一视觉表示”这条路线很有启发,尤其适合后续继续研究离散视觉 token、原生分辨率建模和高压缩多模态表示。
稳定性: ★★★☆☆
整体训练设计比较稳,但毕竟还是离散化路线,遇到极端细节任务时天然会有信息损失,不属于“拿来就能闭眼上生产”的那种。
适应性以及泛化能力: ★★★★☆
任意分辨率输入是个加分项,跨不同基础语言模型也能保持竞争力,说明适配面不窄。
硬件需求及成本: ★★★☆☆
训练阶段仍然吃 A100,而且分两阶段训练,前期成本不低;但一旦离散码可离线提取,后续多模态训练效率提升很可观。
复现难度: ★★★☆☆
代码开源是好事,但训练链路不短,权重、数据、算力和多组件配置都不算轻松,适合有一定工程基础的团队复现。
产品化成熟度: ★★★☆☆
在多模态训练加速、视觉缓存、压缩表示等场景有明确价值,但要进更复杂的真实业务,还得继续验证极端细节、长尾文档和跨域鲁棒性。
可能的问题: 离散表示的上限仍受压缩率约束,细粒度任务上不可能完全追平强连续编码器;另外训练链路偏重,落地前还得看算力账本。
主要参考文献
Yu, X., Liu, Z., Yang, Z., Dong, Y., Qian, S., Lu, J., Hu, H., Rao, Y. ViQ: Text-Aligned Visual Quantized Representations at Any Resolution. arXiv 2026.
Mentzer, F. et al. Finite Scalar Quantization.
Dehghani, M. et al. NaViT: Native Resolution Vision Transformer.
Su, J. et al. Rotary Position Embedding.
*本文仅代表个人理解及观点,不构成任何论文审核或者项目落地推荐意见,具体以相关组织评审结果为准。欢迎就论文内容交流探讨,理性发言哦~ 想了解更多原文细节的小伙伴,可以点击 "阅读原文", 查看更多原论文细节哦!
欢迎加入龙哥读论文粉丝群,
扫描下方二维码或者添加龙哥助手微信号加群 :kangjinlonghelper。
一定要备注:研究方向+地点+学校/公司+昵称(如 图像处理+上海+清华+龙哥) ,根据格式备注,可更快被通过且邀请进群。
『龙哥读论文』微信群目前包含:图像处理、大模型及智能体、自动驾驶及机器人、AI医疗及AI金融5个群
ViQ这类“离散视觉码”论文,最适合进群边读边拆:方法、代码、复现坑位,一起把视觉表示这口锅炖明白。