← 返回 PaperDaily 视觉与图像

机器人|Veo 3零训练完成分割推理,视频模型就是视觉基础模型?

大模型靠语言"封神",但如果视觉才是通往AGI的真路呢?OpenAI、DeepMind、斯坦福等21位学者联合发布白皮书,正面挑战"语言中心主义"——看完这篇,你对AGI路径的理解可能要重构。

机器人|Veo 3零训练完成分割推理,视频模型就是视觉基础模型?
原论文信息如下:
论文标题:
Visual General Intelligence: A White Paper(视觉通用智能:白皮书)
发表日期: 2026年8月
发表单位: AIST、牛津大学VGG、OpenAI、剑桥大学、Google DeepMind、卡内基梅隆大学、斯坦福大学、普林斯顿大学等
原文链接: https://arxiv.org/pdf/2608.25924

语言模型一路狂飙,ChatGPT们把"下一个词预测"玩到了炉火纯青,甚至让不少人觉得:只要把语言 Scaling 到极致,AGI 就到手了。但这份由21位重量级学者联合撰写的白皮书,却发出了一个有点"反常识"的声音——你们是不是把通往AGI的路,想窄了? 这份白皮书全名叫《Visual General Intelligence: A White Paper》,核心就一个词:视觉通用智能(Visual General Intelligence,简称VGI)。作者阵容堪称豪华:有来自OpenAI的Yonglong Tian,Google DeepMind的Robert Geirhos,斯坦福的Jiajun Wu,CMU的Deva Ramanan,牛津VGG的 Andrew J. Davison,还有普林斯顿的Zhuang Liu等等。这些名字单拎出来每一个都是视觉领域响当当的人物,如今却凑在一起,认真讨论一个"离经叛道"的话题:视觉,可能才是通向通用人工智能的正路。 注意,这不是一篇技术报告,没有提出什么新模型、新算法,它是一份"白皮书"——也就是一份立场声明和研究路线图。它的价值不在于给出了多少实验数据,而在于:它把散落在各个角落的"视觉中心论"观点,第一次系统性地拧成了一股绳。 为什么说视觉可能是比语言更底层的智能?白皮书讲了一个非常有意思的生物学事实:地球上先进的视觉系统,包括相机眼和复眼,可以追溯到大约5亿年前的寒武纪。而人类的语言、文字系统,在生命演化的时间尺度上,是极其晚近的现象。换句话说,视觉在演化上远比语言"古老"和"基础"。语言是建立在对世界的视觉理解之上的抽象符号,如果智能真的有一个"底座",视觉可能比语言更接近这个底座。 再看看当下AI的发展现状。语言模型靠"下一个词预测"就涌现出了上下文学习、少样本适配等能力,那如果把同样的策略用在视觉上呢?让模型大规模地预测"下一帧画面"、"下一个3D结构",会不会涌现出更底层、更通用的世界理解能力?这份白皮书没有给出确定的答案,但它把这个问题郑重其事地摆到了台面上,并且给出了九种来自不同研究视角的回答。 文章接下来的内容,就带大家逐一拆解这九种视角。它们有的激进,有的保守,有的甚至互相矛盾,但这恰恰是这份白皮书最有趣的地方——它不像典型论文那样试图给出"唯一正确解",而是像一场高质量的圆桌讨论,把视觉通向AGI的各种可能性摊开来给你看。 文章上半部分子标题: - 01 视觉的"寒武纪大爆发":为什么说视觉比语言更古老、更底层? - 02 九种视角,九条通往AGI的视觉之路 - 03 【观点一】视频模型就是视觉基础模型:Veo 3已经证明了这件事 - 04 【观点二】创造力,才是视觉通用智能的试金石 - 05 【观点三】从一条数据开始学习:打造视觉版"婴儿大脑" - 06 【观点四】视觉智能必须多模态、生成式、还要高效 - 07 【观点五】视觉智能×科学发现:去解开太阳磁场和进化的秘密 文章下半部分子标题: - 08 【观点六】空间AI:让机器拥有"脑内蓝图" - 09 【观点七】视觉智能就是具身智能:看得见,更要摸得着 - 10 【观点八】看见物理世界:把世界"编译"成代码 - 11 【观点九】从视觉模型到视觉原生智能:别再让视觉当语言的跟班 - 12 龙哥点评:白皮书的价值不在"答案",在"提问"

视觉智能能否通向AGI?——白皮书全景解读

很多人第一次看到《Visual General Intelligence: A White Paper》这个名字,可能会下意识觉得,这又是一篇"抛概念、画大饼"的论文。但真正打开之后会发现,这份白皮书的野心比"画大饼"大得多——它试图回答的,是当前人工智能领域最根本的一个问题:通向AGI的路,是不是只有"语言"这一条?
过去几年,语言模型几乎成了AGI的代名词。从GPT-3展现出上下文学习能力开始,"下一个词预测+海量数据+暴力缩放"这个配方在语言领域反复奏效。善于总结的人甚至给这种现象起了个名字,叫"大语言模型的涌现能力"。但这份白皮书提出了一个值得深思的反问:既然简单的生成式目标可以在语言的海洋里涌现出通用智能,那么同样的事情,会不会也发生在视觉的宇宙里?
为了支撑这个反问,白皮书搬出了一个相当有说服力的生物学事实。地球上先进的视觉系统,包括相机眼和复眼,大约在5亿年前的寒武纪就已经出现;而人类的语言、文字系统,在生命演化的时间尺度上,是极其晚近的发明。视觉系统在进化上领先语言数十亿年。如果智能真的是在适应环境的过程中生长出来的,那么视觉经验很可能比语言符号更接近智能的底座。语言是挂在视觉理解之上的抽象符号,而不是智能的全部。
正是基于这样的思考,白皮书正式提出了视觉通用智能(Visual General Intelligence,简称VGI)这一概念。它并没有打算给出一个封闭的定义,而是把VGI描述为一种从视觉模态和视觉任务中涌现出的通用能力,并号召计算机视觉社区把研究重心从单个任务的精度竞赛,转向更根本的问题:视觉经验究竟如何支撑起通用的世界理解、预测与行动能力?搞清楚这个问题,可能比继续刷十个榜一更有意义。

十位顶尖学者,十种视觉智能路径

这份白皮书的另一个鲜明特点,是它没有试图给出"唯一正确答案"。论文集合了来自OpenAI、Google DeepMind、斯坦福、普林斯顿、卡内基梅隆大学(CMU)、牛津大学视觉几何组(VGG)等机构的十余位学者,每人从自己的研究视角出发,给出了各不相同、甚至互相碰撞的视觉智能路径。读这份白皮书,就像参加了一场高质量的圆桌讨论——有人坚信视频生成就是万能解药,有人坚持说创造力才是试金石,还有人认为视觉智能必须有身体。
最先出场的是来自Google DeepMind的Robert Geirhos,他的观点最为直接:视频模型就是视觉基础模型,把语言模型的成功配方搬到视频生成上就行。CMU的Aditi Raghunathan则提出了一个更"挑剔"的标准:真正的视觉智能应该在创造性任务上接受检验,不只是做对选择题。纽伦堡工业大学的Yuki Asano主张打造一个从一条数据开始学习的"视觉版婴儿大脑",不靠海量重放,不靠预设任务。CMU的Deva Ramanan押注了三个方向:多模态、生成式和高效——智能不会是纯视觉的,也不会是负担不起的。纽约大学(NYU)的David Fouhey把目光投向了太阳磁场和物种进化,认为视觉智能将在科学发现中率先兑现价值。除此之外,还有学者提出了空间AI、具身智能、物理世界编译和视觉原生智能等各有侧重的路径。九种观点,就是九种对"视觉如何通向通用智能"的假设。
这些观点既有共识,也有深刻分歧。共识在于:大多数作者都认可生成式目标、大规模数据和视觉经验本身是通向通用智能的关键要素。分歧则在于:单模态缩放到底够不够?语言应该在什么位置发挥作用?视觉智能需不需要身体、需要交互、需要科学任务来驱动?这些分歧不是坏事——它们恰恰为后续的研究提供了足够多的可检验假设。下表汇总了这些视角的核心主张:
表1:本文呈现的视觉通用智能各视角的简明汇总
表1:本文呈现的视觉通用智能各视角的简明汇总
shaona

生成模型、具身智能与空间AI:核心观点碰撞


视频模型就是视觉基础模型

Google DeepMind的Robert Geirhos给出了一个相当激进的看法:视频模型就是视觉基础模型。他的推理链条很干净。语言智能的钥匙是"大规模生成式预训练",那把同样的钥匙直接用在高帧率、高信息密度的视频数据上,不就是视觉智能的解法吗?更关键的是,视频生成比图像分类要"硬核"得多。分类模型可以走捷径——把"大象"和灰色皮革纹理关联起来,把"奶牛"和草地背景关联起来,任务就糊弄过去了。但生成模型没有这种偷懒的空间:你必须把物体、背景、纹理、形状、光照、阴影全部生成对,才不会被训练目标惩罚。这种"逼着模型理解世界"的特性,正是生成式目标的魅力所在。
Geirhos的团队在Veo 3上做了一个漂亮的验证。这个模型没有任何针对特定视觉任务的训练,仅仅通过图像到视频的生成,就展现出了边缘检测、目标分割、关键点定位、超分辨率、图像编辑、风格迁移,甚至迷宫求解和图遍历这类初级视觉推理能力。一个为娱乐而训练的视频生成模型,顺手就成了"视觉基础模型",这就像早期语言模型刚刚展现出涌现能力时的感觉。"每个任务都需要自己的模型"的计算机视觉社区,有望在这种范式下被统一起来。

创造力,视觉智能的试金石

CMU的Aditi Raghunathan则提出了一个更"挑剔"的视角。她认为,真正的视觉智能不应该只在"有唯一正确答案"的任务上做文章。设计一个满足功能约束的物体、为一个机器人提出多种行动方案、绘制一张科学示意图——这些开放式任务才是对智能更好的考验。她把这类能力称为算法创造力(algorithmic creativity):输出不仅要连贯、满足约束,还要在结构上多样化、在训练经验之外保持新颖。
Raghunathan借鉴认知科学的分类,区分了两种创造力。组合创造力,是在熟悉的元素之间发现不寻常的联系,比如类比、双关、把原本分离的领域连接起来;探索性创造力,是在一组规则约束下构造新的模式,比如设计新的蛋白质、机制或叙事。在视觉世界里,前者可能是发现两个看似无关物体之间的意外关系,后者可能是生成一个满足几何、物理、语义多重约束的新场景。她还特别强调:随机性应该注入到"顶层计划"层面,而不是只在输出层做温度采样。用一个样本级别的隐变量来选定场景布局、物理机制或行动轨迹,再生成细节,这样产生的多样性才是结构性的,而不是像素层面的抖动。

从一条数据开始学习

纽伦堡工业大学的Yuki M. Asano提出了一个更大胆的设想。他认为今天最强的视觉系统是"训练一次、部署终身"的固定模型——这不叫通用智能。一个真正通用的视觉系统,应该像婴儿一样,在持续展开的视觉经验中逐步构建对世界的理解:不需要标注、不需要反复重放历史数据、不需要预先知道哪些任务是重要的。这种系统的能耗也应当接近"一盏灯泡",而不是"一座城市"。
Asano设想中的视觉大脑由四个交互模块组成:感知系统把连续的视觉流转化为物体、区域、表面、运动和语义特征;空间与动态世界模型维护关于几何、视角、物体身份、运动和因果变化的多尺度假设,并区分"观测者自身造成的改变"与"世界本身发生的改变";记忆系统在不同时间尺度上存储信息;任务与动作接口把学到的视觉知识暴露给下游的机器人、科学仪器和人类用户。在这个架构里,语言退居为"接口"——它用来命名概念、传达目标、进行教学,但不再是组织视觉智能的主线。深度、运动、持续性、包含关系、接触和可供性,这些世界的基本结构在语言出现之前就已经存在,视觉系统理应先在无文字的世界里学会它们。

具身智能视角:视觉到底重不重要

CMU的Deva Ramanan从机器人学的角度,讲了一个非常反直觉的现象。目前绝大多数足式机器人(包括人形机器人和四足机器人)的演示,其实都是"盲操作"——它们不靠视觉,而是靠本体感觉(proprioceptive sensing)来感知自身运动状态,照样能翻跟头、走复杂地形。灵巧操作里也有类似例子:可以不看口袋,纯靠触觉就分清钥匙串上的每一把钥匙。在机器人圈甚至流传着一种说法:视觉是最不重要的感知信号。
但Ramanan明确反对这个看法。从信息论的角度看,视觉是高维的、充满了物理世界信息的信号,它之所以被机器人学家"嫌弃",仅仅是因为低维的本体感觉策略更轻量、延迟更低。他给出的研究方向也很具体:第一,真正多模态的预训练,而不是先训一个单模态模型再外挂适配器;第二,把触觉感知"视觉化",比如GelSight传感器就把触觉问题转化成了光度立体重建问题;第三,发展"近场视觉",用手腕上的第一视角相机理解周围正在发生接触的世界。这些方向,实际上就是把视觉智能推向具身智能的腹地。

空间AI与科学发现

空间智能是贯穿这份白皮书的一条暗线。Ramanan在讨论长视频生成时提出了一个关键想法:要生成一段连贯的、一小时以上的视频,模型必须拥有一种"不随时间增长的记忆",而在线3D重建就是这种记忆的理想实现形式。走进一栋房子,五分钟后回到客厅,客厅看起来应该是一致的——这种一致性,本质上就是一个空间记忆在起作用。把3D重建视为生成模型的一部分,而不是一个独立的感知模块,这个观点为"空间AI"提供了一个非常具体的雏形。
NYU的David Fouhey则把视觉智能的舞台搬到了科学发现领域。他参与的研究用AI模型揭示了太阳磁场的新细节,也用AI生成的数据帮助重建了物种进化的过程。科学仪器正在各个尺度上产生海量视觉数据,但这些数据往往样本少、标注贵、噪声大——这恰恰是视觉智能大显身手的场景:用更聪明的算法,把有限的数据压榨出更多科学发现。Fouhey认为,未来视觉智能很大一部分算力预算,会投向这些"对着特殊仪器、盯着特殊尺度"的科学任务上。

从视觉经验到通用智能:VGI的开放问题

白皮书当然不只是罗列观点,它也相当坦诚地列出了视觉智能通向AGI的几个核心开放问题。
第一个问题是学习目标的选择。视觉模型应该预测下一帧?生成未观察到的区域?重建3D/4D结构?还是把这些目标全部整合起来?不同的目标选择会导致完全不同的智能形态。语言模型用"下一个词预测"统一了几乎所有任务,但视觉世界的信息密度更高、结构更复杂,一个简单的目标是否足够,远没有定论。
第二个问题是能力归因的混乱。目前的视觉基础模型(Vision Foundation Model,简称VFM)被广泛应用在分类、密集预测、对应估计和3D重建上,但一个能力到底来自训练数据、任务设计、解码器、提示词、模型规模,还是它们的组合?这些变量纠缠在一起,"可解释的涌现"就变得非常困难。白皮书专门指出:搞清楚能力的来源,比单纯把模型做大更重要。
第三个问题是视觉与语言的关系。多模态大语言模型(Multimodal Large Language Model,简称MLLM)——从CLIP把图像和文本映射到共享空间,到Flamingo、BLIP、BLIP-2、LLaVA把图像特征接入语言模型——为视觉理解和指令跟随提供了强大的框架。但正因为图像特征、图文对、指令微调和推理过程深度纠缠,很难说清楚哪些能力真正来自视觉经验本身,哪些只是语言模型的"翻译"结果。白皮书的态度不是反对多模态,而是呼吁在视觉与语言解耦的前提下,重新审视视觉的独立贡献:视觉能不能先自成体系,再与语言对接?
第四个问题是效率。白皮书点名了一个非常现实的案例:OpenAI曾经推出的视频生成模型SORA最终被关闭,核心原因就是推理和生成的美元成本太高。当下严肃的视频生成研究似乎只对少数前沿实验室开放,连业内玩家都觉得吃力,学术界更是几乎无法参与。如果视觉智能真的要靠超大规模视频生成来实现,那么训练和推理效率就不再是工程问题,而是决定研究路线能否成立的根本约束。

视觉智能的未来:挑战与机遇

虽然开放问题不少,但白皮书整体透露出一种难得的乐观情绪。计算机视觉社区积累了数十年的家底——几何、光流、三维重建、视觉生成、机器人操控——这些多元化的"老手艺",恰恰是探索视觉通用智能最丰富的土壤。AI社区正在进入一个可以主动设计目标的创造期:除了排行榜上的精度数字,物理世界的应用、未知环境的适应、社会影响,都值得被纳入衡量标准。
从更现实的产业视角看,视觉智能的需求正在爆发。今年大厂的校招中,AI相关岗位大幅扩展,尤其偏爱"AI+X"的复合人才;从自动驾驶到仓储机器人,从医学影像到科学发现,各垂直行业都在等待更通用的视觉模型落地。一个能用视频生成统一感知、推理与规划的模型,可能比十个专用模型加起来更具商业想象力。白皮书把视觉智能摆到AGI路径的高度,本质上也是在提醒产业界:不要只盯着语言模型的Chat时刻,视觉模型可能正在酝酿自己的"GPT-3时刻"。
但挑战同样清晰。视频生成模型的高昂成本意味着,学术界如果不找到全新的效率思路,很可能会被排除在主力研究之外;数据的多样性如何保证,而不是靠堆砌重复样本来凑规模;多模态数据如何真正联合预训练,而不是先训一个视觉模型再外挂语言适配器——这些问题的答案,将决定视觉智能是从"演示中的可能"走向"可靠的产品",还是停留在"论文里的未来"。
回到最初的问题:视觉能通向AGI吗?白皮书没有给出一个斩钉截铁的"能"。它真正做的是,把这个问题从一个哲学猜测,变成了一个可以设计实验、可以比较目标函数、可以评判基准的研究纲领。单凭这一点,它就值得每一位关注AI未来的人认真读一读。也许几年之后回看,这份白皮书会成为视觉领域从"任务竞赛"转向"智能探索"的一个标志性文本。

龙迷三问

下面是龙哥对于大家可能的一些问题的解答:
这篇论文到底在解决什么问题?这是一份由OpenAI、DeepMind、斯坦福、牛津等21位学者联合撰写的视觉通用智能(VGI)白皮书。论文提出:视觉不只是传感器,更可能是通向通用人工智能的关键路径,并系统探讨了视频生成、具身智能、科学发现、空间AI等多元视角
这篇工作最值得看的点是什么?不适用(本文为白皮书/综述,无实验)
这篇工作的边界或风险在哪里?优点:汇集了来自不同机构(包括OpenAI、Google DeepMind、CMU、Stanford等)的顶尖学者观点,提供了多元化的视角;系统性地探讨了视觉智能通向AGI的多种可能路径;提出了VGI这一重要概念框架,为计算机视觉社区在AGI时代的研究方向提供了参考;涵盖了生成模型、具身智能、空间AI、科学发现等多个前沿方向。缺点:作为白皮书,缺乏实验验证;各观点之间缺乏统一的理论框架;部分观点较为主观,缺乏实证支持;对VGI的定义较为宽泛,缺乏精确的技术路线图。
如果你还有哪些想要了解的,欢迎在评论区留言或者讨论~

龙哥点评

论文创新性分数:★★★★☆

本文是一篇白皮书,汇集多位顶尖学者的观点,探讨视觉智能作为通向AGI路径的可能性,提出视觉通用智能(VGI)的概念框架,涵盖生成式视频模型、创造力、持续学习、空间AI、具身智能、物理结构恢复、视觉原生智能等多个互补视角。

实验合理度:★★★☆☆

现有材料未完整覆盖数据划分、基线公平性和统计显著性,因此按中性评价处理。

学术研究价值:★★★★☆

本文是一篇白皮书,汇集多位顶尖学者的观点,探讨视觉智能作为通向AGI路径的可能性,提出视觉通用智能(VGI)的概念框架,涵盖生成式视频模型、创造力、持续学习、空间AI、具身智能、物理结构恢复、视觉原生。

稳定性:★★★☆☆

现有材料未提供充分的极端条件、重复运行或扰动测试,稳定性暂按中性评价。

适应性以及泛化能力:★★★☆☆

现有材料未完整展示跨数据集、跨场景或分布外实验,泛化能力仍需进一步验证。

硬件需求及成本:★★★☆☆

现有材料缺少完整训练资源、参数量、显存和推理时延信息,成本暂按中性评价。

复现难度:★★★☆☆

现有材料未确认完整代码、配置、数据处理脚本和权重是否齐备,复现难度暂按中性评价。

产品化成熟度:★★★☆☆

论文验证以研究实验为主,真实部署中的时延、成本、维护和异常场景仍需补充验证。

可能的问题:作为白皮书,缺乏实验验证;

主要参考文献

[1] Kataoka, H., Fukuhara, Y., Tian, Y., Wu, S., Deb, O., Yamada, R., et al. Visual General Intelligence: A White Paper. arXiv preprint arXiv:2608.25924, 2026. https://arxiv.org/pdf/2608.25924

*本文仅代表个人理解及观点,不构成任何论文审核或者项目落地推荐意见,具体以相关组织评审结果为准。欢迎就论文内容交流探讨,理性发言哦~ 想了解更多原文细节的小伙伴,可以点击"阅读原文",查看更多原论文细节哦!       

end
眼睛看世界,模型学规律,视觉或许才是通往AGI最近的那条路🧐 想和更多同路人一起聊透这篇白皮书、蹲后续VGI讨论?
欢迎加入龙哥读论文粉丝群,扫描下方二维码或者添加龙哥助手微信号加群:kangjinlonghelper。一定要备注:研究方向+地点+学校/公司+昵称(如 具身智能+上海+交大+阿龙),根据格式备注,可更快被通过且邀请进群。
『龙哥读论文』微信群目前包含:图像处理、大模型及智能体、自动驾驶及机器人、AI医疗及AI金融5个群,等你一起来聊~
wechat_helper dianzan

转发文章 微博 X LinkedIn Facebook
龙哥读论文 · PaperDaily

本文基于龙哥读论文 PaperDaily 数据库整理,结合论文原文与工程视角进行解读。