← 返回 PaperDaily
视觉与图像
CVPR 2026夺冠!商汤&清华让VLM学会“边想边搜边裁剪”,开源7B模型碾压GPT-4o-mini
当VLM面对一张4K图片里的微小文字或长尾知识时,现有模型不是“看瞎了”就是“知识库不够用”。SenseSearch巧妙地把“搜索”和“裁剪”两个看似不相关的能力,通过强化学习捏合成了一个统一的推理智能体。更关键的是,它开源了所有代码和数据集,让社区可以直接复现并续写。这项工作的完成度和效果都相当扎实,值得细细品味。
龙哥读论文
阅读 3
查看原文
🐉 龙哥读论文知识星球来了!公众号每日8篇拆解不够看?星球无上限更AI领域论文、资讯、招聘、招博、开源代码,一站式干货,每日2分钟刷完即赚!
👇扫码加入「龙哥读论文」知识星球,前沿干货、实用资源一站式拿捏~
龙哥推荐理由:
当VLM面对一张4K图片里的微小文字或长尾知识时,现有模型不是“看瞎了”就是“知识库不够用”。SenseSearch巧妙地把“搜索”和“裁剪”两个看似不相关的能力,通过强化学习捏合成了一个统一的推理智能体。更关键的是,它开源了所有代码和数据集,让社区可以直接复现并续写。这项工作的完成度和效果都相当扎实,值得细细品味。
原论文信息如下:
还在为ChatGPT看不懂你上传的4K示意图里的微小公式而抓狂吗?还在抱怨现有AI知识只停留在2023年,无法回答“昨天那个刚发布的产品参数是什么”这种问题吗?
别急,现在有一种全新的智能体视觉语言模型(VLM)SenseSearch,它就像一个拥有“放大镜+搜索引擎+推理大脑”的三合一全能助手,能通过自主思考,决定是去搜索网页、搜索图片,还是放大图片局部,最终给出精准答案。
SenseSearch由商汤科技、清华大学和中国科学技术大学共同提出,并已被计算机视觉顶会CVPR 2026录用。它首次通过端到端的强化学习,让VLM学会了在推理过程中同时调用文本搜索、图像搜索和图像裁剪三种工具,解决了现有模型在知识密集型和高分辨率视觉任务上的短板。
下面,龙哥就来带你看懂这篇堪称“视觉搜索智能体里程碑”的工作。
当VLM学会“找茬”:如何让AI同时拥有放大镜和搜索引擎?
你拿着新买的手机拍了一张4K分辨率的海报,想问问AI海报角落里那一行小字是什么品牌和型号。结果帮主流的视觉语言模型(VLM)看了一眼,要么说“看不清”,要么直接瞎编一个。再问它“这个牌子昨天刚发布的新品参数是什么?”,它更是直接懵掉——训练数据只到2023年,怎么可能知道昨天的事?
这就是现有VLM的两大硬伤:静态知识库和缺乏细粒度视觉分析能力。面对高分辨率图像里的微小文字或物体,它们就像没带眼镜又没联网的学渣,只能瞎蒙。
SenseSearch的解决方案很直观:给VLM配上一套“放大镜+搜索引擎+推理大脑”的三合一装备。它不再是一次性“看完”图片然后直接回答,而是学会主动思考:“这个问题我是不是需要去搜一下?”“那个小字我是不是要放大仔细看?”然后根据推理结果,动态调用文本搜索、图像搜索或者图像裁剪工具,收集足够信息后再给出答案。
从“拍图识物”到“精准定位”:SenseSearch如何打通视觉搜索最后一公里?
要理解SenseSearch的厉害之处,先要搞清它定义的问题形式。论文将任务建模为多轮交互的智能体搜索推理:
给定一个自然语言查询 q 和一张初始图像 I₀,智能体(即SenseSearch)需要在一轮轮推理中决定下一步做什么。它拥有四种可选动作:
文本搜索:调用Serper Search API进行关键词搜索,获取最新的文本信息。
图像搜索:以当前图片为输入,进行反向图像搜索,找到视觉上相似的网络图片和相关上下文。
图像裁剪:对图片中某个区域进行裁剪放大,让模型能够更仔细地阅读小字或小物体。
最终答案:当模型觉得信息够了,就生成最终输出。
每轮智能体先生成一段推理,然后选择一个动作。不像以前那种静态RAG(检索增强生成)——不管问题难易都先搜一堆资料——SenseSearch完全是动态的:简单的直接答,复杂的才去搜;需要看细部的就裁图放大。这就像人解决难题一样,边想边找,边找边看。
告别手忙脚乱:强化学习如何让AI学会“看、搜、裁”三位一体
要让模型学会同时用好这三种工具,不是简单把代码堆在一起就能完成的。论文采用了两阶段训练法:
第一阶段:冷启动SFT(Cold-start Supervised Fine-Tuning)。论文花了很大功夫构建了一个只有约3000条高质量示例的冷启动数据集。这些数据覆盖了需要搜索、需要裁剪或两者结合的各种视觉任务。关键点是:数据必须“够难”。论文先用Qwen2.5-VL-7B-Instruct跑8次采样,把模型答错或几乎答不对的样本挑出来(“hard samples”),然后请Gemini-2.5-Flash生成完整的多轮工具调用轨迹,最后再用GPT-4o验证格式和答案正确性。这样训练出来的初始模型(SenseSearch-SFT)就学会了基本的工具使用流程。
第二阶段:强化学习(Reinforcement Learning)。SFT只是“依葫芦画瓢”,要让模型真正成为高效的“搜索-推理”专家,还得靠RL。RL阶段,模型在更大的数据集上(包括FVQA-train、VisualProbe-train和DeepEyes-4K-train)不断试错,通过奖励信号学习如何更聪明地调用工具——比如减少无效搜索、在必要时才裁剪、以及更高效地组织推理步骤。
不止是搜索,更是推理:BN-GSPO算法如何驯服多工具协同训练
GRPO(Group Relative Policy Optimization)或GSPO(Group Sequence Policy Optimization),训练很容易不稳定——简单问题很快过拟合,复杂问题还没学会。
BN-GSPO(Batch-Normalized Group Sequence Policy Optimization)。核心思想是对优势函数(advantage)进行两步归一化:第一步在组内标准化(GSPO原有的),第二步在一个mini-batch内做跨组的归一化。这样不同问题之间的奖励量级就被拉平了,训练信号更加一致。
正确性奖励(答案是否匹配ground truth,由GPT-4o判断)和格式奖励(每个轮次必须包含推理和正确的工具调用格式)。简单但有效。
效果炸裂:开源7B模型吊打GPT-4o-mini,比肩Gemini和GPT-4o
论文在两类基准上进行了全面评估:搜索导向基准(FVQA-test、InfoSeek、MMSearch、HR-MMSearch等)和细粒度视觉理解基准(V* Bench、HR-Bench、MME RealWorld)。
表1展示了搜索导向的任务结果。可以看到,直接回答(Direct Answer)模式下,即使是GPT-4o也只有42.38平均分。加上RAG工作流后分数大幅提升。但最强的还是Agentic Model——模型自主决定工具使用。SenseSearch-RL以7B参数量取得了57.43的平均分,不仅超越了所有开源模型(包括之前的SOTA MMSearch-R1 52.49),还以很大优势战胜了GPT-4o-mini(45.65),与Gemini-2.5-Flash(58.05)几乎平起平坐,仅略低于GPT-4o(60.93)。注意,GPT-4o是闭源大模型,参数量远大于7B。
表2是细粒度视觉理解的结果。SenseSearch-RL在V* Bench、HR-Bench 4K、HR-Bench 8K、MME RealWorld上全面超越此前的微型工具模型Pixel-Reasoner和DeepEyes,平均分72.8,比GPT-4o(71.5)还高一点。注意GPT-4o是直接回答模式,没有用工具——但这也充分说明SenseSearch的视觉分析能力已经达到闭源模型水平。
论文还分析了不同数据分布对RL的影响(表4)。如果只用感知数据训练,模型会变成“只会裁图但不会搜索”的偏科生。只有混合搜索和感知数据才能达到最佳平衡。
未来已来:智能体视觉模型的新范式与无限可能
SenseSearch为我们指明了一条清晰的道路:未来的VLM不再是“死记硬背”的静态模型,而是会主动使用工具的智能体。这种“推理+搜索+感知”三位一体的范式,对于许多应用场景具有革命性意义:
医疗影像分析:医生可以指着CT片上的一小块阴影问AI“这个可能是哪种病变?最近有什么新研究?”AI会自动放大阴影区域、搜索最新文献,然后给出参考建议。
电商产品识别:拍一张模糊的商品局部图,AI自动搜索完整商品信息、价格、评测,甚至可以给出推荐。
工业质检:在一张4K生产线上,AI自主裁剪可疑区域进行精细检测,同时搜索历史缺陷数据库比对。
当然,SenseSearch目前还基于7B模型,虽然效果已很出色,但更大的模型(比如32B或更大)还有待探索。论文中已经展示了32B版本的部分结果,平均分进一步提升到60+。另外,当前工具集是固定的,未来可以扩展出更多工具,比如代码执行、数据库查询等。
论文已经开源了全部代码和数据集(GitHub: OpenSenseNova/SenseNova-MARS),社区可以直接复现和在此基础上改进。可以预见,基于RL的智能体VLM将成为下一个研究热点,SenseSearch是其中非常扎实的一步。
龙迷三问
这篇论文解决什么问题?现有VLM无法处理需要细粒度视觉分析和外部知识搜索的复杂任务。SenseSearch让VLM学会根据推理结果动态调用文本搜索、图像搜索和图像裁剪三种工具,实现端到端的搜索推理智能体。
BN-GSPO中的“Batch Normalized”具体是什么意思?它是在GSPO的基础上,对组标准化后的优势值再做一个跨整个mini-batch的标准化。这样可以消除不同prompt之间奖励尺度差异带来的训练不稳定,让简单和困难的问题都能被均衡优化。
HR-MMSearch基准有什么特别?它是由305张4K分辨率图像组成的新基准,图像全部来自2025年的事件,避免了训练数据泄露。每个问题都聚焦于图像中面积小于5%的微小物体或文字,专门考验模型的高分辨率细粒度搜索推理能力。
如果你还有哪些想要了解的,欢迎在评论区留言或者讨论~
龙哥点评
论文创新性分数:★★★★✰首次将图像裁剪工具融入搜索推理智能体框架,并通过RL端到端训练多工具协作,思路清晰且有效。不过BN-GSPO算法本质上是对GSPO的工程改进,理论创新稍弱。
实验合理度:★★★★★实验设计非常扎实:基准全面(7个搜索+4个视觉)、对比方法涵盖开源和闭源、消融清晰。尤其对比了直接回答、RAG、智能体三种工作流,立体展示了方法的优势。
学术研究价值:★★★★★这篇论文开创了“搜索+裁剪+推理”融合的智能体VLM范式,对多工具协作、RL训练稳定性等方向有重要启发。代码和数据全部开源,便于后续研究。
稳定性:★★★★✰BN-GSPO提高了训练稳定性,模型在不同benchmark上的表现一致。但工具调用依赖外部API(Serper),网络延迟和API故障会影响实际使用。
适应性以及泛化能力:★★★★✰在多个搜索和感知基准上都有提升,但当前仅测试了7B和32B模型。对于极端低光、模糊图像等噪声场景的泛化能力还需验证。
硬件需求及成本:★★★✰✰7B模型推理可以在单卡V100上完成,但RL训练需要多卡(论文使用128 batch size)。API调用会产生费用(Serper搜索),且每次推理最多32K token,实时场景成本较高。
复现难度:★★★★★代码、数据、模型权重全部开源在GitHub,论文提供了详尽的训练超参数,理论上复现门槛很低。
产品化成熟度:★★★✰✰方法有效但当前依赖外部搜索API,延迟较高(每轮需等待返回)。离线场景(如本地文档搜索)更可行。工具集固定,扩展性有限。
可能的问题:论文没有对比更先进的基座模型(如LLaVA-NeXT、InternVL2),且RL训练中格式奖励占比过高(0.5分),可能导致模型过度关注格式而忽略内容质量。另外,HR-MMSearch基准仅305张图片,规模偏小,代表性可能不足。
主要参考文献
[1] Chng, Y.X. et al. "SenseSearch: Empowering Vision-Language Models with High-Resolution Agentic Search-Reasoning via Reinforcement Learning." CVPR 2026.
[2] MMSearch-R1: Qwen2.5-VL-7B-based agentic search model, 2025.
[3] Pixel Reasoner: Pixel-space visual reasoning via RL, 2025.
[4] DeepEyes: Open-source implementation of "Thinking with images" paradigm, 2025.
*本文仅代表个人理解及观点,不构成任何论文审核或者项目落地推荐意见,具体以相关组织评审结果为准。欢迎就论文内容交流探讨,理性发言哦~ 想了解更多原文细节的小伙伴,可以点击"阅读原文",查看更多原论文细节哦!
SenseSearch告诉你,AI也能学会“看、搜、裁”三位一体!想深入掌握多智能体强化学习与视觉搜索的前沿框架?快来「龙哥读论文」粉丝群,与千名AI爱好者一起,啃论文、追热点、聊落地。每日8篇深度学习论文拆解,30+细分领域全覆盖,等你来撩!
欢迎加入龙哥读论文粉丝群,
扫描下方二维码或者添加龙哥助手微信号加群:kangjinlonghelper。
一定要备注:研究方向+地点+学校/公司+昵称(如 图像处理+上海+清华+龙哥),根据格式备注,可更快被通过且邀请进群。