← 返回 PaperDaily
视觉与图像
Google新方法:先想清楚再分类,F1最高涨10.5%
这篇论文最有意思的地方,不是又造了一个更强的分类器,而是先承认一件事:很多视觉概念根本没法一上来就说清。Google把“边界样本+概念梳理”做成了一个可交互流程,专门治那种人和模型都容易吵架的主观概念,挺实用。
龙哥读论文
发布于 2026-08-16 00:20:02
阅读 4
查看原文
原论文信息如下:
从“凭感觉”到“会思考”:AI如何帮你厘清模糊的视觉概念
有些视觉任务,模型不是不会做,而是人自己都没想明白。比如“健康食物”“危险内容”“像不像高端餐厅摆盘”这种概念,边界本来就糊得像一锅粥。模型一上来就要给答案,往往只能靠“猜”;人一上来就要写定义,也经常写着写着就改口。Agile Deliberation 做的事很朴素:先别急着分类,先把“这个概念到底是什么意思”想清楚,再让模型跟着人一起迭代。
这篇论文最有意思的地方,不是把视觉分类又卷高了几个点,而是承认了一个现实:主观视觉概念不是“标出来就完事” ,它更像人脑里的一个动态草稿。内容审核、视觉筛选、个性化推荐这些场景里,真正麻烦的往往不是“有没有猫”,而是“这只猫算不算可爱到值得推荐”“这张图算不算有误导性”。这类任务里,概念本身就是会变的,边界也会随着例子不断被重新理解。
论文把这种过程叫做concept deliberation ,中文可以理解为“概念审思”或者“概念推敲”。这里的 deliberation 不是“犹豫不决”,而是指人对一个模糊概念反复看例子、拆边界、改定义的过程。作者从内容审核专家的访谈里发现,真实工作流里大家并不是先有一个完美定义再去标注,而是先有一个大概想法,然后不断碰到边界样本,边看边改,边改边统一标准。
于是,Agile Deliberation 的目标就很明确:不是替人拍板,而是帮人把概念想清楚,再把这个清晰后的概念变成一个能工作的视觉分类器。它解决的不是“模型不够大”,而是“人和模型对同一个词的理解压根没对齐”。这事看起来文气,实际上很工程:定义不稳,标签就乱;标签一乱,少量数据下的微调就容易翻车。
深入剖析Agile Deliberation:两大阶段与三大模块
这套方法可以先用一句人话概括:先拆概念,再找边界,最后迭代定义 。流程分成两大阶段:概念范围界定(concept scoping)和概念迭代(concept iteration);系统里落地成三个模块:分解模块、边界图像检索模块、概念修正模块。名字不花哨,但逻辑很顺。
第一步是概念范围界定 。系统先拿到一个概念名,比如“健康食物”或者“paid to play”。如果这个概念本身很复合,就先拆成若干个单位概念,例如“食物类型”“烹饪方式”“配料特征”之类,再把每个单位概念继续展开成正向和负向的子概念。这里的关键不是让模型写出一篇作文,而是让它把模糊概念压成一个结构化定义:哪些特征算进来,哪些特征要排出去,哪些边界情况需要特别说明。
这个阶段的价值很现实。很多人做分类时,脑子里其实有一团“差不多”的标准,但一旦要写成提示词,就会发现“差不多”这三个字最难落地。Agile Deliberation 逼着系统把这团雾拆成几个可讨论的块:正例子概念、反例子概念、以及容易争议的边缘项。这样做的好处是,后面不管是给人看,还是喂给视觉语言模型,都更稳定。
第二步是概念迭代 。这一步才是真正“审思”的核心。系统会不断找出那些语义上处在边界附近的图像,拿给用户看,让用户标注、评论、修正。注意,这里不是传统意义上的“不确定性采样”,不是盯着概率最接近 0.5 的样本硬挑,而是找语义上最容易让人犹豫的样本。这个区别很关键,后面会单独展开。
这一步的设计很像现实中的专家工作流:真正有用的反馈,往往不是“这个明显对/错”,而是“这个地方差一点点,你得把标准说死”。因此系统会把模型的预测、理由、用户的标签和简短解释放在一起,让人看到分歧究竟出在哪里。然后再让大模型根据这些反馈自动改写定义,生成新的候选版本,继续下一轮。
从实现上看,三大模块分别承担三种任务:分解模块负责把大概念拆成可讨论的结构;边界图像检索模块负责把“争议点”从海量图片里捞出来;概念修正模块负责把人类反馈写回定义。三者拼起来,就不是简单的“人打标签、模型训练”了,而是一个围绕概念理解展开的闭环。
很多人做主动学习时,第一反应是:把模型最不确定的样本挑出来不就行了?在普通分类任务里,这招常常有效。但这篇论文偏偏不这么干,因为这里的“分类器”不是一个训练得很老实的判别式模型,而是靠视觉语言模型加提示词去判断。问题来了:VLM 的置信度不一定和人的理解一致 。模型觉得稳,人在挠头;人觉得明显,模型反而装糊涂,这种场面并不少见。
所以作者换了个思路:不去盯“概率边界”,而去找“语义边界”。所谓语义边界,就是那些在自然语言定义下最容易引发争议的图像。比如“健康食物”里,沙拉加了很多奶油酱,到底还算不算健康?“paid to play”里,图片里明明有奖励承诺,但语气又像玩笑,这算不算点击诱饵?这些样本不一定是模型最不确定的,但它们往往最能暴露定义里的漏洞。
这就是这套方法最“聪明”的地方:它不只是在找错误,而是在找能逼人把标准说清楚的错误 。普通的不确定样本,可能只是模型数学上没把握;语义边界样本,则是人类概念本身还没收紧。前者适合训练,后者更适合审思。对于主观概念来说,后者显然更值钱。
论文里这块实现也挺工程化。系统先生成一批边界查询,再从目标数据集中检索相似图像,随后去重、聚类,再用一个多臂老虎机式的策略挑选最值得展示的簇,最后再从簇里挖出真正“卡边界”的样本。这个设计看起来绕,但好处很实际:既能保证样本多样性,又能把用户时间花在最有信息量的地方,而不是被一堆重复图像刷屏。
这篇论文的实验很特别,因为它没有走常规“找个公开数据集、跑个分数、贴个表”的套路。原因也简单:主观概念没有稳定真值,尤其是概念会随着用户理解不断变化时,静态基准根本测不准“对齐”这件事。所以作者做了 18 组真实用户会话,每组 1.5 小时,直接看系统能不能帮人把概念越想越清楚。
实验设了三类对照:零样本分类、自动分解的对照系统,以及人工审思流程。零样本就是直接拿最初概念描述去问模型;自动分解则是让大模型自动把概念拆细,但不让用户参与修正;人工审思则是让用户自己找边界样本、自己改提示词。Agile Deliberation 则是把“找边界”和“改定义”都系统化了。
结果很直接:Agile Deliberation 在 F1 上比零样本平均高出约 10.5%,比自动分解方法高出约 7.5%,也比人工审思流程更稳。更重要的是,提升主要来自精确率的改善,而不是靠牺牲召回去“保守求稳”。这说明系统不是简单地把模型变得更谨慎,而是把概念边界真正收紧了。
从曲线看,Agile Deliberation 的 F1 随着迭代轮次总体上升,虽然中间有波动,但方向是对的。这个波动并不奇怪,因为每一轮都在改文本定义,而不是单纯调一个数值参数。文本提示词的优化本来就不像梯度下降那样丝滑,它更像人类讨论:有时一轮改得很准,有时会多绕半圈。
用户体验这一块也挺关键。表 2 显示,参与者普遍认为 Agile Deliberation 帮助他们更清楚地理解概念,认知负担更低,挫败感也更小。这个结果很重要,因为主观概念任务里,系统好不好,不只是看分数,还要看人是不是愿意继续用。一个把人搞得头大的工具,即使分数涨一点,也未必适合真实部署。
更有意思的是跨模型迁移。作者把用 Gemini 2.5 Flash 产出的概念定义,拿去给其他视觉语言模型继续用,发现效果还能保持相当一部分提升。这说明它学到的不是某个模型的“投机提示词”,而是更接近人类概念本身的结构化表达。对工程来说,这个信号很友好:定义如果只能绑死在一个模型上,实用性就会很差;如果能迁移,才更像真正可复用的资产。
不过,这里也别把结果吹得太满。实验是通过真实用户会话完成的,优点是真实,代价是样本不大、概念有限、会话时长也受约束。再加上系统依赖大模型 API、图像检索和交互式流程,离“开箱即用的大规模产品”还有一段距离。它证明的是方法方向靠谱,不是说所有主观分类问题都能立刻被一键治好。
Agile Deliberation 的启发其实很简单,却很容易被忽略:很多 AI 问题不是“模型不够聪明”,而是“人没把问题说清楚” 。尤其在主观视觉分类里,概念边界不是天然存在的,它需要通过例子、反例、边界样本和反复修正慢慢长出来。与其一开始就追求一个“完美标签”,不如先建立一个能让人持续修正的流程。
这也是这篇工作的真正价值:它把“概念对齐”从抽象口号变成了可操作的交互流程。对内容审核、品牌安全、个性化内容筛选这类场景来说,这种流程比单纯追求一个更高的分数更有意义。因为真实业务里,最贵的不是少涨 1 个点的 F1,而是概念没对齐导致的误判、漏判和后续争议。
如果要说这项工作最值得借鉴的地方,那就是它很克制:没有幻想大模型能替人类直接定义价值判断,而是把大模型放在一个更合适的位置上——帮忙拆概念、找边界、写草案、做迭代。模型不是裁判,模型更像一个很勤快的助理,负责把人脑里那团模糊想法整理成可以讨论的文本。
这条思路对后续研究也有启发:未来如果能把这种“概念审思”推广到多模态检索、个性化推荐、医学图像筛查,甚至企业内部的内容治理流程里,价值会更大。但前提依然是老问题:要有足够好的交互体验、可控的延迟、稳定的检索质量,以及对用户反馈的可靠吸收能力。否则,流程再聪明,也可能被卡在工程细节里。
龙迷三问
这篇论文到底解决什么问题? 它解决的是“主观视觉概念怎么才能被人和模型一起说清楚”这个问题。不是单纯提升分类器分数,而是先把模糊概念拆开、找边界、再迭代定义,让分类器和用户意图对齐。
“概念审思(concept deliberation)”是什么意思? 就是人面对一个模糊概念时,不是一次性下定义,而是通过看例子、看边界样本、不断修正标准,逐步形成更一致的判断方式。论文把这个真实工作流系统化了。
为什么强调“语义边界”而不是“概率边界”? 因为这里用的是视觉语言模型,模型的置信度并不总和人类理解一致。语义边界样本更能暴露概念定义里的歧义,也更能推动人把标准讲明白。
如果你还有哪些想要了解的,欢迎在评论区留言或者讨论~
龙哥点评
论文创新性分数: ★★★★☆
把“概念审思”做成可交互框架,这个切口挺新,不是常规分类器套路。
实验合理度: ★★★★☆
没有硬套静态基准,而是用真实用户会话评估,和问题本身匹配得比较好。
学术研究价值: ★★★★☆
对主观概念建模、人机协作标注、提示词迭代都很有启发,研究味道足。
稳定性: ★★★☆☆
流程清楚,但强依赖大模型、检索质量和交互节奏,离强鲁棒产品还有距离。
适应性以及泛化能力: ★★★☆☆
对主观视觉概念很合适,但对定义明确、标签稳定的任务,收益未必明显。
硬件需求及成本: ★★★☆☆
训练不重,但交互依赖云端大模型和检索服务,成本主要在推理与人工时间。
复现难度: ★★★☆☆
思路可复现,但真实用户实验、数据与交互流程不算轻松,完整复现门槛不低。
产品化成熟度: ★★★☆☆
在内容审核、图像筛选等半结构化场景有落地潜力,但需要更低延迟、更稳的反馈吸收机制。
可能的问题: 真实会话成本高,样本量有限,且对大模型交互质量敏感;更像一套有希望的方法论,而不是即插即用的成品。
主要参考文献
[1] Wang et al. Agile Deliberation: Concept Deliberation for Subjective Visual Classification. arXiv, 2025.
[2] 论文原文链接:https://arxiv.org/pdf/2512.10821.pdf
[3] 相关实现与演示:论文未提供公开项目链接,本文仅依据原文与图示整理。
*本文仅代表个人理解及观点,不构成任何论文审核或者项目落地推荐意见,具体以相关组织评审结果为准。欢迎就论文内容交流探讨,理性发言哦~ 想了解更多原文细节的小伙伴,可以点击 "阅读原文", 查看更多原论文细节哦!