1. 食物分割难在哪?视觉相似食材的挑战
这问题看似简单,但机器视觉做起来可不容易。食物图像分割,说白了就是把一道菜里的每种食材“抠”出来,打上对应标签。这活儿听起来常规,但真正做起来——用龙哥的话讲——特别容易翻车。
为什么呢?因为食材之间长得太像了。豆腐和芝士都是白白软软的,酱汁和汤颜色纹理几乎一样,烤虾和披萨馅料在特定光照下根本分不清。这种 高类间相似性 再加上 高类内变异性(比如同一种食材切法不同、熟度不同),让纯视觉模型频频翻车。
这就是 文本引导的图像分割 的起源——用食材名称这样的语义信息来指导视觉模型。之前的工作如ReLeM、OVFoodSeg都做了尝试,但它们需要大量的图文配对数据(Recipe1M+之类),训练复杂,且难以迁移到新场景。
那有没有一种方案:不用费劲搞配对数据,还能即插即用,随便挂到现有分割模型上就能涨点?
答案是:有。国立成功大学(台湾)的研究团队带来了两个轻量级模块——LIM-F和LIM-Q,效果出奇好。
2. 创新方案:利用LLM生成标签,即插即用双模块
先让大语言模型(LLM)看一眼食物图片,让它猜出里面大概有哪些食材。然后把这些食材名称变成一串文本标签,再用BERT这种文本编码器转成向量,最后把这些语义向量“注入”到图像分割模型中指导决策。
关键来了——这个过程完全不需要人工标注的图文配对,因为LLM可以直接根据图像像素“编”出标签,虽然标签不完美,但足够给模型搭个语义脚手架。
它们最打动人的标签就是 即插即用:不需要改动骨干网络的结构,不需要重新设计损失函数,加上去就能训练,显存开销最多只增加3.8GB。对于很多只想在已有模型上白捡几个点的同学来说,这简直是福音。
3. LIM-F与LIM-Q:特征级与查询级注入的巧妙设计
这么做的直观理解:让每一层特征图都去“问”一下文本——这张图上到底有哪些食材?然后带着文本信息再往下送。因为交叉注意力用在了所有层级,视觉特征就能从粗到细地吸收语义指导。
这种做法等于直接告诉查询向量:你要找的对象是这些食材,而不是靠视觉特征慢慢猜。所以LIM-Q收敛更快,论文Fig.4的mIoU曲线清楚显示了这一点。
这很符合直觉——因为文本标签已经给出了类别信息,强化分类监督自然更有效。
4. 实验盘点:在FoodSeg103上刷新SOTA
对比当前SOTA——Swin-TUNA的50.6,LIM-Q直接高出近5个点。这个差距在图像分割领域是显著的。
5. 案例解析:罕见食材分割效果大幅提升
类似的,baseline在‘melon’上只有7.95的IoU,LIM-F提升到60.9,LIM-Q也到52.27。这些改善不是一点点,而是直接翻倍甚至翻几十倍。这对实际应用意义很大——食物分割要落地,必须能处理那些偶尔出现的稀有食材。
6. 局限与未来:依赖LLM质量,跨领域待验证
第一,对LLM质量敏感。实验用的GPT-o4 mini在2025年5月表现不错,但如果换成更弱的开源模型,生成的标签噪声增大,性能是否会下降?目前没有实验验证。并且LLM的使用需要联网调用,对隐私敏感的应用可能有顾虑。
第二,只验证了FoodSeg103一个数据集。食物分割还有其他数据集(如UNIMIB2016、MyFood等),跨域泛化能力没测。另外,该方法理论上也可以拓展到其他细粒度分割任务(如医学图像、农业),但论文没有验证。
第三,LIM-F和LIM-Q在同一架构(Mask2Former)上表现接近,但LIM-Q显存更低、收敛更快,是更推荐的选择。不过LIM-F拥有更好的通用性(可搭配CNN解码器)——如果未来LVM(大视觉模型)替换了Transformer解码器,LIM-F的适用范围反而更广。
第四,LLM生成标签的过程是否“作弊”?论文用图片来让LLM推理食材,相当于借助了外部知识。这也可能引入偏见——LLM如果漏掉某类食材,模型就永远得不到这个类的文本信号。但总体来看,正收益远大于风险。
龙迷三问
Q1:这篇论文的创新点到底在哪?简单说就是“用LLM生成食材标签来辅助分割”吗?不完全是。LLM生成标签只是第一步,核心创新是LIM-F和LIM-Q这两个即插即用的注入模块。它们解决了之前方法需要大规模图文配对预训练的问题。而且LIM-F不限制解码器类型,LIM-Q针对Transformer解码器优化,两种设计相互补充。
Q2:为什么罕见食材能涨点这么多?因为LLM提供了“常识”。比如图片里有一碗汤,里面飘着几颗小红果,视觉上可能被划为“其他”,但LLM根据整体菜肴风格推断出“可能有枸杞”或“可能有枣”。这个语义先验对齐到分割模型,模型就不需要从少量训练样本中学这个类别,而是直接“听从”文本提示。
Q3:这个方法能不能迁移到医学图像分割?思路上是可行的——比如用LLM根据影像学描述生成可能的病灶区域标签。但有两个前提:一是LLM要能准确理解医学影像的视觉内容(目前GPT-4v等多模态模型在医疗成像上并不完美);二是需要合适的文本编码器(BERT可能不够,需要医学领域的预训练模型)。但总体来看,LIM-F的通用性让它有潜力迁移到很多细粒度分割场景。
龙哥点评
论文创新性分数:★★★★☆
构思很巧妙,用LLM输出+轻量交叉注意力实现即插即用的语义注入,与之前方法相比省去了大量预训练开销。实验合理度:★★★★☆
在FoodSeg103上做了充分对比和消融,基线选择合理(Mask2Former、K-Net),罕见食材的针对分析很有说服力。但缺乏跨数据集验证。学术研究价值:★★★★☆
为“如何利用LLM常识提升视觉密集预测”提供了一个干净、可复用的范式,有望在其他细粒度分割任务中引发后续工作。稳定性:★★★☆☆
依赖LLM生成标签的质量,在线LLM可能不稳定或返回错误标签。理论上不同LLM的输出方差会影响最终分割精度,论文未分析这点。适应性以及泛化能力:★★★☆☆
只在FoodSeg103单一数据集上验证,且食材类型固定(菜式偏向亚洲菜)。迁移到其他食物文化或医学、农业场景时性能未知。硬件需求及成本:★★★☆☆
训练需要24GB左右显存(LIM-Q版20GB),推理时需额外调用LLM,增加延迟和成本。如果部署环境没有网络或不能调用GPT,就需要换本地LLM。复现难度:★★★☆☆
目前未公开代码。不过所用组件(Swin-L、Mask2Former、BERT)均有成熟开源实现,LIM模块结构清晰,复现难度中等。产品化成熟度:★★☆☆☆
目前仍是学术验证阶段。要产品化还需解决:推理时LLM调用开销、对罕见食材的过度依赖(LLM一旦预测错类别模型会跟着错)、以及跨菜系泛化测试。可能的问题:论文没有对比LLM换成本地部署的模型(如Qwen-7B)时的表现,也没有报告LLM生成标签的准确率。此外,罕见食材的提升数字过于亮眼,需要警惕是否因特定超参数或随机种子导致,建议复现时多做几次实验确认稳定性。
主要参考文献
[2] Cheng, B., Misra, I., Schwing, A.G., Kirillov, A., Girdhar, R.: Masked-attention mask transformer for universal image segmentation. In: CVPR. pp. 1290–1299 (2022)(Mask2Former)
[3] Liu, Z., Lin, Y., Cao, Y., Hu, H., Wei, Y., Zhang, Z., Lin, S., Guo, B.: Swin transformer: Hierarchical vision transformer using shifted windows. In: ICCV (2021)(Swin Transformer)
[4] Devlin, J., Chang, M.W., Lee, K., Toutanova, K.: Bert: Pre-training of deep bidirectional transformers for language understanding. In: NAACL-HLT. pp. 4171–4186 (2019)(BERT)
[5] Wu, X., Yu, S., Lim, E.P., Ngo, C.W.: Ovfoodseg: Elevating open-vocabulary food image segmentation via image-informed textual representation. In: CVPR. pp. 4144–4153 (2024)(OVFoodSeg)
融会贯通
总体而言,这篇工作给了一个非常实用的“LLM即插即用”配方,在食物分割这个应用价值巨大的方向上取得了实打实的进步。如果你手头正好有食物分割的任务,不妨试试LIM-F或LIM-Q——至少从论文结果看,花3.8GB显存换近4个点的mIoU提升,这笔交易相当划算。
*本文仅代表个人理解及观点,不构成任何论文审核或者项目落地推荐意见,具体以相关组织评审结果为准。欢迎就论文内容交流探讨,理性发言哦~ 想了解更多原文细节的小伙伴,可以点击"阅读原文",查看更多原论文细节哦!
『龙哥读论文』微信群目前包含:图像处理、大模型及智能体、自动驾驶及机器人、AI医疗及AI金融5个群,等你来聊干货!