← 返回 PaperDaily 视觉与图像

国立成功大学新突破:LLM引导食物分割,即插即用模块mIoU达55.0

食物分割里,豆腐和芝士经常被搞混?国立成功大学这篇工作用一个巧妙的思路——让大语言模型(GPT-o4 mini)根据图像猜出食材名称,再把食材标签嵌入视觉特征或解码器查询中,实现精准分割。两个模块完全即插即用,在FoodSeg103上刷新SOTA达到55.0 mIoU,且仅增加3.8GB显存开销。不用搞什么对齐训练,拿来就能涨点,实用派狂喜!

原论文信息如下:
论文标题:
Food Image Segmentation with LLM-Derived Ingredient Labels and Multimodal Fusion
发表日期:
2026年07月
发表单位:
National Cheng Kung University, Tainan, Taiwan (国立成功大学)

1. 食物分割难在哪?视觉相似食材的挑战

先问大家一个问题:当你看到一盘菜,能准确分辨出里面每一块到底是豆腐还是芝士,是土豆还是萝卜吗?

这问题看似简单,但机器视觉做起来可不容易。食物图像分割,说白了就是把一道菜里的每种食材“抠”出来,打上对应标签。这活儿听起来常规,但真正做起来——用龙哥的话讲——特别容易翻车。

为什么呢?因为食材之间长得太像了。豆腐和芝士都是白白软软的,酱汁和汤颜色纹理几乎一样,烤虾和披萨馅料在特定光照下根本分不清。这种 高类间相似性 再加上 高类内变异性(比如同一种食材切法不同、熟度不同),让纯视觉模型频频翻车。
图5:分割结果对比。Mask2Former基线错把酱料当成汤,加入LIM模块后边界和类别都准确了。
早期方法靠纯视觉特征,像UPerNet、DeepLab这些CNN架构,后来Transformer来了,Mask2Former等模型性能大幅提升,但依然难以应对视觉模糊的食材。这时候有研究者想到:如果模型能“知道”这道菜里有什么配料,那岂不是能减少很多误判?

这就是 文本引导的图像分割 的起源——用食材名称这样的语义信息来指导视觉模型。之前的工作如ReLeM、OVFoodSeg都做了尝试,但它们需要大量的图文配对数据(Recipe1M+之类),训练复杂,且难以迁移到新场景。

那有没有一种方案:不用费劲搞配对数据,还能即插即用,随便挂到现有分割模型上就能涨点?

答案是:有。国立成功大学(台湾)的研究团队带来了两个轻量级模块——LIM-F和LIM-Q,效果出奇好。

2. 创新方案:利用LLM生成标签,即插即用双模块

整个思路其实很直接:

先让大语言模型(LLM)看一眼食物图片,让它猜出里面大概有哪些食材。然后把这些食材名称变成一串文本标签,再用BERT这种文本编码器转成向量,最后把这些语义向量“注入”到图像分割模型中指导决策。

关键来了——这个过程完全不需要人工标注的图文配对,因为LLM可以直接根据图像像素“编”出标签,虽然标签不完美,但足够给模型搭个语义脚手架。
图1:整体框架。LLM根据图片输出可能食材,BERT编码后注入视觉分支。
论文提出了两种注入方式,分别命名为 LIM-F(Language Injection Module for Features,特征级语言注入模块)和 LIM-Q(Language Injection Module for Queries,查询级语言注入模块)。

它们最打动人的标签就是 即插即用:不需要改动骨干网络的结构,不需要重新设计损失函数,加上去就能训练,显存开销最多只增加3.8GB。对于很多只想在已有模型上白捡几个点的同学来说,这简直是福音。

3. LIM-F与LIM-Q:特征级与查询级注入的巧妙设计

LIM-F的工作位置在 特征层面,适合搭配能输出多层特征图的编码器(如Swin Transformer)。Swin-L会输出四个不同层级(level 0~3)的特征图,每个LIM-F模块在这四个层级上独立操作:以视觉特征作为Query,以BERT编码的食材嵌入作为Key/Value,进行交叉注意力计算,然后用残差连接把结果加回到视觉特征中。

这么做的直观理解:让每一层特征图都去“问”一下文本——这张图上到底有哪些食材?然后带着文本信息再往下送。因为交叉注意力用在了所有层级,视觉特征就能从粗到细地吸收语义指导。
图2:LIM-F结构。每个层级独立做交叉注意力,把语义注入到图像特征中。
LIM-Q则工作在 查询层面,专门为Transformer解码器(如Mask2Former)设计。在Mask2Former里,每一轮解码都需要更新一组可学习的查询向量(query tokens)。LIM-Q在每一轮开始前,先让这些查询向量和BERT编码的食材嵌入做一次交叉注意力,再经过自注意力和FFN,把语义注入到查询里。

这种做法等于直接告诉查询向量:你要找的对象是这些食材,而不是靠视觉特征慢慢猜。所以LIM-Q收敛更快,论文Fig.4的mIoU曲线清楚显示了这一点。
图3:LIM-Q结构。在每轮解码前用食材文本增强查询向量。
另外值得一提的是,损失函数这里也有个小巧思。Mask2Former原本采用 mask loss(CE+Dice)加分类loss,权重是(5,5,2)。作者发现当增加分类loss权重时,两个LIM模块能获得更大的提升。表3的消融实验表明:对于LIM-F,把分类权重从2调到4(且微调BERT)最佳;对于LIM-Q,调到6最佳。

这很符合直觉——因为文本标签已经给出了类别信息,强化分类监督自然更有效。

4. 实验盘点:在FoodSeg103上刷新SOTA

论文在FoodSeg103基准上做了全面评估。FoodSeg103是食物分割领域公认的标杆,包含103类食材、超过7000张图片。下面直接看核心结果:
表1:主实验mIoU结果。LIM-Q以55.0拔得头筹,LIM-F紧随其后。
从表1可以看到,Mask2Former(Swin-L)基线是51.9,加LIM-F后提升到54.4(+4.8%相对增益),加LIM-Q后到55.0(+6.0%)。而且LIM-F还能和传统CNN架构(K-Net+UPerNet)配合,把mIoU从47.7提升到49.0(+2.7%),证明了它不挑解码器的特性。

对比当前SOTA——Swin-TUNA的50.6,LIM-Q直接高出近5个点。这个差距在图像分割领域是显著的。
图4展示了训练过程中mIoUs的变化:
图4:训练收敛曲线。两种注入模块都优于基线,LIM-Q在前期就快速拉高。
显存开销:基线Mask2Former约19GB,加LIM-F后22.5GB(+3.5GB),加LIM-Q后20GB(+1GB)。考虑到性能提升幅度,这点代价完全可以接受。

5. 案例解析:罕见食材分割效果大幅提升

论文特意分析了罕见食材上的表现。表2列出了一批在训练集中出现比例不足1.2%的食材(如date、melon、dried cranberries等):
表2:罕见食材的IoU提升。对于‘date’(枣),基线几乎完全失效(1.28),LIM-F却达到了88.93。
这数据太夸张了,但仔细一想也合理:视觉模型在训练中几乎没见过‘date’这类样本,自然学不到它的视觉特征。但LLM(GPT-o4 mini)看图片时却可能根据上下文(比如画面上还有大米、甘草)推断出“有枣”,从而让BERT给LIM模块提供了足够强的语义提示。换句话说,文本标签成了罕见类的救命稻草。

类似的,baseline在‘melon’上只有7.95的IoU,LIM-F提升到60.9,LIM-Q也到52.27。这些改善不是一点点,而是直接翻倍甚至翻几十倍。这对实际应用意义很大——食物分割要落地,必须能处理那些偶尔出现的稀有食材。
消融实验(表3)也验证了超参数选择:
表3:消融实验。增大分类权重并微调BERT能取得最佳性能。

6. 局限与未来:依赖LLM质量,跨领域待验证

任何新方法都有不完美的地方,这篇也有它的边界:

第一,对LLM质量敏感。实验用的GPT-o4 mini在2025年5月表现不错,但如果换成更弱的开源模型,生成的标签噪声增大,性能是否会下降?目前没有实验验证。并且LLM的使用需要联网调用,对隐私敏感的应用可能有顾虑。

第二,只验证了FoodSeg103一个数据集。食物分割还有其他数据集(如UNIMIB2016、MyFood等),跨域泛化能力没测。另外,该方法理论上也可以拓展到其他细粒度分割任务(如医学图像、农业),但论文没有验证。

第三,LIM-F和LIM-Q在同一架构(Mask2Former)上表现接近,但LIM-Q显存更低、收敛更快,是更推荐的选择。不过LIM-F拥有更好的通用性(可搭配CNN解码器)——如果未来LVM(大视觉模型)替换了Transformer解码器,LIM-F的适用范围反而更广。

第四,LLM生成标签的过程是否“作弊”?论文用图片来让LLM推理食材,相当于借助了外部知识。这也可能引入偏见——LLM如果漏掉某类食材,模型就永远得不到这个类的文本信号。但总体来看,正收益远大于风险。

龙迷三问

下面是龙哥对于大家可能的一些问题的解答:

Q1:这篇论文的创新点到底在哪?简单说就是“用LLM生成食材标签来辅助分割”吗?不完全是。LLM生成标签只是第一步,核心创新是LIM-F和LIM-Q这两个即插即用的注入模块。它们解决了之前方法需要大规模图文配对预训练的问题。而且LIM-F不限制解码器类型,LIM-Q针对Transformer解码器优化,两种设计相互补充。

Q2:为什么罕见食材能涨点这么多?因为LLM提供了“常识”。比如图片里有一碗汤,里面飘着几颗小红果,视觉上可能被划为“其他”,但LLM根据整体菜肴风格推断出“可能有枸杞”或“可能有枣”。这个语义先验对齐到分割模型,模型就不需要从少量训练样本中学这个类别,而是直接“听从”文本提示。

Q3:这个方法能不能迁移到医学图像分割?思路上是可行的——比如用LLM根据影像学描述生成可能的病灶区域标签。但有两个前提:一是LLM要能准确理解医学影像的视觉内容(目前GPT-4v等多模态模型在医疗成像上并不完美);二是需要合适的文本编码器(BERT可能不够,需要医学领域的预训练模型)。但总体来看,LIM-F的通用性让它有潜力迁移到很多细粒度分割场景。

如果你还有哪些想要了解的,欢迎在评论区留言或者讨论~

龙哥点评

论文创新性分数:★★★★☆

构思很巧妙,用LLM输出+轻量交叉注意力实现即插即用的语义注入,与之前方法相比省去了大量预训练开销。

实验合理度:★★★★☆

在FoodSeg103上做了充分对比和消融,基线选择合理(Mask2Former、K-Net),罕见食材的针对分析很有说服力。但缺乏跨数据集验证。

学术研究价值:★★★★☆

为“如何利用LLM常识提升视觉密集预测”提供了一个干净、可复用的范式,有望在其他细粒度分割任务中引发后续工作。

稳定性:★★★☆☆

依赖LLM生成标签的质量,在线LLM可能不稳定或返回错误标签。理论上不同LLM的输出方差会影响最终分割精度,论文未分析这点。

适应性以及泛化能力:★★★☆☆

只在FoodSeg103单一数据集上验证,且食材类型固定(菜式偏向亚洲菜)。迁移到其他食物文化或医学、农业场景时性能未知。

硬件需求及成本:★★★☆☆

训练需要24GB左右显存(LIM-Q版20GB),推理时需额外调用LLM,增加延迟和成本。如果部署环境没有网络或不能调用GPT,就需要换本地LLM。

复现难度:★★★☆☆

目前未公开代码。不过所用组件(Swin-L、Mask2Former、BERT)均有成熟开源实现,LIM模块结构清晰,复现难度中等。

产品化成熟度:★★☆☆☆

目前仍是学术验证阶段。要产品化还需解决:推理时LLM调用开销、对罕见食材的过度依赖(LLM一旦预测错类别模型会跟着错)、以及跨菜系泛化测试。

可能的问题:论文没有对比LLM换成本地部署的模型(如Qwen-7B)时的表现,也没有报告LLM生成标签的准确率。此外,罕见食材的提升数字过于亮眼,需要警惕是否因特定超参数或随机种子导致,建议复现时多做几次实验确认稳定性。


主要参考文献

[1] Wu, X., Fu, X., Liu, Y., Lim, E.P., Hoi, S.C., Sun, Q.: A large-scale benchmark for food image segmentation. In: Proceedings of ACM International Conference on Multimedia. pp. 506–515 (2021)(FoodSeg103基准)
[2] Cheng, B., Misra, I., Schwing, A.G., Kirillov, A., Girdhar, R.: Masked-attention mask transformer for universal image segmentation. In: CVPR. pp. 1290–1299 (2022)(Mask2Former)
[3] Liu, Z., Lin, Y., Cao, Y., Hu, H., Wei, Y., Zhang, Z., Lin, S., Guo, B.: Swin transformer: Hierarchical vision transformer using shifted windows. In: ICCV (2021)(Swin Transformer)
[4] Devlin, J., Chang, M.W., Lee, K., Toutanova, K.: Bert: Pre-training of deep bidirectional transformers for language understanding. In: NAACL-HLT. pp. 4171–4186 (2019)(BERT)
[5] Wu, X., Yu, S., Lim, E.P., Ngo, C.W.: Ovfoodseg: Elevating open-vocabulary food image segmentation via image-informed textual representation. In: CVPR. pp. 4144–4153 (2024)(OVFoodSeg)

融会贯通

结合PaperDaily已收录论文进行同基准对比:在FoodSeg103的mIoU指标上,此前的最佳方法是Swin-TUNA(50.6),本文的LIM-Q达到了55.0,相对提升约8.7%。虽然提升幅度显著,但需要指出:本文仅使用单个数据集FoodSeg103,且LLM生成标签的方式可能隐含了“利用测试集图像”的风险(LLM是在训练时根据每张图片生成标签的,如果LLM泛化能力在测试集上也表现良好,则可能引入轻微的数据泄露)。此外,不同split下的对比结果可能存在差异,建议在更多数据集(如UNIMIB2016、Food-101分割版)上验证,才能确认方法的绝对领先地位。

总体而言,这篇工作给了一个非常实用的“LLM即插即用”配方,在食物分割这个应用价值巨大的方向上取得了实打实的进步。如果你手头正好有食物分割的任务,不妨试试LIM-F或LIM-Q——至少从论文结果看,花3.8GB显存换近4个点的mIoU提升,这笔交易相当划算。

*本文仅代表个人理解及观点,不构成任何论文审核或者项目落地推荐意见,具体以相关组织评审结果为准。欢迎就论文内容交流探讨,理性发言哦~ 想了解更多原文细节的小伙伴,可以点击"阅读原文",查看更多原论文细节哦!       

end
🍽️ 想让你的分割模型更懂食材?LIM-F/LIM-Q即插即用方案值得一试!欢迎加入龙哥读论文粉丝群,扫描下方二维码或者添加龙哥助手微信号加群:kangjinlonghelper。一定要备注:研究方向+地点+学校/公司+昵称(如 图像处理+上海+清华+龙哥),根据格式备注,可更快被通过且邀请进群。
『龙哥读论文』微信群目前包含:图像处理、大模型及智能体、自动驾驶及机器人、AI医疗及AI金融5个群,等你来聊干货!
wechat_helper dianzan
转发文章 微博 X LinkedIn Facebook
龙哥读论文 · PaperDaily

本文基于龙哥读论文 PaperDaily 数据库整理,结合论文原文与工程视角进行解读。