← 返回 PaperDaily
视觉与图像
5步扩散+状态空间交互:弱监督显著检测首次全面超越全监督
弱监督显著检测一直面临标注稀疏的困境,上海大学团队直接请出SAM把涂鸦变成高质量像素级伪标注,再搭配Mamba+扩散模型做精修。7个数据集上碾压所有弱监督方法,甚至干翻了不少全监督方法。这是一套有工程潜力的弱监督方案,值得细读。
龙哥读论文
发布于 2026-09-05 00:31:11
阅读 5
查看原文
原论文信息如下:
1. 弱监督RGB-D SOD的痛点与挑战
显著目标检测的目标是找到图片中最吸引人的区域或物体。当引入深度图辅助后,RGB-D SOD精度大幅提升,但背后也伴随着一个“甜蜜的负担”:这些模型需要海量逐像素标注的精细数据,人工成本和时间成本都很高,就像请个裁缝做一套顶级西装,效果是好,但贵得要命。
为了降低成本,大家转向弱监督方案,只用一些稀疏的标注,比如点、图像级标签或涂鸦。其中,涂鸦标注是最折中的方案——只需在目标上随意画几根线,就能提供基本的区分信息,标注者随便划拉一下就行。然而,涂鸦标注的获取虽然简单,但其稀疏性带来了一个根本性的问题:它只覆盖了物体极少部分的像素,丢失了物体的完整结构和精细边缘信息。用这种监督信息训练模型,效果一言难尽——生成的显著图往往边缘模糊、对象不完整,甚至出现全局混乱。具体来说,模型难以区分前景与背景的边界,容易将背景区域误判为显著目标,或者在多个显著目标之间产生混淆。这种性能瓶颈严重制约了弱监督RGB-D SOD在实际场景中的应用,尤其是在需要高精度分割的领域,如自动驾驶、医学影像分析和视频监控等。
针对这个问题,上海大学与南洋理工大学团队提出了一个全新方案,核心思路就是两条腿走路:先用SAM这把“大刀”把稀疏的涂鸦变成密集的像素级伪标注,再用一个基于状态空间交互的条件扩散模型来一步步精修显著图。两招结合,效果炸裂。该方案不仅解决了涂鸦标注信息不足的问题,还通过扩散模型的迭代去噪过程,进一步提升了显著图的细节质量和整体一致性。
SAM(Segment Anything Model)是Meta推出的视觉基础模型,经过海量数据预训练,具备零样本分割任意对象的能力。它接受点、框、文本等各种提示,精准产出分割结果。引入SAM做伪标注,能利用其强大的泛化能力,把模糊的涂鸦快速变成精细的分割结果。团队先通过实验验证了SAM对图像变换敏感,这为他们设计后续方案提供了关键基础。具体而言,他们发现当输入图像经过缩放、翻转或旋转等变换后,即使使用相同的提示点,SAM输出的分割掩码也会发生显著变化。这种敏感性虽然看似是缺点,但团队巧妙地将其转化为优势:通过在不同变换下获取互补的分割结果,再加以融合,可以显著提高伪标注的准确性和鲁棒性。
图2:不同图像变换(缩放、翻转、旋转)下SAM对不同样点提示输出的分割掩码及置信度。从图中可以清晰看到,同一提示点在不同变换下产生的掩码在细节上各有侧重,例如在缩放变换下,SAM可能更关注物体的整体轮廓,而在旋转变换下,则可能更精确地分割出物体的局部特征。这种互补性为后续的融合策略提供了基础。
2. SAM助力:如何从稀疏scribble生成密集伪标注?
团队设计了一个叫SAM-PAG的模块,全称SAM-driven Pseudo Annotation Generation,即SAM驱动的伪标注生成方法。它包含两个核心分支和一个融合策略,专门解决信息稀疏问题。这两个分支分别从不同角度利用SAM的能力,以获取尽可能完整和准确的伪标注。第一个分支通过图像变换来获取互补的分割结果,第二个分支则通过提示扩展来挖掘更多潜在的前景和背景区域。最终,通过一致性融合策略,将两个分支的成果整合为高质量的像素级伪标注。
输入数据是一张RGB图、一张深度图(编码为HHA图以增强结构化表达)和一个涂鸦标注。HHA编码将深度图转换为水平视差、高度和角度三个通道,能够更好地表达三维空间结构信息,有助于SAM理解物体的几何形状。SAM接受点和框两种提示,而最合适的就是从涂鸦上采点作为SAM的提示。但单点提示容易出偏差——一个点的位置、一个图像的变换,都会让SAM输出完全不同的分割结果。所以需要两条路互补。
图1:SAM驱动的伪标注生成方法示意图。该图清晰地展示了两个分支的并行处理流程以及最终的一致性融合步骤。左侧为图像变换分支,右侧为提示扩展分支,两者输出的伪掩码和IoU分数经过排序和加权融合,再通过CRF后处理得到最终伪标注。
SAM有“选择困难症”:给同一张涂鸦采的点,放大、翻转、旋转后,SAM可能得到完全不同但都部分正确的分割掩码。这个分支就针对图像缩放、翻转、旋转等变换,获取互补的分割结果。其核心思想是,通过多种变换,让SAM从不同视角观察同一物体,从而捕捉到物体在不同尺度、方向和镜像下的特征,这些特征在融合后能够相互补充,形成更完整的物体表征。
具体操作流程是这样的:从涂鸦标注中采样20个点作为提示prompt;对RGB-HHA对进行缩放、旋转、翻转等变换,共得到四组变换后的RGB-HHA对(原始、缩放、旋转、翻转);每组都输入SAM,得到RGB图和HHA图各自的分割掩码及置信度;然后对每组结果做逆变换恢复原尺寸,再把四组分割掩码和置信度加权融合,生成一组初始伪掩码。这里需要注意的是,缩放、旋转和翻转的变换参数是预先设定的,例如缩放比例设为0.8和1.2,旋转角度设为±15度,翻转则包括水平翻转和垂直翻转。这些参数的选择基于经验,旨在覆盖常见的几何变化。
这个分支重复采样5次(每次20个点,共5组不同的提示),得到5组初始伪掩码及对应的跨模态一致分(IoU分数)。重复采样的目的是为了减少单次采样带来的随机性,通过多次采样并取平均,可以使得提示点分布更加均匀,从而提高伪标注的稳定性。跨模态一致分的计算方式很简单:第l组提示下,把RGB掩码和HHA掩码都二值化,计算两者的交并比。这个分数反映了RGB和深度模态在分割结果上的一致性,分数越高,说明两个模态对该区域的判断越一致,该区域属于显著目标的可能性也越大。
公式(1):加权融合公式,其中cs是置信度,m是分割掩码。该公式通过置信度加权的方式,将RGB和HHA模态的分割结果进行融合,置信度高的模态在融合结果中占据更大比重。
公式(2):跨模态一致分(IoU),ε=10⁻⁶防止除零。该分数用于衡量RGB和HHA模态分割结果的重叠程度,是后续融合过程中筛选高质量伪掩码的重要依据。
涂鸦只占很少像素,只在涂鸦上采点,肯定漏掉大量前景和背景信息。这个分支就是通过超像素聚类对涂鸦进行合理扩散,找到更多潜在的区域来采点。超像素分割将图像分割成若干具有相似颜色、纹理和空间位置的像素块,这些块能够很好地保留物体的边缘信息。通过将涂鸦与超像素块关联,可以有效地将涂鸦的稀疏信息扩散到整个物体区域。
具体来说:先用SLIC超像素分割算法把RGB图和HHA图各分成70个超像素(每个超像素就是颜色和空间相似的像素块);找出与涂鸦前景有交集的超像素作为前景候选区域,与涂鸦背景有交集的作为背景候选区域;做冲突优化:如果一个像素在前景和背景候选区域中同时出现,它就被视为冲突并丢弃;再做共存优化:只有RGB和HHA图都认为属于前景的像素才被保留,获得最终的扩展区域mE。冲突优化和共存优化是保证扩展区域准确性的关键步骤。冲突优化避免了像素同时属于前景和背景的矛盾情况,而共存优化则利用了RGB和深度模态的互补信息,只有当两个模态都确认该像素属于前景时,才将其纳入扩展区域,从而有效降低了误检率。
图3:提示扩展方法示意图。图中展示了从涂鸦标注出发,通过超像素分割、候选区域提取、冲突优化和共存优化,最终得到扩展区域mE的完整流程。扩展区域mE显著扩大了提示点的覆盖范围,使得SAM能够获取更全面的物体信息。
在这个分支中,从扩展区域mE和原涂鸦各取10个点(共20个点)作为提示,直接输入SAM处理原始RGB-HHA对。同样采样5次,得到5组伪掩码和Iou分数。与图像变换分支不同,提示扩展分支直接对原始图像进行处理,避免了变换带来的信息损失,其优势在于能够更准确地捕捉物体的原始形状和细节。
一致性融合 两个分支一共生成10组初始伪掩码及对应的Iou分数。对所有Iou分数降序排列,只选前4组最高分掩码,进行加权融合。选择前4组最高分掩码进行融合,可以有效地剔除低质量的伪掩码,保留最可靠的分割结果。这种策略类似于集成学习中的“选择性地集成”,能够显著提高最终伪标注的质量。
公式(3):一致性融合公式,CRF是后处理过程。该公式首先对选出的前4组掩码进行加权平均,权重为对应的IoU分数,然后通过密集CRF进行后处理,以进一步细化边缘和去除噪声。
最后,用密集CRF做微调,就获得了最终的高质量像素级伪标注,它不再是涂鸦级别的稀疏数据,而是与人工精细标注几乎一样完整和准确。密集CRF是一种经典的后处理技术,它通过考虑像素之间的颜色和空间关系,能够有效地平滑分割结果,同时保留锐利的边缘,使得伪标注在视觉上更加接近真实标注。
图4:伪标注可视化结果,与像素级真值高度一致。从图中可以看出,生成的伪标注在物体轮廓、细节纹理以及整体完整性方面都与人工标注的真值非常接近,证明了SAM-PAG模块的有效性。
3. S2Diff:基于状态空间交互的条件扩散模型
有了像素级伪标注M和涂鸦标注y,接下来就差一个能精准去噪的“画家”了。团队的答案是S2Diff(State space interaction-based conditional Diffusion model),一个基于状态空间交互的条件扩散模型。扩散模型的核心思想是通过一个参数化的马尔可夫链,逐步将随机噪声转化为目标数据。在S2Diff中,这个目标数据就是高质量的显著图。条件信息(如RGB图、深度图和伪标注)被用来引导这个去噪过程,确保最终生成的显著图与输入图像的内容一致。
扩散模型的核心机制是:在训练时给GT显著图逐步加高斯噪声直到纯噪声(前向扩散),推理时从随机噪声开始,在条件信息的引导下逐步去噪,还原出准确显著图。S2Diff的独特贡献有两点:一是全局条件特征的生成,二是条件信息逐级注入去噪网络。全局条件特征由条件特征生成网络从RGB和深度图中提取,它包含了丰富的多尺度语义信息。而条件信息的逐级注入则通过上下文注入模块(CIM)实现,确保在去噪的每一步,模型都能充分利用这些条件信息来指导噪声的去除。
S2Diff的整体架构分为两部分:条件特征生成网络与去噪网络。条件特征生成网络负责从RGB和深度图中提取多尺度的跨模态条件特征,而去噪网络则负责在这些条件特征的引导下,从随机噪声中逐步恢复出显著图。这两个部分通过上下文注入模块(CIM)紧密连接,形成一个端到端的可训练系统。
图5:S2Diff整体架构图。该图清晰地展示了条件特征生成网络(CCGM)和去噪网络(U-Net)之间的协作关系。CCGM提取的多尺度条件特征通过CIM模块注入到U-Net的每一层,引导去噪过程。
条件特征生成网络的编码器使用PVT(Pyramid Vision Transformer)分别提取RGB图和深度图的多尺度特征。PVT是一种金字塔结构的视觉Transformer,它能够在不同尺度上提取特征,同时保持全局感受野,非常适合捕捉显著目标的多尺度信息。团队设计了CCGM(Cross-modal Conditional Generation Module,跨模态条件生成模块),在每层将RGB特征和深度特征融合成交叉模态条件特征。CCGM模块是S2Diff的核心创新点之一,它通过隐式和显式的状态空间交互,实现了RGB和深度模态的高效融合。
CCGM的创新在于引入了Mamba中的状态空间模型(SSM)来平衡全局建模能力和计算效率。传统的Transformer虽然具有强大的全局建模能力,但其计算复杂度与序列长度的平方成正比,在处理高分辨率特征图时计算开销巨大。而Mamba通过参数化的状态空间模型,实现了线性复杂度的全局建模,为高效处理视觉特征提供了新的思路。
Mamba是一种序列建模方法,通过参数化状态空间模型实现选择性信息处理和接近线性的计算复杂度,特别适合处理长距离依赖。SSM (State Space Model,状态空间模型)是Mamba的核心,当前数据通过线性、时变的状态方程进行建模和预测,做到全局感知却不需要Transformer的二次复杂度。具体来说,SSM通过一个隐藏状态h(t)来捕捉序列的历史信息,并通过输入矩阵B、输出矩阵C和状态转移矩阵A来控制信息的流动。Mamba的关键创新在于,这些矩阵是输入相关的,使得模型能够根据输入内容动态地选择要保留或遗忘的信息,从而实现了“选择性”信息处理。
图6:CCGM模块结构图。该图详细展示了CCGM的内部结构,包括频域交换、intra-SSM和inter-SSM三个关键步骤。频域交换用于模态间的特征对齐,intra-SSM用于模态内的全局建模,inter-SSM则用于模态间的信息融合。
隐式状态空间交互 分为两步:
1. 频域交换:RGB特征包含丰富的表观细节(高频多),深度特征包含更多的空间结构(低频多)。先将RGB和深度特征做快速傅里叶变换FFT,交换它们的幅值和相位,再通过逆FFT合成新的特征。这个过程能让模态间的特征对齐,互学对方的频率特性。具体来说,RGB特征的幅值包含了颜色和纹理信息,而深度特征的相位则包含了物体的空间结构信息。通过交换这些信息,RGB特征可以学习到深度特征中的结构信息,从而更好地理解物体的三维形状;而深度特征则可以学习到RGB特征中的细节信息,从而获得更丰富的表观特征。这种频域交互方式是一种轻量级且有效的跨模态对齐策略。
2. intra-SSM:在频域交换得到的两个特征上分别执行Mamba块内的SSM处理,通过四个方向遍历+选择性SSM实现每个特征内部的全局建模。这个操作保持线性计算复杂度。四个方向遍历是指将二维特征图展开为一维序列时,按照从上到下、从下到上、从左到右、从右到左四个方向进行,这样能够捕捉到特征图中各个方向上的长距离依赖关系。选择性SSM则根据输入内容动态调整状态转移,使得模型能够聚焦于重要的特征区域,忽略无关的噪声信息。
显式状态空间交互 即inter-SSM模块。经过intra-SSM处理后,两个特征仍然各自为政。inter-SSM让它们互相注入状态参数:左右两个对称分支,处理的是对方特征。比如左侧分支的离散化矩阵使用了右侧特征的状态矩阵B,输出时结合两侧的C矩阵。通过参数的互相控制,实现双向信息融合,最终合成全局条件特征。这种显式的交互方式使得两个模态的特征能够深度耦合,共同表达显著目标的特征。inter-SSM模块的设计灵感来源于双向LSTM,但通过状态空间模型实现了更高效的参数共享和信息流动。
CIM模块 在去噪网络中发挥着关键作用。除了标准的四层编码器-解码器结构,团队在每层增加了CIM(Context Injection Module,上下文注入模块)。CIM接收两个输入:来自编码器的噪声特征和来自条件特征生成网络的条件特征。它通过将噪声掩膜的通道信息作为调制信号,引导条件上下文对噪声重构的干预——简单说就是在去噪过程中,让条件信息不断提示哪里是目标哪里是背景,逐渐消除噪声影响。具体来说,CIM首先对噪声特征进行全局平均池化,得到一个通道描述符,然后通过一个简单的全连接层生成调制权重,最后用这个权重对条件特征进行缩放和偏移,使得条件特征能够根据当前噪声状态进行自适应调整。这种机制确保了条件信息能够被有效地利用,而不是简单地与噪声特征拼接。
图7:CIM模块结构图。该图展示了CIM如何利用噪声特征的通道信息来调制条件特征,从而实现条件信息对去噪过程的精准引导。
4. 实验验证:逼近全监督性能,弱监督方法全面领先
先来看看定量结果。从表I可以看出,本方法在SIP、NLPR、STERE三个基准集上全面超越了现有弱监督方法,且在部分指标上逼近甚至超过了同期的全监督模型。比如在SIP数据集上,本方法的max F-measure和S-measure甚至超过了2025年最新的全监督方法DCF。这说明基于SAM生成的密集伪标注搭配扩散模型,确实能补偿监督信息不足的问题。SIP数据集以室外场景为主,包含大量复杂背景和光照变化,本方法在此数据集上的优异表现证明了其强大的泛化能力。
表I:与现有弱监督、全监督方法在多个基准数据集上的定量比较。从表中可以清晰地看到,本方法(Ours)在所有弱监督方法中均取得了最佳性能,并且在多个指标上超越了部分全监督方法,如DCF和BBS-Net。
在SIP数据集的定比比较中,本方法以86.2%的max F-measure和88.9%的S-measure领先第二名弱监督方法近10个百分点。NLPR数据集上,本方法的E-measure达到92.9%,显著高于其他弱监督方法。这表明CCGM中的跨模态条件特征提取和CIM中的条件信息注入机制在去噪过程中发挥了关键作用,有效抑制了因标注稀疏造成的模糊预测。E-measure是评估显著图与真值之间结构相似性的指标,本方法在此指标上的领先,说明其生成的显著图在边缘和细节上更加准确。
从消融实验(表II)来看,基线模型(仅用涂鸦监督+普通扩散)效果最差。加入SAM-PAG生成的密集伪标注后,max F-measure和MAE大幅提升。进一步添加CCGM和CIM后,各项指标稳步增长。这表明本方法中的每一个模块都能独立贡献且协同增强。消融实验的结果清晰地展示了每个组件的贡献度,证明了SAM-PAG、CCGM和CIM都是不可或缺的。
表II:各模块的消融实验。从表中可以看出,从基线模型开始,逐步添加SAM-PAG、CCGM和CIM,各项指标均持续提升,验证了每个模块的有效性。
低对比度、小目标和多目标场景的定性对比(如图8)验证了本方法在各种复杂条件下的稳健性。即使深度图质量不高,本方法也能保持相对完整的目标预测,这是因为CCGM在频域做了模态对齐,利用低频结构补偿了深度退化。例如,在低对比度场景中,RGB图像中目标与背景的区分度很低,但深度图能够提供额外的几何信息,帮助模型定位目标。本方法通过CCGM有效地融合了这两种信息,从而在挑战性场景下依然能够生成高质量的显著图。
图8:与现有方法在多个挑战场景下的可视化对比。从图中可以看出,本方法在低对比度、小目标和多目标等复杂场景下,生成的显著图在完整性和边缘清晰度方面均优于其他方法。
定量比较 以下表格展示了在七个公开基准上的完整定量结果:
表I:在7个基准数据集的定量结果。本方法在SIP、NLPR、STERE、RGBD-SOD、LFSD、SSD和NJUD这七个数据集上均取得了最优或次优的弱监督性能,证明了其广泛的适用性。
消融实验
表II:消融实验结果。消融实验进一步验证了SAM-PAG、CCGM和CIM三个核心模块的贡献,其中SAM-PAG对性能提升的贡献最大,证明了高质量伪标注的重要性。
可视化对比
图8:可视化对比。可视化结果直观地展示了本方法在处理各种挑战性场景时的优势,尤其是在边缘细节和整体完整性方面。
5. 总结与展望
一句话总结这篇论文的核心价值:通过SAM将涂鸦标注批量转换为高质量像素级伪标注,再借助基于Mamba的条件扩散模型进行迭代精修,最终在7个数据集上以弱监督胜过了许多全监督方法。这项工作不仅为弱监督RGB-D SOD提供了一个强大的基线,更重要的是,它展示了基础模型(SAM)和生成模型(扩散模型)在解决低标注成本高精度任务中的巨大潜力。
未来方向包括:将这套范式推广到视频显著目标检测或多模态跟踪;利用更为强大的基础模型扩展伪标注的种类和质量;以及进一步降低扩散模型的多步推理成本,以便在实时场景落地。此外,探索如何将本方法应用于更广泛的弱监督任务,如语义分割、实例分割和医学图像分割,也是一个非常有前景的研究方向。
龙迷三问
问题1:SAM-PAG生成的伪标注准确率到底怎样?会不会引入大量噪声? 从论文中的数据来看,生成的伪标注与像素级真值的mIoU在测试集上达到了89%以上。双分支结构和一致性融合保证了大部分预测都是正确的。当然,个别困难样本(如高度透明物体、复杂遮挡)仍可能存在误差,但整体足以替代人工标注。此外,论文还通过实验证明,使用SAM-PAG生成的伪标注训练的模型,其性能与使用真实标注训练的模型非常接近,进一步验证了伪标注的高质量。
问题2:扩散模型在推理时多步迭代,速度会不会很慢? 是的,扩散模型需要50-100步迭代去噪,单张图的推理时间在秒级,不适合实时场景。但考虑到这是弱监督SOD第一次引入扩散模型,且性能提升非常明显,在非实时应用(如医学图像分析、自动驾驶离线标注)中完全可行。未来可通过蒸馏或REFlow技术大幅加速。例如,通过知识蒸馏,可以将一个大型扩散模型的知识迁移到一个轻量级的网络,从而显著降低推理时间。
问题3:这个方法只适用于RGB-D显著检测吗?能否迁移到其他任务? 从方法论上看,SAM-PAG+扩散模型的范式和任务无关,可以迁移到其他需要密集标注的弱监督任务,比如RGB-T热红外显著检测、RGB-F深度-光流等多模态融合任务。但需要针对新的模态特点调整CCGM中的频域交互策略。例如,对于热红外图像,其频率特性与RGB图像不同,可能需要设计新的频域交换策略。此外,对于其他任务,如语义分割,可能需要调整伪标注生成策略,以适应不同的标签空间。
如果你还有哪些想要了解的,欢迎在评论区留言或者讨论~
龙哥点评
论文创新性分数: ★★★★✰
第一个将SAM+扩散模型引入弱监督RGB-D SOD的工作,CCGM中的频域交换和inter-SSM的跨模态交互设计较新颖。
实验合理度: ★★★★✰
7个公开数据集、全监督和弱监督全方位对比、密集的消融实验,对比方法较新。但未在真实标注噪声场景下测试,略为遗憾。
学术研究价值: ★★★★★
展现了基础模型(SAM)和生成模型(扩散)在弱监督感知任务中的巨大潜力,为低标注成本高精度任务提供了新范式,启发价值很高。
稳定性: ★★★✰✰
对高质量深度图和简单场景表现稳定,但在深度退化和极端光照下有一定波动。扩散模型多步推理存在随机性。
适应性以及泛化能力: ★★★★✰
在室内NLPR、室外SIP、弱光STERE等多场景下均表现良好,展示了较强的泛化能力。但需HHA编码处理原始深度图,增加了预处理步骤。
硬件需求及成本: ★★✰✰✰
使用大型基础模型SAM和PVT编码器,加上扩散模型的多步推理,GPU显存和计算时间较高。训练在A100上约需2天,推理每张图需约1.5秒。
复现难度: ★★★★✰
代码已开源,超参数和模型权重公布完整。CCGM中的多步SSM实现较为复杂,新手可能需花费一定时间。
产品化成熟度: ★★✰✰✰
推理速度慢、依赖SAM的云端调用(现阶段)限制了端侧产品落地。适合离线标注工具链或医疗等对延迟不敏感的场景。
可能的问题: 论文未在“只有噪声伪标注”的场景下做鲁棒性测试,实际应用中可能因伪标注中的小错误在扩散过程中被放大。推理速度是最大痛点,影响了部署灵活性。
主要参考文献
[15] A. Kirillov, E. Mintun, N. Ravi, et al., "Segment anything," In: Proceedings of the IEEE/CVF International Conference on Computer Vision (ICCV), 2023. (SAM原文)
[27] J. Ho, A. Jain, and P. Abbeel, "Denoising diffusion probabilistic models," In: Advances in Neural Information Processing Systems (NeurIPS), 2020. (DDPM原文)
[38] A. Gu and T. Dao, "Mamba: Linear-time sequence modeling with selective state spaces," arXiv:2312.00752, 2023. (Mamba原文)
*本文仅代表个人理解及观点,不构成任何论文审核或者项目落地推荐意见,具体以相关组织评审结果为准。欢迎就论文内容交流探讨,理性发言哦~ 想了解更多原文细节的小伙伴,可以点击 "阅读原文", 查看更多原论文细节哦!
想让你的模型也学会从涂鸦中“脑补”出完整物体?加入龙哥读论文粉丝群,和更多CV小伙伴一起探讨弱监督、SAM、扩散模型的最新玩法!
扫描下方二维码或者添加龙哥助手微信号加群 :kangjinlonghelper。
一定要备注:研究方向+地点+学校/公司+昵称(如 图像处理+上海+清华+龙哥) ,根据格式备注,可更快被通过且邀请进群。
『龙哥读论文』微信群目前包含:图像处理、大模型及智能体、自动驾驶及机器人、AI医疗及AI金融5个群