IEEE BigData 2025:CEMD跨域迁移,让胆囊分割暴涨27%还能提速3倍
在医学影像分割的同类探索里,这篇把手伸向了更硬核的跨手术域迁移:胆囊手术学到的东西,能不能直接帮直肠手术做分割?CEMD架构给出的答案是——不仅能用,胆囊类分割还暴涨27%,收敛还快3倍,值得一读。
LONGGE AI RESEARCH DAILY
每天筛选值得关注的 AI 论文,用工程视角拆解方法、实验和真正的落地价值。
目前已发表 1573 篇文章
在医学影像分割的同类探索里,这篇把手伸向了更硬核的跨手术域迁移:胆囊手术学到的东西,能不能直接帮直肠手术做分割?CEMD架构给出的答案是——不仅能用,胆囊类分割还暴涨27%,收敛还快3倍,值得一读。
农田分割遇到难题,让模型再强十倍也可能白搭——关键证据压根不在当前图像里。中南大学这篇FarmSeeker,把分割从“图内思考”拉到“图外思考”,按需查时空影像,把模糊地块查得明明白白。跨11国测试,比一堆老牌方法都稳,值得一看。
高光谱分类就像拿着“放大镜”找茬:CNN只看得到眼前一亩三分地,Transformer倒是看得远,但算力账单吓人。青岛理工团队把多尺度CNN和Mamba塞进一个框架,0.2M参数直接干到94.35%精度,这波混搭真有东西。
弱监督显著检测一直面临标注稀疏的困境,上海大学团队直接请出SAM把涂鸦变成高质量像素级伪标注,再搭配Mamba+扩散模型做精修。7个数据集上碾压所有弱监督方法,甚至干翻了不少全监督方法。这是一套有工程潜力的弱监督方案,值得细读。
还在为医疗分割数据的像素级标注头疼?西北大学这篇工作告诉你,医生看片子时的眼动轨迹就能当弱监督信号,而且效果居然超越了最专业的涂鸦、边界框等“传统”弱监督!更关键的是,它首次用Mamba这种高效架构建模了轨迹的时序信息,而不是把它当作一堆散点的静态图。看完你会感叹:原来最宝贵的监督信号,就藏在医生最自然的阅片习惯里。
PolSAR分类一直受困于边缘模糊和各向异性散射建模。现有Mamba方法要么只做空间域,要么固定扫描方向。本文提出DA-Mamba,巧妙结合NSCT多方向分解和方向自适应扫描,在四个数据集上全面超越SOTA。方向感知扫描+双域融合的设计,既保留全局语义又捕捉精细边缘,思路干净实用,值得关注。
视频实例分割通常需要昂贵的视频标注和复杂的时序建模,但QueenVIS仅用单帧图像训练就拿到了接近SOTA的结果。它通过两个轻量辅助头把外观和空间先验注入Transformer查询,推理时零参数开销,在长视频上提升10.3 AP,简直是为标注稀缺场景量身打造。方法干净、实用,值得工程团队关注。
视频实例分割的“天价标注”让人头疼,QueenVIS却告诉你:只用单帧图像训练,效果堪比视频监督!它通过两个超级简单的辅助头(特征预测+中心预测)把外观和空间先验注入查询向量,推理时零开销、零参数增加。在YouTube-VIS长视频上直接飙了10.3 AP,比很多视频监督模型还稳。代码已开源,值得一试!
食物分割里,豆腐和芝士经常被搞混?国立成功大学这篇工作用一个巧妙的思路——让大语言模型(GPT-o4 mini)根据图像猜出食材名称,再把食材标签嵌入视觉特征或解码器查询中,实现精准分割。两个模块完全即插即用,在FoodSeg103上刷新SOTA达到55.0 mIoU,且仅增加3.8GB显存开销。不用搞什么对齐训练,拿来就能涨点,实用派狂喜!
医学图像分割的像素级标注成本高得离谱,边界框标注是更经济的替代,但框形偏置总会让预测结果“方方正正”。深圳大学在CVPR 2026提出的WeakMed,用一招Mask-to-Box变换和尺度一致性损失,巧妙地把框形偏置化解于无形,在9个数据集上全面超越现有弱监督方法,甚至逼近全监督。这对于想低成本部署医学分割的团队来说,简直是及时雨。
单像素传感的压缩测量跳过图像重建直接做分割,一直有个老大难:如何优雅地把一维测量“提升”成二维特征?本文给出了系统性的答案——不仅搞清楚了不同提升方式的优劣谱系,还设计了内容自适应注意力+动态任务调度,在极低采样率和有噪声条件下都能保持高精度分割,尤其展现了无图像推理在噪声下的天然鲁棒性,相当有意思。
继2026年5月推送的NeoVerse之后,斯坦福又带来一款暴力物理世界模型PhyWM。它没有标注,没有动作标签,仅靠自回归预测光流和RGB,就能零样本完成物体分割、3D操纵甚至Visual Jenga。对机器人、具身智能来说,这是一条通往物理智能的捷径。
LONGGE AI COMMUNITY
加入「龙哥读论文」知识星球,持续获取 AI 论文、资讯、开源项目、招聘与研究思路。
加入龙哥读论文微信群:添加微信 kangjinlonghelper,备注“研究方向 + 地点 + 学校/公司 + 昵称”。
微信扫码加入知识星球