单目预训练+3D蒸馏,GeoLaV冲上SOTA
这篇论文最有意思的地方,不是又堆了一个更大的视频模型,而是反其道而行之:先拿单张图做几何预训练,再把3D教师的结构先验蒸馏进去。结果很直接——图像数据也能学出视频所需的空间一致性,最后还在多个基准上冲到SOTA。
LONGGE AI RESEARCH DAILY
每天筛选值得关注的 AI 论文,用工程视角拆解方法、实验和真正的落地价值。
目前已发表 1573 篇文章
这篇论文最有意思的地方,不是又堆了一个更大的视频模型,而是反其道而行之:先拿单张图做几何预训练,再把3D教师的结构先验蒸馏进去。结果很直接——图像数据也能学出视频所需的空间一致性,最后还在多个基准上冲到SOTA。
这篇论文把“先找框、再抠图”做得特别顺手:Faster R-CNN 负责定位,Mask 分支负责像素级分割,RoIAlign 负责把坐标对齐。看起来只是加了个小分支,结果却把实例分割这门活干得又快又稳。
这篇工作最有意思的地方,不是单纯“多标了点血管”,而是把动态4D-CTA变成了半自动标注流水线。更妙的是,它明确告诉模型:没标出来的血管,别急着当背景埋了。
视频里常常不止一个事件,硬把它们当成“一锅粥”来分割,模型就容易看花眼。EVIS干脆先把视频拆成简单事件,再一段一段对齐文本,思路挺顺手。
这篇文章把扩散模型、双路径编码和跨层特征融合揉到一起,专门对付皮肤病灶那种“边界糊成一锅粥”的老难题。实验结果也挺硬,三个公开数据集上平均Jaccard和Dice都很能打,值得看看它到底怎么把病灶边缘抠细。
SAM2Matting把“跟踪”和“抠图”这对老搭档拆开干活,思路很干净。更离谱的是,它只用图像训练,却能在视频抠图上打出零样本SOTA,属于那种看完会想拍桌子的设计。
少样本增量学习(FSCIL)一直是个“鱼和熊掌”都想兼得的难题,既要记住旧知识,又要快速学会新类别。CVPR 2026的这篇QR-Prompt,把VLM的残差特征做成“小纸条”,既稳定又灵活,在三个基准数据集上都刷了新SOTA。对于搞小样本、增量学习的朋友,这篇是必读品了。
U-Net家族新成员驾到!还在为U-Net只能做加法特征变换而苦恼?德国应用科技大学团队祭出PU-UNet,让U-Net学会乘法交互。参数、FLOPs几乎不变,但Dice分数狂飙,正常病例假阳性率直接干到零。不烧钱,不折腾,是时候考虑给网络加个“乘法器”了。
在2026年6月推送过ETH利用AI预测小麦3D体积的方法后,这次犹他州立大学团队直接放了个大招:一个专门为观赏藤蔓植物打造的、高精度实例分割数据集Vines-DB。这就像给AI配了一本植物图谱,让机器学会精准识别和量化每一片藤蔓的覆盖面积。别小看这个数据集,它可是从168株藤蔓里,带着人工标注的边界框和分割掩码,一点一点抠出来的。想搞精准园艺?没这个数据集
说“飞机”和“飞行器”时,CLIP模型的“眼睛”居然会看错地方?那自动驾驶可不敢用!CVPR 2026的这篇SynCLIP,狠狠揪出这个同义词“注意力分裂”的bug,用语义连贯预训练一招治愈,密集感知鲁棒性直接拉满!
LONGGE AI COMMUNITY
加入「龙哥读论文」知识星球,持续获取 AI 论文、资讯、开源项目、招聘与研究思路。
加入龙哥读论文微信群:添加微信 kangjinlonghelper,备注“研究方向 + 地点 + 学校/公司 + 昵称”。
微信扫码加入知识星球