ECCV 2026南开新作:像素看不清?超像素来救!7M参数横扫雨雪雾
恶劣天气下的图像恢复,难点从来不在“去除”而在“组织”——雨雪雾在空间上分布极不均匀,而现有状态空间模型(SSM)却用固定轨迹逐个像素扫描,总把语义冲突区域硬凑成一段。南开大学等机构提出SSR,把扫描粒度从像素提升到超像素,让状态沿着语义边界“顺流而下”,再配合区域级门控做通道校准,参数量仅7.05M,却在六个基准上刷新了SOTA。思路干净,性价比极高,值得
LONGGE AI RESEARCH DAILY
每天筛选值得关注的 AI 论文,用工程视角拆解方法、实验和真正的落地价值。
目前已发表 1573 篇文章
恶劣天气下的图像恢复,难点从来不在“去除”而在“组织”——雨雪雾在空间上分布极不均匀,而现有状态空间模型(SSM)却用固定轨迹逐个像素扫描,总把语义冲突区域硬凑成一段。南开大学等机构提出SSR,把扫描粒度从像素提升到超像素,让状态沿着语义边界“顺流而下”,再配合区域级门控做通道校准,参数量仅7.05M,却在六个基准上刷新了SOTA。思路干净,性价比极高,值得
这篇工作把扩散模型去模糊从“一键生成”变成了“手动调档”,引入了类似音量旋钮的模糊度量(BM),让用户自己决定要锐化多少、生成多少细节。还实打实对比了ControlNet适配和全量微调两条路线,结论清晰,落地感强,值得做图像恢复和摄影后处理的朋友读一读。
GAN快但不够稳,扩散稳但太磨叽,这俩能不能别打架、搭个伙?本文给出了一个简单又实用的答案:把冻结的WGAN-GP中间特征当“导师”,用交叉注意力喂给扩散U-Net,在CelebA人脸去噪上直接涨了4.40dB。方法不复杂,但对混合范式感兴趣的读者值得一读。
法医病理误判的潜在风险,被一次脑洞大开的「图像翻译」给盯上了。本论文首次把薛定谔桥搬进死后自溶恢复,不搞像素级配对,直接学分布映射,还建了首个真实数据集AutoPath。更狠的是,它证明FID这类老牌指标在诊断场景里可能「帮倒忙」——专家盲评和滑片级诊断一致性,才是硬通货。
图像取证是典型“平时用不上、出事就救命”的技术。这篇论文不依赖训练数据、不查设备指纹库,仅凭单张可疑图像就能定位篡改区域,RTD数据集上AUC达0.839、IoU 0.725,多项指标领先同类方法。做内容安全、多媒体取证的朋友值得一读。
扩散模型做MRI重建效果好,但动辄几百上千步的迭代采样让临床落地遥遥无期。明尼苏达大学这篇CM-RED,把一致性模型塞进RED优化框架,4步出图,PSNR/SSIM全面超越1000步的DPS和100步的DDS,计算量直降25—250倍。生成式MRI重建的“速度焦虑”,这次是真的被治好了。
论文由Sichen Pan和Simon Scheuring完成(通讯作者为Simon Scheuring),发表在Nature Communications上,提出了名为SPIDER(Scanning Probe Mic。
学习型图像压缩(LIC)性能虽猛,却怕对抗攻击——像素上加点人眼看不见的噪声,码率直接爆炸、画质稀碎。这篇澳门大学与南洋理工的最新研究发现了个反直觉的规律:攻破LIC要几百步,修复却只要1步!基于此提出的FTTR框架,在白盒攻击下把PSNR拉高近15dB,码率暴降6+。值得一读。
水下照片总是蓝绿蒙蒙一片?印度理工学院这次把海洋光学的"家底"全搬进了合成数据——十种Jerlov水体、深度依赖辐照度、生物荧光一次建模到位。合成数据FID比最强竞品直降46%,四个增强架构跨六个真实数据集全面反超。搞水下视觉的朋友,这份物理知识+数据工程的双拼值得仔细品品。
当只有两张随手拍的模糊照片、还没有相机位姿时,3D重建还能做吗?本论文不仅做了,还用级联的2D→3D引导把Deblur-NeRF真实场景PSNR提升了1.19dB、合成场景提升了2.11dB。这种极简输入设定对XR、手持设备3D内容生成非常有吸引力。
低光增强里"提亮容易、校色难"的老大难问题,这篇论文算是啃到点子上了。福州大学提出的CAGE框架,用可解释的颜色空间变换方案做色彩校正,还能像插件一样直接塞进现有模型里,成本低到可以忽略。在低光图像处理这个长期刚需的赛道上,这活儿干得漂亮。
同样是扩散模型,凭什么HNDif去雾更猛?因为它不玩"纯噪声瞎猜",而是把大气散射模型直接写进扩散过程:雾浓处多注噪声、雾淡处少注噪声,反向再联合去雾去噪。四个主流去雾骨干、六个基准数据集,平均PSNR提升0.57dB。想给自家去雾模型"插管提速"?这篇值得细读。
LONGGE AI COMMUNITY
加入「龙哥读论文」知识星球,持续获取 AI 论文、资讯、开源项目、招聘与研究思路。
加入龙哥读论文微信群:添加微信 kangjinlonghelper,备注“研究方向 + 地点 + 学校/公司 + 昵称”。
微信扫码加入知识星球