ECCV 2026南开新作:像素看不清?超像素来救!7M参数横扫雨雪雾
恶劣天气下的图像恢复,难点从来不在“去除”而在“组织”——雨雪雾在空间上分布极不均匀,而现有状态空间模型(SSM)却用固定轨迹逐个像素扫描,总把语义冲突区域硬凑成一段。南开大学等机构提出SSR,把扫描粒度从像素提升到超像素,让状态沿着语义边界“顺流而下”,再配合区域级门控做通道校准,参数量仅7.05M,却在六个基准上刷新了SOTA。思路干净,性价比极高,值得
LONGGE AI RESEARCH DAILY
每天筛选值得关注的 AI 论文,用工程视角拆解方法、实验和真正的落地价值。
目前已发表 1573 篇文章
恶劣天气下的图像恢复,难点从来不在“去除”而在“组织”——雨雪雾在空间上分布极不均匀,而现有状态空间模型(SSM)却用固定轨迹逐个像素扫描,总把语义冲突区域硬凑成一段。南开大学等机构提出SSR,把扫描粒度从像素提升到超像素,让状态沿着语义边界“顺流而下”,再配合区域级门控做通道校准,参数量仅7.05M,却在六个基准上刷新了SOTA。思路干净,性价比极高,值得
Yann LeCun参与的最新视频预训练工作,把JEPA家族的防坍塌机制全砍了,只用单一编码器加SIGReg正则,预训练算力直接降到原来的二十分之一,甚至95%的token随机丢掉反而精度更高。视频预训练终于不再是算力大户的专属游戏,这篇值得所有做视觉自监督的读者细读。
这篇工作把扩散模型去模糊从“一键生成”变成了“手动调档”,引入了类似音量旋钮的模糊度量(BM),让用户自己决定要锐化多少、生成多少细节。还实打实对比了ControlNet适配和全量微调两条路线,结论清晰,落地感强,值得做图像恢复和摄影后处理的朋友读一读。
太空机器人一旦硬件故障,传统强化学习就抓瞎——因为真空中根本算不出奖励信号。卢森堡大学这篇工作把世界模型玩出了新高度:预训练阶段把奖励函数"记住"在隐空间里,部署后冻结奖励预测器、只更新转移动力学,60分钟无监督数据就能让机器人自我修复。三大任务、代码开源、效果诚实不吹牛,值得一读。
GAN快但不够稳,扩散稳但太磨叽,这俩能不能别打架、搭个伙?本文给出了一个简单又实用的答案:把冻结的WGAN-GP中间特征当“导师”,用交叉注意力喂给扩散U-Net,在CelebA人脸去噪上直接涨了4.40dB。方法不复杂,但对混合范式感兴趣的读者值得一读。
现在的数字人头像,脸可以以假乱真,头发却像顶了个头盔——怎么晃都是死的。马普所等机构提出PhysHead,把头发拆成一根根发丝并接入物理引擎,让头像在点头、转头甚至刮风时,头发真的会飘。顺便还借大模型把“秃头版”训练数据造了出来,细节拉满。
先花十秒钟想一个场景:一台扫地机器人走进一个从来没去过的房间,它需要知道哪里有桌子、哪里有椅子、哪个是垃圾桶,最好还能知道每件东西具体占了多大面积——注意,是像素级的轮廓,不是一个框就算完。
3D高斯泼溅遇上开放词汇理解,过去大家往点云里硬塞特征,结果存储爆表、边界糊成一片。北大这篇CVPR 2026新作反其道而行,把几何和语义彻底解耦,用VLM生成文本假设做外置索引,直接让特征存储从GB级砍到MB级。思路清奇,落地极香,值得一读!
法医病理误判的潜在风险,被一次脑洞大开的「图像翻译」给盯上了。本论文首次把薛定谔桥搬进死后自溶恢复,不搞像素级配对,直接学分布映射,还建了首个真实数据集AutoPath。更狠的是,它证明FID这类老牌指标在诊断场景里可能「帮倒忙」——专家盲评和滑片级诊断一致性,才是硬通货。
换根连杆、改个质量,世界模型就“失忆”?清华这项研究把机器人形态参数和可复用动力学分开建模,让世界模型在没见过的新参数下也能零样本预测和规划。想搞机器人泛化的,这篇值得一读。
单张照片就能告诉机器人“杯子把手在哪、椅子坐哪里”?同济大学与中科院最新开源AfordAny,把开放世界3D功能定位做成了端到端流水线,473类基准直接拉满。
跑姿分析一直被认为是专业实验室的专利,动辄几十万的设备劝退了大多数人。这篇论文用五个成熟姿态估计模型+后处理,把髋膝关节角度估测误差压到5.3°,还配套了网页演示平台,属于典型的低成本高性价比工作,做运动科学和姿态估计的朋友值得一读。
LONGGE AI COMMUNITY
加入「龙哥读论文」知识星球,持续获取 AI 论文、资讯、开源项目、招聘与研究思路。
加入龙哥读论文微信群:添加微信 kangjinlonghelper,备注“研究方向 + 地点 + 学校/公司 + 昵称”。
微信扫码加入知识星球