身份相似度0.988!四校联手端出免训练人脸修复新范式
手机里存了三年的糊脸照片,AI一顿猛修,结果亲妈都不认得了?扩散模型人脸修复最怕"五官漂移",南邮等四校带来WaveFreqAnchor:零训练、零微调,只用波结构锚定+频率校正,把身份相似度一路抬到0.988,修完还像本人!
LONGGE AI RESEARCH DAILY
每天筛选值得关注的 AI 论文,用工程视角拆解方法、实验和真正的落地价值。
目前已发表 1573 篇文章
手机里存了三年的糊脸照片,AI一顿猛修,结果亲妈都不认得了?扩散模型人脸修复最怕"五官漂移",南邮等四校带来WaveFreqAnchor:零训练、零微调,只用波结构锚定+频率校正,把身份相似度一路抬到0.988,修完还像本人!
让大模型当"色偏裁判"?新国立这篇CVPR 2026论文把跨相机白平衡玩出了新花样:不直接回归光照,而是先白平衡、让视觉语言模型判断残留色偏、再迭代修正。四大基准全面碾压现有方法,最差场景误差几乎减半,思路清奇还实用。
24K沉浸感,听起来有没有很刺激?这篇论文巧妙借助静态场景的稳定性,用“8K全景相机+4K云台相机”的搭配,把静态360度远程呈现的有效分辨率提升到了24K水平,还顺手做了一个用户实验来验证体验提升。VR远程协作、远程巡检、沉浸式教学都可能被这波操作刷新上限。
卫星半夜拍的地球照片,又黑又糊还布满噪点,现有增强方法越修边界越糊、颜色越偏。这篇HALO把DINOv3语义先验和Depth Anything 3几何先验直接焊进注意力矩阵,用“正同质偏置+负异质惩罚”把特征聚合钉在物理边界内,8大基准全面领跑,低光遥感增强终于有了靠谱的新思路。
每次去佛罗伦萨,游客都在仰头看大卫像,而真正的“老司机”却在用热成像扫墙面。UC San Diego团队在千年凉廊上做了一场“硬核实验”:把AI超分拉来重建三维热像模型,结果耐人寻味——
对称检测模型一遇到旋转图像就"掉链子"?这篇来自广东实验室的工作给出了答案:用非对称区域去噪配合旋转等变特征匹配,在DENDI上将F1提升到65.52%刷新SOTA,还捎带手构建了多干扰的GMSYM新基准。方法不复杂,收益很实在,值得一看。
夏天在景区拍照,最难缠的不是人潮,而是地上那道怎么躲都躲不开的影子。照片还能靠后期硬修,一到视频里影子跟着物体动起来,简直是在考验修图师的心脏。今天这篇AAAI 2027论文《WildShadowRemover》,把“去除视频阴影”这件事直接交给视频扩散模型来搞定。看完只能说一句:还是让模型去扛吧,人眼真的看不过来。
人脸超分一直有个尴尬:单张低清图怎么补也补不出真实五官。这篇韩国三校合作的工作干脆“摇人”——把同一个人的多张低清监控图凑在一起,用Transformer把身份特征统一起来,再靠级联网络一步步把脸“画”清晰,顺便把行人再识别也推进了一把。思路简单粗暴,效果却很能打。
还在手动挑低光增强参数?这篇论文发现7个主流无参考质量评估指标在候选选择任务上全军覆没(Top-1准确率全部为0%),并推出BlindPSNR——不依赖任何参考图就能预测PSNR,在场景未见数据上Top-1准确率飙到89.5%,后悔值仅0.026dB,代码已开源。对任何要落地低光增强的团队都是一份实用参考。
极端场景下车牌只有12像素宽,笔画宽度2-3像素,常规OCR盲猜等于送分给负分。这篇ICIP 2026挑战赛高分方案证明了:把超分做到位(HAT 4倍提升),再搭配两个架构差异够大的识别器做集成,最后根据计分规则(+2/-1/0)设定弃权阈值,即使没有外部数据和私有模型,照样拿到9.73 wECR。核心思路很简单:先让字看得清,再让模型认得出,认不出的时候就
水下图像增强一直面临空间不均匀衰减的棘手难题,大多数方法要么效果不错但慢得离谱,要么轻快但恢复质量堪忧。DY-LUT直接把场景深度和YCbCr色彩分离这两个自然线索揉进四维查找表,用极小的参数量(3.56M)实现了质量和效率的双赢。自适应4K推理只需要约7毫秒,比那些笨重的扩散模型快了两个数量级,还能给下游检测和特征匹配带来实打实的提升,很值得关注。
红外与可见光双摄设备如今很常见,可两个摄像头总有‘视角差’,导致图像对不齐。以往要么手动校准,要么用复杂的配准网络。而这篇BeyondFusion另辟蹊径——直接在扩散模型的潜空间里让两个模态‘自对齐’,还能同时输出红外超分辨率图和融合图,手机实拍效果惊艳。一篇方法干净、结果扎实的工作,值得细读。
LONGGE AI COMMUNITY
加入「龙哥读论文」知识星球,持续获取 AI 论文、资讯、开源项目、招聘与研究思路。
加入龙哥读论文微信群:添加微信 kangjinlonghelper,备注“研究方向 + 地点 + 学校/公司 + 昵称”。
微信扫码加入知识星球