ACM MM 2026:让超分模型学会"随机应变"?测试时自适应让模糊视频秒变清晰
视频超分模型碰到真实世界里的压缩伪影、噪点、模糊就翻车,这是老难题了。这篇论文把「测试时自适应」玩出了花:不重新训练、不要高清参考,AI模型边推理边自我调整,画质和文字清晰度都有实打实的提升。思路接地气,实验做得很扎实,值得一读。
LONGGE AI RESEARCH DAILY
每天筛选值得关注的 AI 论文,用工程视角拆解方法、实验和真正的落地价值。
目前已发表 1573 篇文章
视频超分模型碰到真实世界里的压缩伪影、噪点、模糊就翻车,这是老难题了。这篇论文把「测试时自适应」玩出了花:不重新训练、不要高清参考,AI模型边推理边自我调整,画质和文字清晰度都有实打实的提升。思路接地气,实验做得很扎实,值得一读。
图像编辑最怕什么?改完目标,背景也跟着面目全非。这篇ACM MM 2026论文提出ATDEdit,把扩散Transformer的采样过程改造成异步Token解码,用Token级条件惊奇在线发现"该改哪些Token",不需要外部掩码、不需要微调,在PIE-Bench上把背景保持的PSNR推到27.44dB。方法干净、思路漂亮,值得一读。
网络会不会“吵到天荒地老”?这篇论文只用一个三次非线性,就把动态极化的产生、稳定与消除讲得明明白白;最反直觉的是,只需锚定一个智能体的观点,全网振荡分歧就能收敛回共识。推导极其优雅,值得控制系统方向的同学反复品味。
先把镜头拉远一点。物理学家手里有一堆实验数据,然后想从里面挖出一条公式——比如爱因斯坦那个 E = mc²。放在过去,这得靠灵光一现。
Google DeepMind把动态4D重建做成了"点单式"服务:一段视频编码一次,任何时间、任何空间位置的3D坐标随查随到。200+FPS位姿估计、18-300倍跟踪提速,CVPR 2026最佳论文的含金量,龙哥带大家一探究竟。
为什么值得读?CVPR 2026最佳论文荣誉提名作品,把“攻击-防御”对抗博弈引入SAM提示词优化——用攻击者主动制造干扰,逼出能抗干扰的提示词优化器,全程无需下游任务标注,即插即用,医学图像上最多涨超15个百分点。思路清奇,值得一看。
运动生成界的“解耦大师”来了!MoCoDiff把文本、风格、历史信息拆成独立控制通道,在冻结扩散骨干上即插即用,长序列不漂移、风格不串味,效率还直接冲到136.89 FPS——动画师看了想点赞,研究者看了想复现。
JPEG一压狠了,画面就糊成一团。传统方法要么回归均值磨平纹理,要么生成式模型脑补纹理骗过人眼却坑了下游模型。FDIR用两阶段解耦把这笔“三角债”理清了,只用3.5K张图就拿下7/10下游任务领先,值得做压缩恢复的同学都看一眼。
给AI代理发工具权限就像借车给实习生——怕他乱开。Niyam-AI直接上密码学“行车记录仪+电子围栏”:每次工具调用都得先过轻量Judge模型,再生成零知识证明,F1 88.5%、误报率仅1.1%,关键是任何第三方都能在53毫秒内验证“安全检查真的发生了”。同类工作里把ZK证明用到agent工具调用验证上的,这是头一遭。
告别逐镜头生成的割裂感,快手Kling团队联合清华、南大提出的ContextMaster,把生成、参考和编辑统一进一个模型,在单卡上跑到16 FPS的同时,还能让角色和场景在多镜头之间保持一致。🔍 想看懂这套固定预算稀疏路由怎么在有限算力下留住完整记忆?这篇值得细读。
大模型推理贵、响应慢,一直是落地最扎心的痛点。苹果、谷歌DeepMind、哈佛这次联手给16B扩散语言模型LLaDA 2.1动了场小手术:6层注意力换成线性版本,只训练约60小时就换来最高1.7倍解码加速,代码已开源。扩散模型也能线性化,这波操作值得细品。
戴智能眼镜开电话会,周围人声嘈杂听不清?边缘小模型算力不够,云端大模型又太慢——Meta这次让云边“组队打怪”,边缘只加1.5%参数就能蹭到云端大模型的“听力”,在64毫秒延迟下硬是把语音增强的SI-SDR拉高了3.77dB。真·云边协同新范式,值得一看。
LONGGE AI COMMUNITY
加入「龙哥读论文」知识星球,持续获取 AI 论文、资讯、开源项目、招聘与研究思路。
加入龙哥读论文微信群:添加微信 kangjinlonghelper,备注“研究方向 + 地点 + 学校/公司 + 昵称”。
微信扫码加入知识星球