DCP改造后有多强?四叉树+引导滤波跑出0.74SSIM
这篇工作很“朴素”,但不空。它没有靠大模型堆参数,而是把低光照增强里最容易被忽略的几个老问题——大气光估计不准、透射率细节糙、结果容易发灰——逐个拆开处理。思路偏传统,但工程味很足,适合想看物理模型怎么落地的人。
LONGGE AI RESEARCH DAILY
每天筛选值得关注的 AI 论文,用工程视角拆解方法、实验和真正的落地价值。
目前已发表 1655 篇文章
这篇工作很“朴素”,但不空。它没有靠大模型堆参数,而是把低光照增强里最容易被忽略的几个老问题——大气光估计不准、透射率细节糙、结果容易发灰——逐个拆开处理。思路偏传统,但工程味很足,适合想看物理模型怎么落地的人。
这篇论文最有意思的地方,不是“看见了喷流”,而是看见喷流在黑洞附近居然不是笔直冲出去,而是先拐弯、再加速、还顺手把视角压到接近正脸。EHT把3C 279的内核区域拍得足够细,细到能把“伪影”和“真结构”分开,这才是硬核。
原子一跑,相干就散,这事在里德伯极化激元里尤其致命。本文不去硬追“把原子冻住”,而是让原子在存储期间自己把相位补回来,三套协议的思路都很直接,实验可操作性也不差。
这篇工作最狠的地方,不是“能修视频”,而是把“多步扩散修复”硬生生压成了一步,还顺手把对外部草稿的依赖也掐掉了。对于视频对象移除这种既要像真、又要够快的任务,D2DF给出了一条很工程化的路子。
这篇论文最有意思的地方,不是又造了一个更会“听话”的模型,而是把问题反过来:模型能不能从几张示例图里自己悟出共同概念,再拿去指导生成?Apple Research这次盯上的,就是视觉模型最容易翻车、但也最像人类学习的那一口气。
视频深度估计一直卡在“没数据”上。这篇来自上海AI Lab、浙大和悉大的论文,直接去游戏里“白嫖”了4万段高精度视频深度数据,再把手里的视频生成扩散模型改成深度估计模型,3步去噪就出结果,跑得比谁都快。效果直接起飞,把之前所有生成式深度模型都甩在身后。
这篇论文最有意思的地方,不是又造了一个波束成形器,而是把“选参数”这件事倒过来了:不先盯输入信号,而是先看输出好不好,再决定用哪个候选方案。对低信噪比和麦克风统计失真的场景,这个思路很实在。
这篇论文把“自动驾驶需要传什么”这件事说得很直白:别再傻乎乎传整张图了,直接传任务相关语义。更有意思的是,它不是只做压缩,还把重建和分类一起训练,顺手把卫星链路下的低信噪比问题也一起收拾了。
视频模型最尴尬的地方,不是不会画,而是会画却不会“想”。HDR把这个矛盾掰开了:先粗后细地推理,再保持流式低延迟输出,六个多步任务上把成功率从34.22拉到60.29,确实有点东西。
医学图像分割最烦的不是分不清边界,而是模型一出院门就“水土不服”。CRISP不靠目标域数据、不改测试时参数,直接用排名稳定性把不确定边界一层层挤出来,思路干净,临床味很浓。
这篇论文最狠的地方,不是把代码模型调高了几个点,而是它几乎没加任何“外挂”:不要验证器,不要教师模型,不要强化学习,只靠模型自己的原始输出就能涨分。更有意思的是,提升还主要落在更难题上,说明它不是在“刷题套路”,而是在改模型分布本身。
这篇论文最有意思的地方,不是“能不能遗忘”,而是“遗忘前能不能先把没必要遗忘的删掉”。Apple Research 直接把机器遗忘做成了省算力工程,最高能省下约50%执行时间,思路很实在。
LONGGE AI COMMUNITY
加入「龙哥读论文」知识星球,持续获取 AI 论文、资讯、开源项目、招聘与研究思路。
加入龙哥读论文微信群:添加微信 kangjinlonghelper,备注“研究方向 + 地点 + 学校/公司 + 昵称”。
微信扫码加入知识星球