4.23K参数冲SOTA!这篇水下增强把频率先验玩明白了
这篇工作最有意思的地方,不是“又加了个注意力”,而是把频率先验和重参数化卷积硬绑在一起,还尽量不增加推理成本。对超轻量水下增强来说,这种思路比单纯堆参数更像正经做工程。
LONGGE AI RESEARCH DAILY
每天筛选值得关注的 AI 论文,用工程视角拆解方法、实验和真正的落地价值。
目前已发表 1573 篇文章
这篇工作最有意思的地方,不是“又加了个注意力”,而是把频率先验和重参数化卷积硬绑在一起,还尽量不增加推理成本。对超轻量水下增强来说,这种思路比单纯堆参数更像正经做工程。
遥感变化描述最烦的,不是模型不会看图,而是太爱“说套话”。这篇DFM专门盯住这个毛病:用文本引导的对比学习把视觉特征往“该说的变化”上拽,再拿变化检测先验补一脚,思路很工程,也很对症。
这篇文章把扩散模型、双路径编码和跨层特征融合揉到一起,专门对付皮肤病灶那种“边界糊成一锅粥”的老难题。实验结果也挺硬,三个公开数据集上平均Jaccard和Dice都很能打,值得看看它到底怎么把病灶边缘抠细。
这篇论文最有意思的地方,是把原本“玄学味很重”的GAN训练,硬生生拆成了可解的高维动力学问题。类条件、相关性、非零均值这些看起来很乱的因素,最后都被压进了一个有效协方差里,理论和实验还能对上。
这篇 AMG-Fuse 很会“借力打力”:不死磕把退化图硬修到完美,而是先用伪真值把训练方向扶正,再用掩码把每个模态该出力的地方分清楚。雪、雨、雾都能一起照顾到,还顺手把下游检测也拉了一把,属于很实用的那种新方法。
“三个臭皮匠,顶个诸葛亮”在AI评审领域失灵了。Apple Research这篇论文泼了盆冷水:你花重金请来9个顶级大模型打分,以为获得群体智慧,实际上它们只用同一种声音对你说话。这是直面当前AI测评滥用的“清醒剂”。
继2026年6月推过AVDM2、DenseDPO等视频生成加速和对齐方法后,今天这篇城大新作PRISM,直接把视频生成模型本身变成了最懂行且最快速的“评委”。以往用大视觉语言模型当裁判,又慢又贵,还得等视频全生成完。PRISM反其道而行之,冻结生成模型,在满是噪声的潜伏空间里就能精准打分,还能在生成早期就淘汰烂片,推理提速7.6倍。这波操作,值得所有做视频生
把模型“减肥”这件事,龙哥之前也聊过不少,比如大模型量化、混搭量化之类的。但今天这篇CVPR 2026的文章视角很刁钻——它发现视觉模型权重那些看起来不对称的“坏脾气”,其实只是被少数几个“刺头”(离群点)给带歪了。把刺头一拔,底下全是规规矩矩的对称分布。于是作者干脆利落地抛弃了硬件不友好的“非对称量化零点”,搞了个密集+稀疏的二重奏。这波操作不仅精度反超了
AI画画火了这么久,但你有没有发现,让它“精准复刻”某种画风,比如水墨、印象派、卡通,结果总有点“似是而非”? 核心问题在于,现有的“人类偏好奖励模型”能判断美丑,却根本不懂“风格”这回事。CVPR 2026的这篇StyleDoctor,就像给AI配上了一位严格的“美术史教授”,专门用来评估和引导风格生成。这项工作还配套了一个涵盖1000种风格、40万对样本
拼参数时代要终结了?EPFL等机构提出递归掩码扩散模型(R-MDM),让模型在每次去噪时“循环思考”多次。仅6层循环5次的模型,效果竟吊打30层大模型,推理还快了2.7倍!这不就是AI界的“以小博大”新范式吗?
把完美的圆形管子稍微捏扁那么一丁点(不到1%),里面球球的排列方式就会产生翻天覆地的变化——这是南开大学团队刚刚揭示的惊人发现。该研究不仅能解释生物体中奇怪的细胞堆积现象,更为材料设计提供了全新的手性调控思路,太有意思了!
以前给AI发“大锅饭”奖励,生成区域无论主次都一个待遇,难怪画出来的图总在细节上翻车。这次STAR的方法挺巧妙——直接把模型里的注意力图拿来当导航,给“画什么”和“画在哪里”的区域多发奖励。效果是真不错,GenEval飙到0.97,而且计算量几乎没增加,属于花小钱办大事的典范。
LONGGE AI COMMUNITY
加入「龙哥读论文」知识星球,持续获取 AI 论文、资讯、开源项目、招聘与研究思路。
加入龙哥读论文微信群:添加微信 kangjinlonghelper,备注“研究方向 + 地点 + 学校/公司 + 昵称”。
微信扫码加入知识星球