4.9倍吞吐反超SODiff,JPEG修复终于不挑硬件了
先聊一个很多人每天都会碰到、但完全没意识到的问题:你手机相册里那一张张照片,绝大多数都是JPEG格式。JPEG为什么能统治世界这么多年?因为它用一个巧妙的"分块变换+量化"策略,用很小的体积换来了还算能看的画质。
LONGGE AI RESEARCH DAILY
每天筛选值得关注的 AI 论文,用工程视角拆解方法、实验和真正的落地价值。
目前已发表 1573 篇文章
先聊一个很多人每天都会碰到、但完全没意识到的问题:你手机相册里那一张张照片,绝大多数都是JPEG格式。JPEG为什么能统治世界这么多年?因为它用一个巧妙的"分块变换+量化"策略,用很小的体积换来了还算能看的画质。
语音增强有个老毛病——噪声压下去了,说话声的高频细节也跟着"缩水"了。根特大学这回不堆模型,而是从损失函数下手,让网络学会按频率和语音能量"区别对待",高频重建误差直降15%以上。方法轻巧,思路值得一看。
知识图谱里明明写着“A是B的子类”,模型却视而不见?查尔姆斯理工把这种类层级关系变成“语义损失”约束,让链接预测MRR在BioKG上直接涨了15.5%,而且比把层级关系硬塞成图边更省参数。想在KG嵌入里优雅地利用本体的同学,这篇值得细读。
想象一个场景:某情报分析系统正在滚动监测全球事件流,屏幕突然弹出一条提示——“未来一周,A国可能与B国启动贸易谈判”。
夜深人静,研究员对着硬盘里几十TB的野外小鼠录音发愁:录音里除了小鼠50kHz以上的超声“对唱”,还有空调、风扇、鼠笼碰撞、脚步等各色噪声,信号早被压到墙角。
视频超分模型碰到真实世界里的压缩伪影、噪点、模糊就翻车,这是老难题了。这篇论文把「测试时自适应」玩出了花:不重新训练、不要高清参考,AI模型边推理边自我调整,画质和文字清晰度都有实打实的提升。思路接地气,实验做得很扎实,值得一读。
单目标强化学习靠“换网络结构”就能白捡一大截性能,多目标强化学习却还在算法泥潭里打转?马萨里克大学和阿托大学的最新研究直接把SimbaV2架构搬进MORL,HV暴涨132%,证明“算法不够,架构来凑”这条路在多目标领域同样走得通。对正纠结算法创新还是架构升级的读者来说,这篇论文给出了一个极具性价比的新方向。
多元时间序列预测最被忽视的角落,其实是未来变量之间"一起涨跌"的结构关系。这篇来自悉尼科技大学、清华和港科大广州的工作提出CvLoss,一个即插即用的损失正则项,不改模型结构就能在114组受控对比中拿下111胜,推理还零开销。
医学图像分割的像素级标注成本高得离谱,边界框标注是更经济的替代,但框形偏置总会让预测结果“方方正正”。深圳大学在CVPR 2026提出的WeakMed,用一招Mask-to-Box变换和尺度一致性损失,巧妙地把框形偏置化解于无形,在9个数据集上全面超越现有弱监督方法,甚至逼近全监督。这对于想低成本部署医学分割的团队来说,简直是及时雨。
这篇来自弗吉尼亚大学的Lantern直面物理引导扩散在量热器模拟中的梯度冲突问题,设计GradBlend让物理辅助损失不妨碍生成保真度,并引入新度量CFD诊断层间与体素相关性。实验显示Lantern在FPD上持平纯去噪基线,而普通多任务方法性能崩溃2-100倍。对想给生成模型加物理约束的团队极有启发性。
这篇论文最有意思的地方,不是把类别发现做得更准,而是把“测试时不能学”这条老规矩掀了桌子。TALON直接把原型和编码器拉进在线自适应流程里,让模型在推理流里边看边学,顺手还把哈希编码这层“信息损耗滤镜”给拆了。
这篇论文很实在:不跟生成模型纠缠“像不像”,而是直接问“合成数据能不能把分割做对”。FD-loss把分布对齐塞进医学图像生成训练里,结果不是纸面分数好看,而是下游分割真涨点。
LONGGE AI COMMUNITY
加入「龙哥读论文」知识星球,持续获取 AI 论文、资讯、开源项目、招聘与研究思路。
加入龙哥读论文微信群:添加微信 kangjinlonghelper,备注“研究方向 + 地点 + 学校/公司 + 昵称”。
微信扫码加入知识星球