KAIST&MIT最新:无需训练!0.4秒搞定任意特征上采样,各项SOTA
不用训练、不用改模型,单张图优化不到半秒,就能把基础模型低分辨率特征放大成高分辨率特征,还在分割、深度、概率图上一口气刷到SOTA。想给视觉基础模型做“像素级复活”的同学,这篇绝对是宝藏基线。
LONGGE AI RESEARCH DAILY
每天筛选值得关注的 AI 论文,用工程视角拆解方法、实验和真正的落地价值。
目前已发表 1573 篇文章
不用训练、不用改模型,单张图优化不到半秒,就能把基础模型低分辨率特征放大成高分辨率特征,还在分割、深度、概率图上一口气刷到SOTA。想给视觉基础模型做“像素级复活”的同学,这篇绝对是宝藏基线。
如果让一个从来没出过村的老学究,突然面对整个互联网的图片,他会怎么看世界?大概率是懵的。反过来,如果把全世界最聪明的AI模型扔进一座百年图书馆,让它只看一堆发黄的书页扫描件,它也会懵。
这篇论文把“谁来判断压缩图像好不好”这个老问题翻出了新花样。斯坦福和谷歌团队发现,Gemini 2.5-Flash这类通用视觉语言模型,竟然能零样本复现人眼的相似度判断,干脆把它请来当裁判,用偏好优化把扩散自编码器训得更懂人眼。结果在多个基准和上万次用户评测里直接干到第一梯队。想看看VLM怎么当评委、这条路能省多少人工标注成本?这篇值得一读。
一篇彻底改写数值分析教科书认知的硬核理论成果。作者证明了完全主元与车房主元下高斯消元增长因子的渐近量级为维度拟多项式,解开了自1940年代延续至今的著名开放问题;同时证明稀疏矩阵下部分主元依然可能指数爆炸,寻找最优行置换还是NP难问题。做科学计算底层和数值算法的读者,这篇值得精读。
想象一下在蜂蜜里游泳:你拼命划水,水却像胶水一样黏着你,一停就立刻静止。这就是低雷诺数世界里的真实日常。以色列理工学院这篇新论文,给经典的Purcell三连杆游泳机器人加了一个“大肚子”模型,再用庞特里亚金最大值原理,把“怎么扭最远、怎么扭最省力”的最优步态一次算明白了。
模拟存内计算(CIM)部署扩散模型是低功耗生成的重要路径,但芯片非理想性会让引导信号悄悄“失真”。这篇北大港大合作的工作把失效通道定位到无分类器引导残差上,并给出免重训练、只改一个标量参数的优雅修复方案,在3个扩散模型上大幅恢复生成质量,值得所有关注AI芯片落地和扩散模型的读者一读。
你的AI助手能记住你三个月前说过"最近改喝零度可乐"这种小事吗?还能看出你最近压力大、回答时自动把语气调到安静模式?南京大学和字节跳动这篇CVPR 2026工作,把"长期记忆+动态人格对齐"做成了完整框架,在自建基准上把GPT-4o都赢了,值得一看。
多模态大模型“一本正经地胡说八道”是落地最大痛点之一。这篇CVPR 2026论文把幻觉拆成“感知偏差”和“推理漂移”两类,用不到1%的额外计算找到该加强的注意力头,平均提分4.2%且完全无需训练,插拔即用,值得所有做多模态推理的团队收藏。
这可能是今年最"考古"的AI基础设施工作:哈佛联手波士顿公共图书馆,把1795到1930年的147万份报纸扫描件,变成163亿token的干净文本。更难得的是,整套流水线设计成工作站级硬件就能跑,租服务器全程只要约2.5万美元——相比云端OCR动辄几十万美元的报价,这性价比简直离谱。对做数据工程、LLM预训练和数字人文的人来说,这篇值得细读。
人类觉得"闭着眼都能做"的插拔动作,对机器人来说,却是灵巧操作领域最硬的骨头之一。尤其是当机器人换上一只仿人五指手,光是"让五根手指协调起来把东西捏稳、转正、再对准插进去"这一套动作,就足够让无数强化学习训练曲线原地去世。
世界模型和Q学习还能这么玩?斯坦福北大团队提出的QWM,把世界模型当成“预言家”,只做测试时搜索,不让模型误差污染训练,操作成功率全面飙升。继7月末聊过ActSWM这类JEPA世界模型的规划玩法后,本期这篇把Q学习和世界模型的结合推到了一个新高度。
3DGS资产正在被“拆零件拼装”式盗用,而现有的渲染级水印在这种局部侵权下几乎集体失灵。浙大这篇NGS-Marker直接对高斯原语下手,任意抠一块都能验明正身,局部侵权场景下解码准确率冲到99%以上,是3D资产版权保护里少见的真痛点工作。
LONGGE AI COMMUNITY
加入「龙哥读论文」知识星球,持续获取 AI 论文、资讯、开源项目、招聘与研究思路。
加入龙哥读论文微信群:添加微信 kangjinlonghelper,备注“研究方向 + 地点 + 学校/公司 + 昵称”。
微信扫码加入知识星球