KAIST&MIT最新:无需训练!0.4秒搞定任意特征上采样,各项SOTA
不用训练、不用改模型,单张图优化不到半秒,就能把基础模型低分辨率特征放大成高分辨率特征,还在分割、深度、概率图上一口气刷到SOTA。想给视觉基础模型做“像素级复活”的同学,这篇绝对是宝藏基线。
LONGGE AI RESEARCH DAILY
每天筛选值得关注的 AI 论文,用工程视角拆解方法、实验和真正的落地价值。
目前已发表 1573 篇文章
不用训练、不用改模型,单张图优化不到半秒,就能把基础模型低分辨率特征放大成高分辨率特征,还在分割、深度、概率图上一口气刷到SOTA。想给视觉基础模型做“像素级复活”的同学,这篇绝对是宝藏基线。
纯数据驱动的医学分割模型已经够卷了,但几乎没人把线性代数和矢量微积分“硬塞”进网络。M-Net直接给出答案:把条件数、散度、旋度当先验注入U-Net,肝脏分割Dice比基线猛涨12.37%,还能端到端训练。想了解“数学+深度学习”还能玩出什么花活?这篇值得细品。
自动驾驶3D感知,向来是深度、检测、占用各学一套。北航与北邮提出的GeoUP,直接把视觉几何基础模型VGGT改造成统一3D感知骨架,一个模型三大任务全包,在nuScenes、Waymo、Argoverse 2、KITTI、DDAD五大基准拿下SOTA。思路清奇,落地潜力值得关注。
KAN架构虽然把可学习的函数搬到了每条边上,但训练时却只盯着聚合后的节点输出,边函数本身一直缺一个直接的优化目标。哈工大与港大这篇FS-JEPA,直接把自监督预测学习搬进了KAN聚合前的函数空间,用多半径签名当预测目标,把最强KAN方法平均Dice拉高2.25个百分点,思路清奇又扎实。
想象你在家里开着VR远程会议,头顶一圈RGB-D相机从六个角度同时拍摄。你以为自己只是坐着聊天,实际上,你手边的手机、墙上的照片、桌上的文件,甚至镜子里一闪而过的倒影,都正被多台相机同步捕捉,并实时融合成一个可自由旋转视。
深度模型在遥感分割里跑得欢,可它凭什么这么分?黑盒不拆,谁敢拿去搞灾情评估和土地利用监测?本文提出熵中心XAI方法,用熵不确定性给分割模型的决策画热力图,还顺手设计了一个H-SIT评估框架揪出“假重要区域”,在WHU数据集上把Grad-CAM、Score-CAM和Seg-Sobol都甩在身后,值得一读。
医学影像里,插值和分割各干各的,就像分手后非要各自忙活,结果边界糊了、病灶漏了。这篇论文让两个任务在一套网络里双向打配合,四个数据集上插值PSNR最高涨1.67dB、分割Dice最高涨2.9个百分点,推理还省了一半时间,临床落地够实在。
为什么值得读?CVPR 2026最佳论文荣誉提名作品,把“攻击-防御”对抗博弈引入SAM提示词优化——用攻击者主动制造干扰,逼出能抗干扰的提示词优化器,全程无需下游任务标注,即插即用,医学图像上最多涨超15个百分点。思路清奇,值得一看。
SAM3把分割从“几何抠图”进化成了“概念理解”,可越聪明的东西往往越怕被人抓住命门。这篇来自中科大、江南大学等团队的工作,首次为SAM3量身定制了跨概念通用对抗攻击UCD,一张扰动让五个数据集平均Mask AP从59.43直接被干到18.73,还顺手迁移到了SAM3.1和视频推理。AI安全方向的硬核活,值得好好拆解。
先来聊一个问题:怎么判断一张“造假”的病理切片图像到底像不像真的?
化疗靶区勾画要改一处轮廓,AI直接"听懂"人话动手改——这是三维医学影像分割基础模型VoxTell与文本指令结合的一次亮眼尝试。冻结全部预训练权重,只训练一个轻量指令分支,就能让模型按临床语言精确编辑亚区轮廓,正确指令在跨数据集测试中比矛盾指令高出0.047的Dice分离度,方向对了。
大家都在卷骨干网络,可热那亚大学这篇论文偏偏告诉你:轻量分割模型的涨点空间其实藏在被忽视的分割头里。本文系统对比三种解码器模块、验证多任务层次分解的有效性,参数量比基线少约40%,加权精度反而从91.2%涨到92.8%。把解码器这口“冷饭”炒出了新味道,值得一读。
LONGGE AI COMMUNITY
加入「龙哥读论文」知识星球,持续获取 AI 论文、资讯、开源项目、招聘与研究思路。
加入龙哥读论文微信群:添加微信 kangjinlonghelper,备注“研究方向 + 地点 + 学校/公司 + 昵称”。
微信扫码加入知识星球