中科院自动驾驶"错题本":26毫秒现学现卖,Navtest冲到94.1
老司机最怕的不是路况差,而是同一个坑栽两次。这篇论文给自动驾驶大模型装上一个"失败记忆库",用结构化解耦检索加上解耦LoRA测试时训练,让模型现学现卖、遇险纠偏,还把NAVSIM双榜SOTA收入囊中,代码已开源。
LONGGE AI RESEARCH DAILY
每天筛选值得关注的 AI 论文,用工程视角拆解方法、实验和真正的落地价值。
目前已发表 1573 篇文章
老司机最怕的不是路况差,而是同一个坑栽两次。这篇论文给自动驾驶大模型装上一个"失败记忆库",用结构化解耦检索加上解耦LoRA测试时训练,让模型现学现卖、遇险纠偏,还把NAVSIM双榜SOTA收入囊中,代码已开源。
低光增强里"提亮容易、校色难"的老大难问题,这篇论文算是啃到点子上了。福州大学提出的CAGE框架,用可解释的颜色空间变换方案做色彩校正,还能像插件一样直接塞进现有模型里,成本低到可以忽略。在低光图像处理这个长期刚需的赛道上,这活儿干得漂亮。
深度模型在遥感分割里跑得欢,可它凭什么这么分?黑盒不拆,谁敢拿去搞灾情评估和土地利用监测?本文提出熵中心XAI方法,用熵不确定性给分割模型的决策画热力图,还顺手设计了一个H-SIT评估框架揪出“假重要区域”,在WHU数据集上把Grad-CAM、Score-CAM和Seg-Sobol都甩在身后,值得一读。
潜在世界模型越来越火,可学界一直缺一把能解释“为什么这个模型规划成功、那个却失败”的尺子。本文从SIGReg与VISReg的受控对比入手,把诊断对象从单一编码器扩展到编码器+预测器+规划器三件套,提出VIScore;相关度冲到0.75以上,校准误差还能低于常量拟合,属于世界模型方向稀缺的工具型工作。
同样是扩散模型,凭什么HNDif去雾更猛?因为它不玩"纯噪声瞎猜",而是把大气散射模型直接写进扩散过程:雾浓处多注噪声、雾淡处少注噪声,反向再联合去雾去噪。四个主流去雾骨干、六个基准数据集,平均PSNR提升0.57dB。想给自家去雾模型"插管提速"?这篇值得细读。
自动驾驶定位一定要靠高精地图和昂贵传感器吗?长安大学这篇工作直接用普通摄像头+卫星图,把时序信息做成“记忆库”,平均误差从3.8米砍到1.57米,真实车辆零样本跑出96.86%的5米内召回。低成本方案又要卷出新高度了。
一边是700小时的大规模语音增强数据,一边是只有35小时的歌声分离标注集,AI界“贫富差距”在这篇论文里被LoRA一招填平。只需6-12%额外参数,就能让语音增强模型“开口唱歌”,还稳稳保住原有看家本领,这买卖划算。
多帧视觉跟踪里模板帧越堆越多,效果却可能越堆越差?ETCTrack用一个可学习的ATC模块把历史模板Token动态压缩60%,MACs直降21.4%,精度只掉0.4%,还在七个基准上拿下SOTA。代码已开源,看完这篇也许能重新理解“给Transformer减负”这件事。
手术机器人学动作,最缺的就是带标签数据。这篇来自中佛罗里达大学等机构的工作,首次把世界-动作模型(WAM)用到手术机器人上,在动作标签预算固定的条件下,用免费的无动作视频预训练就把闭环成功率从63.5%拽到77.8%,PegTransfer单任务直接涨了20个百分点。视频不要钱、标签贵上天,这条路子值得所有做医疗机器人的人看一眼。
3D高斯泼溅做持续重建,最大痛点就是慢。这篇论文用空间截断变分推断加改进重分配,把每帧训练延迟从84秒干到0.05秒,1680倍提速还不掉质量,直接在RTX 3070 Ti上跑通。做机器人实时建图的读者,这篇相当值得看。
视频生成要当世界模型,最大的坑就是训练时乱炖噪声、推理时要按顺序去噪。华中科大联合地平线这篇Stream Forcing把“训练节奏”做成课程:先广撒网、再精对齐,UCF-101上FVD直接降了36.6%,还能零样本飙到128帧。继2026年6月聊过NVIDIA+清华的Causal-rCM之后,这是又一篇把流式生成训练做扎实的工作。
多路径传输一直在“盲人摸象”——调度器只看字节,不懂视频帧的关键程度。代尔夫特理工这篇MoMQ,首次把MoQT的元数据变成路径调度规则,在Starlink+WiFi真实测试床上把P99.9延迟从384.7ms砍到114.1ms,实时视频终于能跑进150ms交互预算。想法巧妙,实验扎实,值得一读。
LONGGE AI COMMUNITY
加入「龙哥读论文」知识星球,持续获取 AI 论文、资讯、开源项目、招聘与研究思路。
加入龙哥读论文微信群:添加微信 kangjinlonghelper,备注“研究方向 + 地点 + 学校/公司 + 昵称”。
微信扫码加入知识星球