29个检测器12个数据集实测:自动驾驶存储减负新范式
这篇文章切入角度很刁钻:别人都在优化模型算力,它却盯上了摄像头到内存的搬运能耗。用一个带语义感知的存储编码器,在保护行人检测精度的前提下,把前视相机接口能耗砍掉约36%,而且跨29个检测器、12个数据集验证,落地感很强。
LONGGE AI RESEARCH DAILY
每天筛选值得关注的 AI 论文,用工程视角拆解方法、实验和真正的落地价值。
目前已发表 1573 篇文章
这篇文章切入角度很刁钻:别人都在优化模型算力,它却盯上了摄像头到内存的搬运能耗。用一个带语义感知的存储编码器,在保护行人检测精度的前提下,把前视相机接口能耗砍掉约36%,而且跨29个检测器、12个数据集验证,落地感很强。
联邦学习在车上,梯度在公开网络中传输,易被中间人攻击。论文结合差分隐私和同态加密,用DP参数决定加密哪些梯度,攻击下准确率从10.4%提升至78.2%,开销增加约8-10%。思路清晰,实用性强。
协同驾驶最怕的不是"看不见",而是"看见了却说不清谁看到的"。G-MARK用知识图谱把车辆间的观测证据变成显式可追溯的推理对象,遮挡推理提升42.2%、通信成本压缩25.6倍,是轻量级可落地的协同推理新范式。做自动驾驶、车路协同的朋友值得一读。
自动驾驶这事儿,有个特别拧巴的现象:你看那些端到端大模型,在 benchmark(标准测试基准)上跑分一个比一个高,可一放到真实世界里,偶尔会像个刚拿驾照的新手一样,干出些让人血压飙升的事儿——比如老老实实闯个红灯,或者。
一个统一框架同时接管监控、鱼眼和行车记录仪三类交通视频,在AI City 2026出战三个赛道,FETV与第一名只差0.0007。这套「观察-推理-行动-验证」的智能体工作流拆解起来很有嚼头,适合所有对多模态视频理解与跨域泛化感兴趣的读者。
自动驾驶3D感知,向来是深度、检测、占用各学一套。北航与北邮提出的GeoUP,直接把视觉几何基础模型VGGT改造成统一3D感知骨架,一个模型三大任务全包,在nuScenes、Waymo、Argoverse 2、KITTI、DDAD五大基准拿下SOTA。思路清奇,落地潜力值得关注。
老司机最怕的不是路况差,而是同一个坑栽两次。这篇论文给自动驾驶大模型装上一个"失败记忆库",用结构化解耦检索加上解耦LoRA测试时训练,让模型现学现卖、遇险纠偏,还把NAVSIM双榜SOTA收入囊中,代码已开源。
自动驾驶定位一定要靠高精地图和昂贵传感器吗?长安大学这篇工作直接用普通摄像头+卫星图,把时序信息做成“记忆库”,平均误差从3.8米砍到1.57米,真实车辆零样本跑出96.86%的5米内召回。低成本方案又要卷出新高度了。
城市道路的自动驾驶已经卷成红海,矿区这种“路不成路、灰比雾厚”的硬骨头却少有人啃。中科院团队让规划器学会区分“看得见的安全”与“看不见的风险”,碰撞率直降七成多,这波操作值得研究!
道路缺陷检测最怕输入图像又糊又暗——坑洼裂纹在模糊里“隐身”,再强的检测器也得抓瞎。RMIT团队这篇工作直接把退化证据变成恢复条件,让复原后的图像“喂”给检测器,8种退化场景里7项精度领先。方法简洁、定位精准,适合所有做巡检和车载视觉的团队围观。
视频生成模型在自动驾驶里一直是“吃钱大户”,训练花钱推理更花钱。华中科大这波操作骚气:让视频大模型只在训练时当“免费家教”,推理时直接扔了它,结果单目摄像头91.5 PDMS登顶NAVSIM,延迟还比别人低一大截😏 这便宜占得,值得好好看看。
视频扩散模型做驾驶规划,一定要把未来视频全部生成完吗?清华AIR这篇工作给出了否定的答案:中间层特征已经足够解码出好轨迹。它给六个中间层装上"提前出口",配一个轻量质量打分器,分数够了就立刻刹车返回,平均端到端延迟只有170毫秒,比全深度规划省下47%的时间,数值还更高。把视频生成的成本巧妙避开了,这个思路在同类工作里相当眼前一亮。
LONGGE AI COMMUNITY
加入「龙哥读论文」知识星球,持续获取 AI 论文、资讯、开源项目、招聘与研究思路。
加入龙哥读论文微信群:添加微信 kangjinlonghelper,备注“研究方向 + 地点 + 学校/公司 + 昵称”。
微信扫码加入知识星球