9大消融实验验证:比亚迪混合世界模型凭什么成为自动驾驶新标杆
当自动驾驶世界模型还在像素级预测的"精细"与潜变量预测的"鲁棒"之间二选一时,比亚迪团队直接端出了一盘"混合大餐"——HyWorldVLA。预训练阶段同时预测像素和潜变量,既保住了细粒度时空建模,又继承了潜变量的抗噪能力。NAVSIM v1/v2双榜夺冠不是最惊艳的,雨雾场景下PDMS高达86.87(竞品仅60+)才真正让人眼前一亮。一句话:不做选择,全都要
LONGGE AI RESEARCH DAILY
每天筛选值得关注的 AI 论文,用工程视角拆解方法、实验和真正的落地价值。
目前已发表 1573 篇文章
当自动驾驶世界模型还在像素级预测的"精细"与潜变量预测的"鲁棒"之间二选一时,比亚迪团队直接端出了一盘"混合大餐"——HyWorldVLA。预训练阶段同时预测像素和潜变量,既保住了细粒度时空建模,又继承了潜变量的抗噪能力。NAVSIM v1/v2双榜夺冠不是最惊艳的,雨雾场景下PDMS高达86.87(竞品仅60+)才真正让人眼前一亮。一句话:不做选择,全都要
摄影后期调色还在手动拉曲线?Hist2Style把大型图像编辑模型“压缩”成一个1.5M参数的轻量网络,用直方图作为控制界面,让你像调音量一样调色调。在用户研究里,它赢了82%的对比试验,而且支持实时4K处理,简直是调色师的效率神器。
雨天路面反光、夜间地面忽明忽暗、雪天纹理全无——自监督深度估计在这些场景下经常直接崩掉。北邮这篇工作给出了一个漂亮的解决方案:先用多个「天气专家」教师产生伪标签,再用不确定性蒸馏让学生学会判断该信谁;同时把雷达从稀疏的POV视角投影到更稠密的BEV空间做跨注意力融合。效果立竿见影,夜间absRel暴降85%,雪天泛化也提升了20%+。代码已开源,值得所有做自
说到给视频配音效,很多人会想:不就是根据画面内容生成声音吗,猫叫就是喵喵,打雷就是轰隆,有什么难的?但如果你脑洞再大一点——比如,你想让视频里原本只是“喵喵”叫的猫,在00:07秒的那一声突然变成“狮子吼”;或者你希望整个视频的音频听起来就像是从一部80年代复古游戏机里传出来的;再或者在火柴划过的一瞬间,不仅要有摩擦声,还要叠加一声魔幻的“呼——嗖”……你会
自蒸馏方法通常需要特权答案或视觉证据标注来制造教师-学生不对称性,而本论文来自马里兰大学等机构,提出一个极其简洁的替代方案:只需要一张内容擦除的黑色图像,与原始图像下教师模型的预测做对比,就能构建出有效的自蒸馏目标。在Qwen3-VL和Qwen3.5全系模型上,VCSD稳定提升1.86%-4.77%,且无需外部教师、推理时零开销。方法既巧妙又实用,值得关注。
遥感LVLM看着挺靠谱,但能被一张加了微小噪声的图片骗得认错地物?GeoThreat做到了,攻击成功率飙到88%,比之前最好的方法高出46%。这篇工作不仅是攻击,更是对遥感领域LVLM鲁棒性的警钟。
这篇论文最有意思的地方,不是又造了一个更强的分类器,而是先承认一件事:很多视觉概念根本没法一上来就说清。Google把“边界样本+概念梳理”做成了一个可交互流程,专门治那种人和模型都容易吵架的主观概念,挺实用。
6G最怕的不是模型不够大,而是模型在陌生环境里还“自信满满”地胡说八道。本文专门抓住无线多模态基础模型的信任危机,用几何原型把OOD检测做成了一个几乎不拖慢推理的安全闸门,工程味很足。
3D医学分类最容易踩坑的地方,这篇论文几乎都点到了:不是模型越大越好,而是适配方式常常更关键。更狠的是,作者直接把“2D模型不如3D模型”的老观念掀了桌子。
一段单目第一人称视频,竟然想同时“读出”身体、手、注视、相机轨迹和深度。ReViV最有意思的地方,不是它又做了一个单任务模型,而是把这些本来就互相牵连的信号,硬是塞进了一个统一生成框架里,还跑得很快。
临床大模型最麻烦的事,不是选错答案,而是“答案对了,理由却乱了套”。MIRA-Ev 直接把评测拆成三层,专门盯住证据、成分和关系,连巴斯克语也拉进来了,属于那种一看就知道不是来凑数的基准。
量子计算和超算一结合,最先炸掉的往往不是算力,而是调度系统。这个工作不讲玄学,直接把 QRMI 拿去适配多种主流 workload manager,看看“统一接口”到底能不能真落地。
LONGGE AI COMMUNITY
加入「龙哥读论文」知识星球,持续获取 AI 论文、资讯、开源项目、招聘与研究思路。
加入龙哥读论文微信群:添加微信 kangjinlonghelper,备注“研究方向 + 地点 + 学校/公司 + 昵称”。
微信扫码加入知识星球