LONGGE AI RESEARCH DAILY

龙哥读论文

每天筛选值得关注的 AI 论文,用工程视角拆解方法、实验和真正的落地价值。

目前已发表 1573 篇文章

PaperDaily 数据库收录 论文拆解 12820 研究思路 385 AI 资讯 208 开源项目 164 科研招聘 128 学习资料 8 热点主题 493 论文成功模式 1625

标签:多模态

共 200 篇
9大消融实验验证:比亚迪混合世界模型凭什么成为自动驾驶新标杆
视觉与图像

9大消融实验验证:比亚迪混合世界模型凭什么成为自动驾驶新标杆

当自动驾驶世界模型还在像素级预测的"精细"与潜变量预测的"鲁棒"之间二选一时,比亚迪团队直接端出了一盘"混合大餐"——HyWorldVLA。预训练阶段同时预测像素和潜变量,既保住了细粒度时空建模,又继承了潜变量的抗噪能力。NAVSIM v1/v2双榜夺冠不是最惊艳的,雨雾场景下PDMS高达86.87(竞品仅60+)才真正让人眼前一亮。一句话:不做选择,全都要

北邮新方法:夜间深度估计误差暴降85%,雪天零样本也涨20%
视觉与图像

北邮新方法:夜间深度估计误差暴降85%,雪天零样本也涨20%

雨天路面反光、夜间地面忽明忽暗、雪天纹理全无——自监督深度估计在这些场景下经常直接崩掉。北邮这篇工作给出了一个漂亮的解决方案:先用多个「天气专家」教师产生伪标签,再用不确定性蒸馏让学生学会判断该信谁;同时把雷达从稀疏的POV视角投影到更稠密的BEV空间做跨注意力融合。效果立竿见影,夜间absRel暴降85%,雪天泛化也提升了20%+。代码已开源,值得所有做自

字节跳动新作!给视频配音就像改字幕,声效可控性暴增40.7%
视觉与图像

字节跳动新作!给视频配音就像改字幕,声效可控性暴增40.7%

说到给视频配音效,很多人会想:不就是根据画面内容生成声音吗,猫叫就是喵喵,打雷就是轰隆,有什么难的?但如果你脑洞再大一点——比如,你想让视频里原本只是“喵喵”叫的猫,在00:07秒的那一声突然变成“狮子吼”;或者你希望整个视频的音频听起来就像是从一部80年代复古游戏机里传出来的;再或者在火柴划过的一瞬间,不仅要有摩擦声,还要叠加一声魔幻的“呼——嗖”……你会

一张黑图就能蒸馏?VCSD让Qwen3-VL全系飙升4.77%
视觉与图像

一张黑图就能蒸馏?VCSD让Qwen3-VL全系飙升4.77%

自蒸馏方法通常需要特权答案或视觉证据标注来制造教师-学生不对称性,而本论文来自马里兰大学等机构,提出一个极其简洁的替代方案:只需要一张内容擦除的黑色图像,与原始图像下教师模型的预测做对比,就能构建出有效的自蒸馏目标。在Qwen3-VL和Qwen3.5全系模型上,VCSD稳定提升1.86%-4.77%,且无需外部教师、推理时零开销。方法既巧妙又实用,值得关注。

LONGGE AI COMMUNITY

把每天读到的论文,变成长期积累

加入「龙哥读论文」知识星球,持续获取 AI 论文、资讯、开源项目、招聘与研究思路。

加入龙哥读论文微信群:添加微信 kangjinlonghelper,备注“研究方向 + 地点 + 学校/公司 + 昵称”。

龙哥读论文知识星球二维码 微信扫码加入知识星球