真实模糊场景里,JADE-GS为何更稳?
高速运动把图像“拍糊”这件事,常见到让人麻木,但真要把它从3D重建里彻底修好,难点就来了。JADE-GS的思路很直接:让事件相机补时间信息,再让3D几何反过来约束2D去模糊,效果和效率都比单向流水线更像样。
LONGGE AI RESEARCH DAILY
每天筛选值得关注的 AI 论文,用工程视角拆解方法、实验和真正的落地价值。
目前已发表 1665 篇文章
高速运动把图像“拍糊”这件事,常见到让人麻木,但真要把它从3D重建里彻底修好,难点就来了。JADE-GS的思路很直接:让事件相机补时间信息,再让3D几何反过来约束2D去模糊,效果和效率都比单向流水线更像样。
单像素光谱成像最怕“拍得慢还拍不准”。这篇论文的思路很直接:先拍一点点,再让模型决定后面该拍哪些 Hadamard 模式,结果在仿真和近红外实拍里都比固定排序更稳。
如果有一项技术能从你的手机视频中提取出世界的3D结构,像人眼一样感知景深,你会用它做什么?上海AI实验室联合浙大、悉尼大学,最近放了一个大招:Depth Any Video。这个模型直接在Stable Video Diffusion上「开刀」,并靠着从游戏世界收集来的600万帧高质量深度数据,实现了视频深度估计的时空一致性全面飞跃。效果拉满,看了演示gif保
视频深度估计一直卡在“没数据”上。这篇来自上海AI Lab、浙大和悉大的论文,直接去游戏里“白嫖”了4万段高精度视频深度数据,再把手里的视频生成扩散模型改成深度估计模型,3步去噪就出结果,跑得比谁都快。效果直接起飞,把之前所有生成式深度模型都甩在身后。
这篇论文最有意思的地方,不是“删掉了什么”,而是“删掉之后还能不能把视频保住”。SIRUS把遗忘、保真、质量、鲁棒性和效率拆开测,终于不再让概念擦除只靠一张嘴说服人。
阿里这次没玩虚的,直接把文档解析从“流水线拼装”拉到“端到端一把梭”。0.8B 小模型能在公开榜单上登顶,关键不在嘴上说模型小,而在数据引擎和训练 recipe 真把小模型喂明白了。
这篇论文最有意思的地方,不是又造了一个波束成形器,而是把“选参数”这件事倒过来了:不先盯输入信号,而是先看输出好不好,再决定用哪个候选方案。对低信噪比和麦克风统计失真的场景,这个思路很实在。
机器人策略最烦的不是“不会动”,而是“记不住”。这篇把测试时训练塞进机器人基础模型里,直接把上下文拉到8K步,还顺手做出单次视频模仿和在线改进,思路很硬。
这篇论文把“自动驾驶需要传什么”这件事说得很直白:别再傻乎乎传整张图了,直接传任务相关语义。更有意思的是,它不是只做压缩,还把重建和分类一起训练,顺手把卫星链路下的低信噪比问题也一起收拾了。
视频模型最尴尬的地方,不是不会画,而是会画却不会“想”。HDR把这个矛盾掰开了:先粗后细地推理,再保持流式低延迟输出,六个多步任务上把成功率从34.22拉到60.29,确实有点东西。
医学图像分割最烦的不是分不清边界,而是模型一出院门就“水土不服”。CRISP不靠目标域数据、不改测试时参数,直接用排名稳定性把不确定边界一层层挤出来,思路干净,临床味很浓。
这篇论文最狠的地方,不是把代码模型调高了几个点,而是它几乎没加任何“外挂”:不要验证器,不要教师模型,不要强化学习,只靠模型自己的原始输出就能涨分。更有意思的是,提升还主要落在更难题上,说明它不是在“刷题套路”,而是在改模型分布本身。
LONGGE AI COMMUNITY
加入「龙哥读论文」知识星球,持续获取 AI 论文、资讯、开源项目、招聘与研究思路。
加入龙哥读论文微信群:添加微信 kangjinlonghelper,备注“研究方向 + 地点 + 学校/公司 + 昵称”。
微信扫码加入知识星球