LONGGE AI RESEARCH DAILY

龙哥读论文

每天筛选值得关注的 AI 论文,用工程视角拆解方法、实验和真正的落地价值。

目前已发表 1573 篇文章

PaperDaily 数据库收录 论文拆解 12820 研究思路 385 AI 资讯 208 开源项目 164 科研招聘 128 学习资料 8 热点主题 493 论文成功模式 1625

标签:数据集

共 112 篇
7,147条样本实测:融合模型比单模态更稳
视觉与图像

7,147条样本实测:融合模型比单模态更稳

点击诱饵这事,最阴的地方不是“标题党”,而是标题和缩略图一起演戏。BanClickThumb把孟加拉语 YouTube 的这套“组合拳”做成了可复现基准,文本、图像、融合三条线一起比,结果很清楚:只看图不够,只看字也不稳,融合才更像正经干活。

上海AI实验室等开源视频深度估计新模型!从游戏里抓出6M帧合成数据,效果效果优于所有生成式方法
视觉与图像

上海AI实验室等开源视频深度估计新模型!从游戏里抓出6M帧合成数据,效果效果优于所有生成式方法

如果有一项技术能从你的手机视频中提取出世界的3D结构,像人眼一样感知景深,你会用它做什么?上海AI实验室联合浙大、悉尼大学,最近放了一个大招:Depth Any Video。这个模型直接在Stable Video Diffusion上「开刀」,并靠着从游戏世界收集来的600万帧高质量深度数据,实现了视频深度估计的时空一致性全面飞跃。效果拉满,看了演示gif保

上海AI Lab最新研究:给视频做深度估计,零成本“打游戏”就搞定了?
视觉与图像

上海AI Lab最新研究:给视频做深度估计,零成本“打游戏”就搞定了?

视频深度估计一直卡在“没数据”上。这篇来自上海AI Lab、浙大和悉大的论文,直接去游戏里“白嫖”了4万段高精度视频深度数据,再把手里的视频生成扩散模型改成深度估计模型,3步去噪就出结果,跑得比谁都快。效果直接起飞,把之前所有生成式深度模型都甩在身后。

LONGGE AI COMMUNITY

把每天读到的论文,变成长期积累

加入「龙哥读论文」知识星球,持续获取 AI 论文、资讯、开源项目、招聘与研究思路。

加入龙哥读论文微信群:添加微信 kangjinlonghelper,备注“研究方向 + 地点 + 学校/公司 + 昵称”。

龙哥读论文知识星球二维码 微信扫码加入知识星球