LONGGE AI RESEARCH DAILY

龙哥读论文

每天筛选值得关注的 AI 论文,用工程视角拆解方法、实验和真正的落地价值。

目前已发表 1573 篇文章

PaperDaily 数据库收录 论文拆解 12851 研究思路 385 AI 资讯 208 开源项目 164 科研招聘 128 学习资料 8 热点主题 493 论文成功模式 1625

标签:多模态

共 200 篇
生成AI老“画”不对?浙大新方法GAZER:让自回归模型在生成中“自纠错”,无需重新训练!
视觉与图像

生成AI老“画”不对?浙大新方法GAZER:让自回归模型在生成中“自纠错”,无需重新训练!

生成AI经常“画不对题”?这可能是顶尖模型也无法避免的“语法错误”。浙大联合山大的GAZER,不走寻常路,它不重训模型,而是在生成过程中,让模型自己扮演“质检员”,通过多模态大模型“复盘”草稿,发现错误后“回炉重造”,简单一招就让图像和视频生成的语义对齐效果显著提升。同类工作中,GAZER切中了核心痛点,非常值得一看!

中国电信&西安交大最新SOTA!InteractiveAvatar:实时流式生成,视频头像也能听懂你的话
视觉与图像

中国电信&西安交大最新SOTA!InteractiveAvatar:实时流式生成,视频头像也能听懂你的话

能让数字人听懂你说话的“套路”来了!InteractiveAvatar不仅能把语音转成视频,还能理解“看一下手表几点了”这种复杂意图,并做出相应动作。在长达数分钟的无限流式生成中,画面一致性还吊打一众对手,实时推理速度更是达到26.68 FPS。

Meta最新研究:一张照片就能生成4D人-物交互动画,效果效果优于单令牌方法!
视觉与图像

Meta最新研究:一张照片就能生成4D人-物交互动画,效果效果优于单令牌方法!

只需一张图片,就能精准控制4D人-物交互动画中的姿态、接触、布局细节。Meta联合马普所、阿姆斯特丹大学等机构提出的IMAGIN-4D,用“空间-时间”双重解耦的图像条件化策略,把生成图像遵循度指标直接砍半。同类工作做视频生成,它做4D交互,效果惊艳。

中山大学最新研究:让自动驾驶先“脑补”未来,再“反思”轨迹,4B模型SOTA效果亮眼8B
视觉与图像

中山大学最新研究:让自动驾驶先“脑补”未来,再“反思”轨迹,4B模型SOTA效果亮眼8B

大多数自动驾驶模型都是“一条路走到黑”,直接生成轨迹,却不知道这轨迹未来会导出什么结果。中山大学等机构提出的IRR-Drive模型,让智能体先“预设意图”,再通过预测未来BEV可视化地“反思”一遍,最后才修正轨迹。这种做法在NAVSIM v1/v2两个权威榜单上都拿到SOTA,而且仅用4B参数就能干翻不少8B模型,性价比拉满。

越南AI挑战赛夺魁!Vortex多模态视频检索系统,单模型搞定4大任务,90.5%准确率!
视觉与图像

越南AI挑战赛夺魁!Vortex多模态视频检索系统,单模型搞定4大任务,90.5%准确率!

想找一个能同时理解文本、图像、语音,还能进行时序推理和交互反馈的视频检索系统?Vortex做到了。它在一个统一的框架内,巧妙融合了最新的视觉语言模型和经典的检索算法,并在激烈的AI大赛中取得了90.5%的惊人成绩。这不仅仅是技术堆叠,更是一场工程与算法的完美交响。

LONGGE AI COMMUNITY

把每天读到的论文,变成长期积累

加入「龙哥读论文」知识星球,持续获取 AI 论文、资讯、开源项目、招聘与研究思路。

加入龙哥读论文微信群:添加微信 kangjinlonghelper,备注“研究方向 + 地点 + 学校/公司 + 昵称”。

龙哥读论文知识星球二维码 微信扫码加入知识星球