LONGGE AI RESEARCH DAILY

龙哥读论文

每天筛选值得关注的 AI 论文,用工程视角拆解方法、实验和真正的落地价值。

目前已发表 1573 篇文章

PaperDaily 数据库收录 论文拆解 12820 研究思路 385 AI 资讯 208 开源项目 164 科研招聘 128 学习资料 8 热点主题 493 论文成功模式 1625

标签:视频生成

共 73 篇
生成AI老“画”不对?浙大新方法GAZER:让自回归模型在生成中“自纠错”,无需重新训练!
视觉与图像

生成AI老“画”不对?浙大新方法GAZER:让自回归模型在生成中“自纠错”,无需重新训练!

生成AI经常“画不对题”?这可能是顶尖模型也无法避免的“语法错误”。浙大联合山大的GAZER,不走寻常路,它不重训模型,而是在生成过程中,让模型自己扮演“质检员”,通过多模态大模型“复盘”草稿,发现错误后“回炉重造”,简单一招就让图像和视频生成的语义对齐效果显著提升。同类工作中,GAZER切中了核心痛点,非常值得一看!

中国电信&西安交大最新SOTA!InteractiveAvatar:实时流式生成,视频头像也能听懂你的话
视觉与图像

中国电信&西安交大最新SOTA!InteractiveAvatar:实时流式生成,视频头像也能听懂你的话

能让数字人听懂你说话的“套路”来了!InteractiveAvatar不仅能把语音转成视频,还能理解“看一下手表几点了”这种复杂意图,并做出相应动作。在长达数分钟的无限流式生成中,画面一致性还吊打一众对手,实时推理速度更是达到26.68 FPS。

Netflix最新研究Vera:分层视频编辑,内容保真度狂甩VACE几条街!
视觉与图像

Netflix最新研究Vera:分层视频编辑,内容保真度狂甩VACE几条街!

还在苦恼给视频换个背景,主角的头发丝却“糊”了?传统方法“重绘全图”的做法就像把整面墙重刷一遍,难免会蹭到不该动的地方。Netflix联手Caltech最新力作Vera,直接给出“分层”方案——要改的部分单独画在一个“透明图层”上,再盖回原视频,从源头杜绝了“改哪坏哪”的尴尬。PSNR狂甩VACE 7dB,效果真的有点东西。

告别VAE解码瓶颈!让生成器自己当评委,视频对齐又快又准
视觉与图像

告别VAE解码瓶颈!让生成器自己当评委,视频对齐又快又准

继2026年6月推过AVDM2、DenseDPO等视频生成加速和对齐方法后,今天这篇城大新作PRISM,直接把视频生成模型本身变成了最懂行且最快速的“评委”。以往用大视觉语言模型当裁判,又慢又贵,还得等视频全生成完。PRISM反其道而行之,冻结生成模型,在满是噪声的潜伏空间里就能精准打分,还能在生成早期就淘汰烂片,推理提速7.6倍。这波操作,值得所有做视频生

视频修复新范式:GPVAE自带置信度,医生再也不用猜哪帧靠谱
视觉与图像

视频修复新范式:GPVAE自带置信度,医生再也不用猜哪帧靠谱

内窥镜视频常被反光、丢帧搞得“面目全非”,传统方法却“各扫门前雪”,忽略了帧之间的连续关系。2026年6月,安特卫普大学等机构联合提出GPVAE框架,给潜变量加上高斯过程这个“时间绳”,让模型学会用前后帧“脑补”受损画面。最终C3VDv2上误差最高降26%,更关键的是,它每帧还自带“可信度”标签,为临床决策提供额外保险。

LONGGE AI COMMUNITY

把每天读到的论文,变成长期积累

加入「龙哥读论文」知识星球,持续获取 AI 论文、资讯、开源项目、招聘与研究思路。

加入龙哥读论文微信群:添加微信 kangjinlonghelper,备注“研究方向 + 地点 + 学校/公司 + 昵称”。

龙哥读论文知识星球二维码 微信扫码加入知识星球